問題 No.1282
ディープラーニングにおいて、ネットワークの隠れ層を何十層にも深く積み重ねると、入力層に近いパラメータが全く更新されず学習が停滞する問題が発生しやすくなる。この問題を引き起こす最大の数理的要因として、最も適切なものはどれか。
【正解の解説】
シグモイド関数を用いた場合、その微分の最大値が1未満となるため、層を遡るごとに勾配が掛け合わされてゼロに近づくから。
シグモイド関数は入力を0〜1の間に圧縮しますが、その微分は最大で0.25です。これを層の数だけ掛け合わせると、値が急速にゼロに近づく勾配消失問題を引き起こします。
スポンサーリンク
【その他の選択肢の解説】
損失関数に重みの二乗和を加えることで、パラメータの絶対値が過剰に大きくなり数値が発散してしまうから。
これはL2正則化の考え方であり、過学習を防ぐための手法ですが、勾配消失の主因ではありません。
確率的勾配降下法において、ランダムに抽出されたデータ間の分散が大きすぎると、更新方向が互いに打ち消し合ってしまうから。
確率的勾配降下法における分散の問題は学習の安定性に影響しますが、層を深くした際の勾配消失の根本原因とは異なります。
プーリング層を通過するたびに特徴マップの解像度が低下し、入力画像の空間的な情報が完全に失われてしまうから。
プーリング層による解像度の低下は情報の抽象化には寄与しますが、直接的に勾配がゼロになる現象(勾配消失)の直接的な原因ではありません。