問題 No.370
深層ニューラルネットワークの過学習を抑えるための正則化手法について。学習時に中間層のニューロンを一定の確率でランダムに無効化しながらパラメータの更新を行う手法が、なぜ未知のデータに対しても高い予測精度を発揮できるのか。その理論的背景として最も適切なものはどれか。
【正解の解説】
毎回異なる構造のネットワークが擬似的に多数学習され、それらの結果を平均化するような効果が得られるため
ドロップアウトを行うと、毎回少しずつ異なるネットワークが学習されます。最終的にはこれらを平均化(統合)したような効果が生まれ、特定のニューロンに頼り切らない柔軟な予測が可能になります。
スポンサーリンク
【その他の選択肢の解説】
無効化されたニューロンのパラメータが完全に0に初期化され、特徴量選択が行われるため
ドロップアウトは特定のニューロンを消しますが、特徴量選択が直接の目的ではなく、学習中の依存関係を断ち切るのが目的です。
各層の入力データの分布が平均0および分散1に揃えられ、学習の進行が安定化するため
これはバッチ正規化の説明です。学習を安定させるための別の手法です。
誤差逆伝播法において勾配の最大値が制限され、パラメータの爆発的な増加を防ぐことができるため
誤差逆伝播における爆発を防ぐのはクリッピングなどの手法であり、ドロップアウトの主な目的ではありません。