スポンサーリンク

問題の解答・解説ページ

このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!

この問題をクイズ形式で解く
問題 No.53
ニューラルネットワークを確率的勾配降下法(SGD)などの単純な手法で最適化する際、損失関数の形状が特定の方向にだけ急峻で、他の方向にはなだらかな谷(例えば「W」字のような形状)になっていると、パラメータの更新ベクトルが谷の壁の間を激しく往復(振動)してしまい、谷の底(最適解)へ向かう前進スピードが著しく低下する課題がある。この進行方向のブレ(振動)を抑制し、物理的な「慣性」のように前回の更新方向を一定割合で引き継ぐことで、最適解へ向けてスムーズに加速させるアプローチはどれか。

【正解の解説】

モーメンタム

Momentumは、物理の慣性のように、過去の更新方向の勢いを一定割合引き継ぐことで、振動を抑え、谷底へスムーズかつ加速しながら向かうことができる最適化手法です。

スポンサーリンク

【その他の選択肢の解説】

Adagrad

Adagradは、学習率をパラメータごとに自動調整しますが、過去の勾配の累積により学習率が急速に小さくなりすぎてしまう特性があり、慣性のような加速機能とは異なります。

RMSprop

RMSpropは、Adagradの学習率がゼロに近づく弱点を改良した手法で、過去の勾配を指数移動平均で計算しますが、物理的な慣性による加速を主目的とした手法ではありません。

Adam

Adamは、Momentumの慣性による加速機能と、RMSpropの学習率調整機能を組み合わせた非常に強力な手法ですが、設問にある「物理的な慣性のように加速させる」アプローチの根幹はMomentumにあります。