スポンサーリンク

問題の解答・解説ページ

このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!

この問題をクイズ形式で解く
問題 No.1195
ニューラルネットワークのパラメータ最適化において、傾斜の方向へスムーズに進むための慣性を考慮するアプローチと、過去の勾配の大きさに応じてパラメータごとに自動で学習率を調整するアプローチの両方のメリットを融合させ、現代のディープラーニングにおいて最も主流として使われている最適化手法はどれか。

【正解の解説】

Adam

Adamは、慣性を考慮する手法(モーメンタム)と、パラメータごとに学習率を自動調整する手法(RMSpropに近い考え方)の両方の良いとこ取りをした最適化手法です。効率的かつ安定して学習が進むため、現代のディープラーニングでは最も標準的に使われています。

スポンサーリンク

【その他の選択肢の解説】

確率的勾配降下法(SGD)

確率的勾配降下法(SGD)は、データの一部だけを使って少しずつパラメータを更新する基本手法です。坂道を下る際に一歩ずつ着実に進むようなイメージですが、慣性がないため、平坦な場所で止まってしまいやすいという特徴があります。

Adagrad

Adagradは、過去の勾配の大きさを記録し、頻繁に変化するパラメータは学習率を小さく、あまり変化しないパラメータは大きく調整する手法です。各パラメータに合わせた学習が可能ですが、学習が進むと学習率がどんどん小さくなりすぎて途中で止まってしまう欠点があります。

RMSprop

RMSpropは、Adagradの弱点である学習率の減少を改善した手法です。過去の勾配の履歴をうまく減衰させて計算することで、学習の後半でも適切な学習率を維持し、安定した学習を可能にします。