問題 No.32
ディープラーニングにおいて、学習率が大きすぎると最適解を飛び越えて発散してしまい、小さすぎると局所解(ローカルミニマム)から抜け出せず学習が停滞する問題がある。過去の勾配の移動平均(慣性)を考慮する手法と、パラメータごとに学習率を自動調整する手法の双方のメリットを組み合わせ、現在の深層学習において最も標準的に広く用いられている最適化手法はどれか。
【正解の解説】
Adam
Adamは、慣性を利用して方向を定めつつ、個別の学習率調整も行うため、非常に効率的です。現在の深層学習で最も標準的な最適化手法として広く使われています。
スポンサーリンク
【その他の選択肢の解説】
Adagrad
Adagradは、過去の勾配の大きさに応じてパラメータごとに学習率を自動調整しますが、学習が進むと学習率がゼロに近づきすぎてしまう弱点があります。
SGD
SGD(確率的勾配降下法)は、基本的な最適化手法ですが、学習率の調整は手動で行う必要があり、現在の深層学習ではAdamなどが主流です。
AdaBoost
AdaBoostは、複数の弱いモデルを組み合わせて強いモデルを作る「アンサンブル学習」の手法であり、ディープラーニングの最適化手法とは異なります。