ディープラーニングにおいて、学習率が大きすぎると最適解を飛び越えて発散してしまい、小さすぎると局所解(ローカルミニマム)から抜け出せず学習が停滞する問題がある。過去の勾配の移動平均(慣性)を考慮する手法と、パラメータごとに学習率を自動調整する手法の双方のメリットを組み合わせ、現在の深層学習において最も標準的に広く用いられている最適化手法はどれか。 トップへ戻る 次へ進む スポンサーリンク