問題 No.1248
ディープラーニングのパラメータ最適化において、学習の初期段階ではAdamのように素早い収束を可能にしながら、学習の終盤にかけて学習率の範囲を徐々に制限していくことで、最終的にSGDのような高い汎化性能を持たせる手法はどれか。
【正解の解説】
AdaBound
AdaBoundは、学習初期はAdamのように学習率を適応的に変えて高速に学習し、終盤は学習率が一定の範囲に収まるように制限することで、最終的な収束性能を高める手法です。
スポンサーリンク
【その他の選択肢の解説】
Adagrad
Adagradは、過去の勾配の蓄積を使って学習率を調整する手法ですが、学習が進むにつれ学習率が極端に小さくなりすぎる傾向があります。
RMSprop
RMSpropは、Adagradの問題点を修正するために勾配の移動平均を使い、学習率の減衰を抑制する手法です。
AMSBound
AMSBoundは、AdaBoundと同様のコンセプトで、AMSGradの考え方をベースに収束性能を最適化した手法です。