ディープラーニングのパラメータ最適化において、学習の初期段階ではAdamのように素早い収束を可能にしながら、学習の終盤にかけて学習率の範囲を徐々に制限していくことで、最終的にSGDのような高い汎化性能を持たせる手法はどれか。 トップへ戻る 次へ進む スポンサーリンク