スポンサーリンク

問題番号: No.658 (しっかりモード)

ディープラーニングと強化学習を組み合わせた手法によりゲームAIが人間のスコアを上回る成果を上げた。行動価値関数の近似にニューラルネットワークを用い過去の経験を蓄積してランダムにサンプリングすることで学習を安定化させる手法はどれか。

スポンサーリンク