スポンサーリンク

問題の解答・解説ページ

このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!

この問題をクイズ形式で解く
問題 No.898
深層強化学習において、連続して取得したデータをそのまま学習に用いると時間的な相関が強すぎて学習が不安定になる。これを防ぐため、過去の行動履歴をメモリに保存し、ランダムに取り出して学習に用いる仕組みを【 】という。

【正解の解説】

経験再生

経験再生は、過去の失敗や成功の記録(経験)をメモリに保存しておき、それをランダムに引っ張り出して学習することで、記憶の偏りを防ぎ、安定して学習させる手法です。

スポンサーリンク

【その他の選択肢の解説】

報酬の遅延

報酬の遅延は、行動した直後ではなく、時間が経ってから報酬が得られる強化学習特有の難しさ(課題)を指します。

方策勾配法

方策勾配法は、AIがとるべき行動の「確率」を直接最適化していく手法です。経験再生という仕組みとは別の学習方針です。

ターゲットネットワーク

ターゲットネットワークは、学習の目標となる値を計算するためのネットワークを固定することで、計算を安定させるための工夫です。