問題 No.1303
強化学習の手法であるDeep Q-Networkにおいて、ニューラルネットワークを用いた関数の学習を安定させるために導入された、過去の遷移データをメモリに蓄積し、そこからランダムにサンプリングしてミニバッチ学習を行う手法を何と呼ぶか。
【正解の解説】
経験再生
過去の行動や結果の経験を日記のようにメモリに保存しておき、そこからランダムに取り出して何度も復習することで、学習効率を高める手法のことです。
スポンサーリンク
【その他の選択肢の解説】
ターゲットネットワーク
学習の基準となる目標値を計算するための、別のネットワークのことです。学習を安定させるために、メインのネットワークとは少し遅れて更新されます。
報酬割引き
遠い未来に得られる報酬を、現在価値に換算して割り引いて計算することです。将来の報酬よりも、目先の報酬を優先するための考え方です。
方策勾配法
試行錯誤のプロセスを直接最適化する手法です。価値関数を介さず、どのような行動をとるべきかという「方策」を直接学習します。