スポンサーリンク

問題番号: No.1422 (しっかりモード)

強化学習とディープラーニングを組み合わせた深層強化学習のうち、Q学習における行動価値関数をニューラルネットワークで近似した手法はどれか。学習の安定化のために、過去の経験を保存してランダムに取り出す「経験再生」と、目標値を計算するための「ターゲットネットワーク」という2つの重要な仕組みを取り入れている。

スポンサーリンク