問題 No.1422
強化学習とディープラーニングを組み合わせた深層強化学習のうち、Q学習における行動価値関数をニューラルネットワークで近似した手法はどれか。学習の安定化のために、過去の経験を保存してランダムに取り出す「経験再生」と、目標値を計算するための「ターゲットネットワーク」という2つの重要な仕組みを取り入れている。
【正解の解説】
DQN
DQNは、Q学習に深層学習を取り入れた手法です。経験再生により過去の体験を効率的に学習し、ターゲットネットワークにより目標値を固定して学習を安定させています。
スポンサーリンク
【その他の選択肢の解説】
Q学習
Q学習は、ある状態でどのような行動をとるのが最適かを計算するための強化学習アルゴリズムで、行動価値関数(Q値)を更新していく手法です。
SARSA
SARSAは、現在の状態でとった行動の結果を見て、次の行動まで考慮しながら価値を更新する強化学習手法です。Q学習と比較して、より現実の行動に即した学習になります。
Actor-Critic
Actor-Criticは、行動を決める役割(Actor)と、その行動を評価する役割(Critic)という2つのモデルを協力させて学習する深層強化学習の一手法です。