問題 No.440
強化学習において、Q関数を直接更新するのではなく、行動を決定するActorと状態価値を厳しく評価するCriticの2つの構造を独立させて学習を安定化させる手法はどれか。
【正解の解説】
Actor-Critic
行動を決める「役者」と、その行動を評価する「批評家」の2つを役割分担させることで、強化学習を安定して進める手法のことです。
スポンサーリンク
【その他の選択肢の解説】
Q学習
行動価値関数を直接更新することで、どの行動がどれだけ良い報酬を得られるかを学習するアルゴリズムのことです。
DQN
深層学習とQ学習を組み合わせた手法で、膨大な状態から最適な行動を判断できるようにしたものです。
SARSA
現在の状態と行動、そして次の状態と次の行動に基づいて学習を行う、強化学習における基本的な手法の一つです。