スポンサーリンク

問題の解答・解説ページ

このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!

この問題をクイズ形式で解く
問題 No.440
強化学習において、Q関数を直接更新するのではなく、行動を決定するActorと状態価値を厳しく評価するCriticの2つの構造を独立させて学習を安定化させる手法はどれか。

【正解の解説】

Actor-Critic

行動を決める「役者」と、その行動を評価する「批評家」の2つを役割分担させることで、強化学習を安定して進める手法のことです。

スポンサーリンク

【その他の選択肢の解説】

Q学習

行動価値関数を直接更新することで、どの行動がどれだけ良い報酬を得られるかを学習するアルゴリズムのことです。

DQN

深層学習とQ学習を組み合わせた手法で、膨大な状態から最適な行動を判断できるようにしたものです。

SARSA

現在の状態と行動、そして次の状態と次の行動に基づいて学習を行う、強化学習における基本的な手法の一つです。