スポンサーリンク

問題の解答・解説ページ

このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!

この問題をクイズ形式で解く
問題 No.560
強化学習において、現在の行動に従って次の行動を決定する「方策オン型(On-policy)」の手法はどれか。

【正解の解説】

SARSA

SARSAは、自分が今とっている行動の通りに次に進むことを前提に学習するため、方策オン型(On-policy)の代表例です。

スポンサーリンク

【その他の選択肢の解説】

Q学習

Q学習は、今の状況で最も良い報酬が得られる行動を選択して学習するため、現在の行動方針とは別に最適解を目指す方策オフ型(Off-policy)の手法です。

Actor-Critic

Actor-Criticは、行動を選択する「Actor」とそれを評価する「Critic」という2つのネットワークを用い、学習を進める手法です。

モンテカルロ法

モンテカルロ法は、ランダムに試行を繰り返して、その結果得られた報酬の平均から価値を推定する方法です。