問題 No.560
強化学習において、現在の行動に従って次の行動を決定する「方策オン型(On-policy)」の手法はどれか。
【正解の解説】
SARSA
SARSAは、自分が今とっている行動の通りに次に進むことを前提に学習するため、方策オン型(On-policy)の代表例です。
スポンサーリンク
【その他の選択肢の解説】
Q学習
Q学習は、今の状況で最も良い報酬が得られる行動を選択して学習するため、現在の行動方針とは別に最適解を目指す方策オフ型(Off-policy)の手法です。
Actor-Critic
Actor-Criticは、行動を選択する「Actor」とそれを評価する「Critic」という2つのネットワークを用い、学習を進める手法です。
モンテカルロ法
モンテカルロ法は、ランダムに試行を繰り返して、その結果得られた報酬の平均から価値を推定する方法です。