問題 No.693
未知の環境に置かれたエージェントが、試行錯誤を通じて得られる報酬を最大化するように最適な行動ルールを獲得したい。環境の動きを完全に把握していなくても、ある状態で行った行動の価値を記録し、その価値の表を更新し続けることで学習を進める代表的な手法はどれか。
【正解の解説】
Q学習
Q学習は、ある状態で行う行動の価値(Q値)を表にして管理し、報酬を最大化するようにその表を少しずつ更新していく代表的な強化学習の手法です。
スポンサーリンク
【その他の選択肢の解説】
DQN
DQN(Deep Q-Network)は、Q学習に深層学習を組み合わせた手法で、状態が膨大でも扱えるようにしたものです。
マルコフ決定過程
マルコフ決定過程は、強化学習の基盤となる数学的な枠組みで、状態遷移や報酬のルールを定義するモデルです。
SARSA
SARSAは、次の行動を選択した上で価値を更新する、Q学習と似た強化学習の手法です。