スポンサーリンク

問題番号: No.693 (しっかりモード)

未知の環境に置かれたエージェントが、試行錯誤を通じて得られる報酬を最大化するように最適な行動ルールを獲得したい。環境の動きを完全に把握していなくても、ある状態で行った行動の価値を記録し、その価値の表を更新し続けることで学習を進める代表的な手法はどれか。

スポンサーリンク