チェスや将棋のAI、自動運転の制御などで使われる機械学習の枠組みであり、事前に正解データを与えられるのではなく、エージェントが環境の中で行動を選択し、その結果として得られる「報酬(スコア)」を最大化するように試行錯誤を通じて学習する手法はどれか。 トップへ戻る 次へ進む スポンサーリンク