問題 No.928
強化学習において「報酬の遅延」という課題が発生する理由は「【 】」である。
【正解の解説】
即時の行動が必ずしも即時の報酬に結びつかず、未来の成功に貢献するため
報酬の遅延とは、今行った作業がすぐには結果(報酬)として現れず、一連の手続きを終えた後に初めて成功か失敗かが分かる状態を指します。
スポンサーリンク
【その他の選択肢の解説】
エージェントがランダムに行動するため
エージェントがランダムに行動するのは「探索」であり、結果がすぐに分からないこととは直接の関係はありません。
環境が常に変化して予測が難しいから
環境の変化は強化学習の難しさの一つですが、報酬の遅延とは別の概念です。
計算に時間がかかりすぎてリアルタイムに応答できないから
報酬の遅延は、計算スピードの問題ではなく、ゲームや仕事のように「最後までやってみないと結果が分からない」という性質によるものです。