問題 No.975
強化学習において、ある状態から行動を選択する際、過去の経験を参考に確率的に行動を決定する手法として、探索と利用のバランスを調整する「ε-greedy法」のεの役割は何か。
【正解の解説】
ランダムに行動を選択する確率
ε(イプシロン)は、これまでに学習した「一番良い行動」を選ぶのではなく、あえて「ランダムに別の行動」を選んで新しい可能性を探索する確率を表しています。これにより、局所的な最適解に陥るのを防ぎます。
スポンサーリンク
【その他の選択肢の解説】
行動の報酬を計算する定数
εは行動の結果得られる報酬を計算するためのものではありません。
モデルの学習率
学習率とは、モデルがどれくらい一度に学習を進めるかという別の指標です。
環境の変化速度
環境の変化速度というよりも、AI自身が「どこまで探索するか」という戦略を決めるための設定値です。