スポンサーリンク

問題の解答・解説ページ

このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!

この問題をクイズ形式で解く
問題 No.975
強化学習において、ある状態から行動を選択する際、過去の経験を参考に確率的に行動を決定する手法として、探索と利用のバランスを調整する「ε-greedy法」のεの役割は何か。

【正解の解説】

ランダムに行動を選択する確率

ε(イプシロン)は、これまでに学習した「一番良い行動」を選ぶのではなく、あえて「ランダムに別の行動」を選んで新しい可能性を探索する確率を表しています。これにより、局所的な最適解に陥るのを防ぎます。

スポンサーリンク

【その他の選択肢の解説】

行動の報酬を計算する定数

εは行動の結果得られる報酬を計算するためのものではありません。

モデルの学習率

学習率とは、モデルがどれくらい一度に学習を進めるかという別の指標です。

環境の変化速度

環境の変化速度というよりも、AI自身が「どこまで探索するか」という戦略を決めるための設定値です。