スポンサーリンク

問題の解答・解説ページ

このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!

この問題をクイズ形式で解く
問題 No.1192
強化学習の初期段階において、エージェントが過去の経験から得た現時点で最も報酬が高いとわかっている行動ばかりを繰り返すと、より良い行動パターンを一生発見できなくなる危険性がある。この探索と利用のトレードオフを解決するため、一定の確率でランダムな行動を選択し、残りの確率で現在の最適行動を選択する方策はどれか。

【正解の解説】

ε-greedy方策

ε-greedy方策は、一定の確率(ε)で適当に動き(探索)、残りの確率で最高と判断したものを選ぶ(利用)という、探索と利用のバランスをとるシンプルで一般的な手法です。

スポンサーリンク

【その他の選択肢の解説】

UCB方策

UCB方策は、報酬の平均値だけでなく「まだ試していない」という不確実性(探索の価値)を考慮して選択する高度な手法です。

割引報酬和

割引報酬和は、将来得られる報酬を現在価値に換算して合計した値のことです。

ボルツマン方策

ボルツマン方策は、報酬が高い行動ほど高い確率で選ばれるように計算する確率的な手法です。