スポンサーリンク

問題番号: No.3 (しっかりモード)

強化学習の初期段階において、エージェントが過去の経験から得た「現時点で最も報酬が高いとわかっている行動」ばかりを繰り返すと、より良い行動パターンを一生発見できなくなる危険性がある。この「探索と利用のトレードオフ」を解決するため、一定の確率で完全にランダムな行動を選択させることで未知の環境を開拓させる方策はどれか。

スポンサーリンク