強化学習の初期段階において、エージェントが過去の経験から得た現時点で最も報酬が高いとわかっている行動ばかりを繰り返すと、より良い行動パターンを一生発見できなくなる危険性がある。この探索と利用のトレードオフを解決するため、一定の確率でランダムな行動を選択し、残りの確率で現在の最適行動を選択する方策はどれか。 トップへ戻る 次へ進む スポンサーリンク