深層強化学習において、エージェントが過去に経験した行動履歴をメモリからランダムに取り出して学習する仕組みを拡張したい。学習効率を極限まで高めるため、すべての履歴を均等に扱うのではなく、予測誤差が大きくAIにとって予想外だった重要な失敗や成功の経験ほど高い確率でサンプリングし、優先的に学習させる仕組みはどれか。 トップへ戻る 次へ進む スポンサーリンク