問題 No.643
深層強化学習において、エージェントが過去に経験した行動履歴をメモリからランダムに取り出して学習する仕組みを拡張したい。学習効率を極限まで高めるため、すべての履歴を均等に扱うのではなく、予測誤差が大きくAIにとって予想外だった重要な失敗や成功の経験ほど高い確率でサンプリングし、優先的に学習させる仕組みはどれか。
【正解の解説】
優先度付き経験再生
優先度付き経験再生は、すべての経験を平等に扱うのではなく、AIが大きく予測を外した重要な経験ほど頻繁に学習し直すことで、効率を高める仕組みです。
スポンサーリンク
【その他の選択肢の解説】
経験再生
経験再生は、過去の行動履歴をメモリに溜めておき、そこからランダムに取り出して学習することで、データの偏りを防ぐ基本技術です。
ドメインランダマイゼーション
ドメインランダマイゼーションは、シミュレーション環境で様々な条件をわざとランダムに変えることで、現実世界でも通用する強いAIを作る手法です。
Q学習
Q学習は、ある状態でどの行動をとれば将来的に一番多くの報酬が得られるか、その価値(Q値)を計算して学習する強化学習の手法です。