スポンサーリンク

問題番号: No.4 (しっかりモード)

強化学習モデルの構築において、方策を直接最適化する手法は行動のばらつき(分散)が大きくなり学習が不安定になりやすい。この問題を克服するため、「次に行うべき行動を決定する構造」と「その行動によって得られた状態の価値を厳しく評価し、軌道修正を促す構造」の2つを独立させて組み合わせ、効率的かつ安定して学習を進める枠組みはどれか

スポンサーリンク