スポンサーリンク

問題番号: No.440 (しっかりモード)

強化学習において、Q関数を直接更新するのではなく、行動を決定するActorと状態価値を厳しく評価するCriticの2つの構造を独立させて学習を安定化させる手法はどれか。

スポンサーリンク