スポンサーリンク

問題番号: No.206 (しっかりモード)

強化学習のアルゴリズムは、価値(Q値)をベースに計算する手法と、行動を決定する確率そのものを直接最適化する手法に大別できる。エージェントが特定の状態でどの行動をとるべきかという確率分布(方策)をニューラルネットワークで表現し、得られた総報酬が大きくなる方向へ方策のパラメータを微分の勾配を用いて直接更新していく手法を何というか。

スポンサーリンク