スポンサーリンク

問題番号: No.435 (しっかりモード)

Q学習にディープラーニングを組み合わせ、エージェントが画面の画素データから直接、最適な行動(行動価値関数)を推定して学習する強化学習手法はどれか。

スポンサーリンク