スポンサーリンク

問題の解答・解説ページ

このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!

この問題をクイズ形式で解く
問題 No.435
Q学習にディープラーニングを組み合わせ、エージェントが画面の画素データから直接、最適な行動(行動価値関数)を推定して学習する強化学習手法はどれか。

【正解の解説】

DQN

深層Q学習(DQN)。Q学習という行動の評価手法と、画像認識を得意とするCNNを組み合わせることで、ゲーム画面のような複雑な情報から直接行動を学習できるようにしたものです。

スポンサーリンク

【その他の選択肢の解説】

AlphaZero

AlphaZero。囲碁や将棋などで驚異的な強さを見せる、モンテカルロ木探索と深層学習を組み合わせた高度な強化学習システムです。

Actor-Critic

Actor-Critic。行動を選択する役と、その行動を評価する役の2つが連携することで学習を安定させる手法です。

BERT

BERT。文章の意味を理解するための自然言語処理モデルであり、強化学習の手法ではありません。