問題 No.1031
従来の囲碁AIが人間のプロ棋士の膨大な対局データを事前学習に利用していたのに対し、囲碁のルールだけを与えられ、人間の知識を一切介在させずに自己対局のみを繰り返す強化学習によって世界最強の性能に到達したモデルを【 】という。
【正解の解説】
AlphaGo Zero
囲碁AI「AlphaGo」の進化版です。人間の棋譜データを使わず、ルールだけを学んで自分自身と何百万回も対戦することで、人間を凌駕する強さを身につけました。
スポンサーリンク
【その他の選択肢の解説】
AlphaStar
Google DeepMindが開発した、対戦ゲームである「StarCraft II」をプレイするAIです。プロゲーマーに匹敵する実力を持ちますが、囲碁専用のモデルではありません。
OpenAI Five
OpenAIが開発した、対戦ゲーム「Dota 2」で人間のプロチームに勝利したAIです。チームプレイを強化学習によって学習しました。
DQN
Deep Q-Networkの略称です。強化学習にディープラーニングを組み合わせた手法で、ビデオゲームなどを遊べるようになった、深層強化学習の先駆けとなる技術です。