スポンサーリンク

問題番号: No.39 (しっかりモード)

強化学習(Q学習)において、環境から得られる状態(入力情報)のパターンが膨大、あるいは連続値である場合(例:ゲーム画面の映像そのもの)、従来のQテーブルのようにすべての状態と行動の組み合わせを表に記録して学習を進める手法では、メモリと計算量が爆発して実用的に破綻する。この課題を解決するため、状態価値の近似にディープラーニング(CNN)を組み込み、ゲーム画面のピクセル入力のみから最適な操作を自律学習できるようにした手法はどれか。

スポンサーリンク