強化学習の手法であるDeep Q-Networkにおいて、ニューラルネットワークを用いた関数の学習を安定させるために導入された、過去の遷移データをメモリに蓄積し、そこからランダムにサンプリングしてミニバッチ学習を行う手法を何と呼ぶか。 トップへ戻る 次へ進む スポンサーリンク