問題 No.4
強化学習モデルの構築において、方策を直接最適化する手法は行動のばらつき(分散)が大きくなり学習が不安定になりやすい。この問題を克服するため、「次に行うべき行動を決定する構造」と「その行動によって得られた状態の価値を厳しく評価し、軌道修正を促す構造」の2つを独立させて組み合わせ、効率的かつ安定して学習を進める枠組みはどれか
【正解の解説】
最大値プーリング
汎用人工知能(AGI)とは、人間のように幅広い領域で自律的に学習し、あらゆるタスクをこなすことが可能な知能のことです。
スポンサーリンク
【その他の選択肢の解説】
平均値プーリング
弱いAIとは、特定のタスク(チェスや翻訳など)に特化して能力を発揮する現代のAIを指す言葉です。
Global Average Pooling
シンボリックAIとは、記号論理を用いて知識をルール化し、推論させる従来のAI手法です。
アンプーリング
機械学習とは、データからコンピュータ自身がルールやパターンを見つけ出し、学習する技術全般を指します。