問題 No.1228
強化学習において、「現在の状態と選択した行動のみによって次の状態と報酬が決定され、それ以前の過去の履歴には依存しない」という数理的な性質(確率論の性質)を前提とした、強化学習の環境を定式化するための数学的モデルはどれか。
【正解の解説】
マルコフ決定過程
マルコフ決定過程とは、次に起こる状態が直前の状態のみに依存し、過去の出来事には左右されないという性質(マルコフ性)を利用した、強化学習の基盤となる数学モデルです。
スポンサーリンク
【その他の選択肢の解説】
決定木
決定木とは、木のような分岐構造を用いてデータを分類したり予測したりする手法です。条件分岐の積み重ねで判断を視覚化できます。
隠れマルコフモデル
隠れマルコフモデルとは、観測できる情報から、直接は見えない状態の変化を予測するモデルです。音声認識などの時系列データ分析でよく使われます。
正規分布
正規分布とは、自然界で多く見られる「平均値付近にデータが集中し、端に行くほど少なくなる」という山型の分布のことです。統計学の基礎となる考え方です。