強化学習において、「現在の状態と選択した行動のみによって次の状態と報酬が決定され、それ以前の過去の履歴には依存しない」という数理的な性質(確率論の性質)を前提とした、強化学習の環境を定式化するための数学的モデルはどれか。 トップへ戻る 次へ進む スポンサーリンク