問題 No.152
通常の強化学習では、開発者が事前に「報酬関数」を厳格に設計する必要があるが、自動運転の滑らかなハンドル操作や熟練の職人技など、複雑なタスクでは何に対してどれだけの報酬を与えるべきかの設計が極めて難しい。これに対し、人間のエキスパート(熟練者)の実際の行動データ(デモンストレーション)をAIに見せることで、その背後にある「報酬関数そのもの」をデータから逆算して推定・学習させるアプローチを何というか。
【正解の解説】
逆強化学習
逆強化学習とは、熟練者の行動を見て「この行動にはこれくらいの報酬があったはずだ」と逆算して、報酬のルールそのものをAIに学ばせる手法です。
スポンサーリンク
【その他の選択肢の解説】
マルチエージェント強化学習
マルチエージェント強化学習とは、複数のAIが同時にお互いに影響し合いながら学習する手法のことです。
模倣学習
模倣学習とは、熟練者の動きをそのまま真似るように学習する手法ですが、報酬関数を推定するプロセスとは少し焦点が異なります。
転移強化学習
転移強化学習とは、ある環境で学んだ強化学習の成果を、別の環境へ応用する手法のことです。