通常の強化学習では、開発者が事前に「報酬関数」を厳格に設計する必要があるが、自動運転の滑らかなハンドル操作や熟練の職人技など、複雑なタスクでは何に対してどれだけの報酬を与えるべきかの設計が極めて難しい。これに対し、人間のエキスパート(熟練者)の実際の行動データ(デモンストレーション)をAIに見せることで、その背後にある「報酬関数そのもの」をデータから逆算して推定・学習させるアプローチを何というか。 トップへ戻る 次へ進む スポンサーリンク