問題 No.1093
強化学習において、現在の状況で最適な行動をとるか(利用)、未知の行動を試すか(探索)の選択を管理する手法の代表例は【 】である。
【正解の解説】
ε-greedy方策
ε-greedy方策は、強化学習において「過去に成功した行動を繰り返す(利用)」か「新しい可能性を探るために別の行動を試す(探索)」かを確率的に選ぶ仕組みで、初心者にはお店選びで「いつもの店に行くか、あえて新しい店を試すか」を決めるルーレットのようなものとイメージしてください。
スポンサーリンク
【その他の選択肢の解説】
誤差逆伝播法
誤差逆伝播法は、ニューラルネットワークが予測を外した際に、その答え合わせの結果を後ろから前へと遡って「どこが悪かったか」を伝える手法で、間違いを直すための反省のプロセスにあたります。
主成分分析
主成分分析は、多くのデータ項目をより少ない重要な指標にまとめ上げる手法で、複雑な情報を要約して全体像を見やすくするデータ整理術のようなものです。
転移学習
転移学習は、ある分野で学習した知識を別の分野の学習に活かす手法で、自転車に乗れる人がバイクの運転も早く覚えられるように、AIも経験を再利用して学習を効率化します。