スポンサーリンク

問題の解答・解説ページ

このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!

この問題をクイズ形式で解く
問題 No.1093
強化学習において、現在の状況で最適な行動をとるか(利用)、未知の行動を試すか(探索)の選択を管理する手法の代表例は【 】である。

【正解の解説】

ε-greedy方策

ε-greedy方策は、強化学習において「過去に成功した行動を繰り返す(利用)」か「新しい可能性を探るために別の行動を試す(探索)」かを確率的に選ぶ仕組みで、初心者にはお店選びで「いつもの店に行くか、あえて新しい店を試すか」を決めるルーレットのようなものとイメージしてください。

スポンサーリンク

【その他の選択肢の解説】

誤差逆伝播法

誤差逆伝播法は、ニューラルネットワークが予測を外した際に、その答え合わせの結果を後ろから前へと遡って「どこが悪かったか」を伝える手法で、間違いを直すための反省のプロセスにあたります。

主成分分析

主成分分析は、多くのデータ項目をより少ない重要な指標にまとめ上げる手法で、複雑な情報を要約して全体像を見やすくするデータ整理術のようなものです。

転移学習

転移学習は、ある分野で学習した知識を別の分野の学習に活かす手法で、自転車に乗れる人がバイクの運転も早く覚えられるように、AIも経験を再利用して学習を効率化します。