問題 No.1227
チェスや将棋のAI、自動運転の制御などで使われる機械学習の枠組みであり、事前に正解データを与えられるのではなく、エージェントが環境の中で行動を選択し、その結果として得られる「報酬(スコア)」を最大化するように試行錯誤を通じて学習する手法はどれか。
【正解の解説】
強化学習
強化学習とは、AIが環境の中で試行錯誤を繰り返し、良い結果(報酬)を得るための行動ルールを自ら獲得していく手法です。失敗と成功を通じて成長していく学習法です。
スポンサーリンク
【その他の選択肢の解説】
教師あり学習
教師あり学習とは、問題とそれに対する正解のペアを学習データとして与え、その関係性をAIに学ばせる手法です。例えるなら、教科書と答えを見て勉強する学習法です。
教師なし学習
教師なし学習とは、正解データを与えず、データ内に潜む法則性やグループ分けをAI自らが発見する手法です。データの本質的な特徴を捉える際に用いられます。
半教師あり学習
半教師あり学習とは、少量の正解付きデータと大量の正解なしデータを組み合わせて学習する手法です。正解を用意するコストが高い場合に効率的に学習できる方法です。