問題 No.784
大規模言語モデル(LLM)の事前学習を終えた直後の状態では、単に次の単語の出現確率を予測する能力しか持たないため、ユーザーの質問に対して適切に答える「指示への追従」や、倫理的に有害な表現を避ける「安全性の担保」が不十分である。これを改善するため、複数の回答案に対する人間の評価(好みのランキング)を基に報酬モデルを学習させ、その報酬を最大化するように強化学習を用いてLLMの方策を最適化する手法はどれか。
【正解の解説】
RLHF
人間のフィードバックをもとに強化学習を行う手法です。AIが作った回答を人間が評価し、より望ましい回答を選ぶようAIを調整します。
スポンサーリンク
【その他の選択肢の解説】
コンテキスト内学習
モデルを再学習させずに、質問文の中にヒントや例を混ぜることで回答精度を高める手法です。
知識蒸留
巨大なAIモデルの知識を、より小さなモデルに教え込んで小型化する手法です。
データ拡張
データそのものを増やして学習を効率化する手法です。モデルの指示追従性の向上とは直接関係ありません。