スポンサーリンク

問題番号: No.784 (しっかりモード)

大規模言語モデル(LLM)の事前学習を終えた直後の状態では、単に次の単語の出現確率を予測する能力しか持たないため、ユーザーの質問に対して適切に答える「指示への追従」や、倫理的に有害な表現を避ける「安全性の担保」が不十分である。これを改善するため、複数の回答案に対する人間の評価(好みのランキング)を基に報酬モデルを学習させ、その報酬を最大化するように強化学習を用いてLLMの方策を最適化する手法はどれか。

スポンサーリンク