問題 No.866
大規模言語モデルの出力を、人間の意図や倫理観、社会的な好ましさに適合させるために用いられる、人間のフィードバックによる強化学習のプロセスや目的として不適切なものはどれか。
【正解の解説】
モデルに全く新しい専門知識や数理的な計算アルゴリズムそのものをゼロから完全に記憶させるための唯一の事前学習アプローチである
この手法は「人間の好みに合わせる」ための調整プロセスであり、知識をゼロから記憶させる「事前学習」そのものではありません。
スポンサーリンク
【その他の選択肢の解説】
モデルが生成した複数の回答に対して人間が品質や好ましさの順位をつけ、それを基に報酬モデルを学習させる
人間のフィードバックによる強化学習(RLHF)では、人間がモデルの回答を評価し、どれが好ましいか順位付けを行うことで「報酬モデル」を作成します。
学習された報酬モデルを用いて、大規模言語モデルがより人間にとって望ましい回答を出力するように強化学習の手法でチューニングする
作成された報酬モデルのスコアを高くするように、大規模言語モデルを強化学習で微調整(チューニング)していきます。
差別的な表現や有害な情報の出力を抑制し、モデルの安全性や信頼性を高めるためのアライメント技術として機能する
RLHFは、人間にとって有害な回答を避け、誠実で役立つ回答をするようにAIを調整するアライメント(整合性)技術として不可欠です。