問題 No.1059
人間のフィードバックからの強化学習に関する説明として、最も不適切なものを1つ選べ。
【正解の解説】
人間の指示を一切介さずモデル同士の対話のみで倫理的な問題行動を完全に修正する手法である。
RLHFは、AIが学習した内容に対して「これは人間が好む回答か?」というフィードバックを人間が与えることで、倫理性を向上させる手法です。
スポンサーリンク
【その他の選択肢の解説】
大規模言語モデルの出力を人間の好みに整合させるための重要な技術である。
RLHF(人間のフィードバックからの強化学習)は、AIの回答を人間の好みに近づけ、より安全で自然な応答を実現するために欠かせない技術です。
人間の評価データを基に報酬モデルを訓練し、その報酬を最大化するようにモデルを最適化する。
人間がAIの回答をランク付けし、その評価を学習した報酬モデルを作ることで、AIが人間にとってより良い回答を選ぶように育てます。
報酬モデルの予測と実際の出力の乖離が大きくなりすぎないようペナルティを課すことが多い。
報酬モデルに過度に最適化するとAIが不自然な回答をしやすくなるため、学習前のモデルと極端に乖離しないよう調整(ペナルティ)をかけるのが一般的です。