大規模言語モデルの出力を、人間の意図や倫理観、社会的な好ましさに適合させるために用いられる、人間のフィードバックによる強化学習のプロセスや目的として不適切なものはどれか。 トップへ戻る 次へ進む スポンサーリンク