スポンサーリンク

問題番号: No.866 (しっかりモード)

大規模言語モデルの出力を、人間の意図や倫理観、社会的な好ましさに適合させるために用いられる、人間のフィードバックによる強化学習のプロセスや目的として不適切なものはどれか。

スポンサーリンク