新しい自然言語処理モデルを開発した際、そのモデルが単に特定のタスクに特化しているだけでなく、文章の分類、質問応答、論理的関係の判定など、多様なタスクにおいて汎用的な文章理解能力を持っているかを客観的に比較したい。このような目的で広く利用されている、複数の自然言語処理タスクをまとめた標準的なベンチマークデータセットの名称はどれか。 トップへ戻る 次へ進む スポンサーリンク