問題 No.639
新しい自然言語処理モデルを開発した際、そのモデルが単に特定のタスクに特化しているだけでなく、文章の分類、質問応答、論理的関係の判定など、多様なタスクにおいて汎用的な文章理解能力を持っているかを客観的に比較したい。このような目的で広く利用されている、複数の自然言語処理タスクをまとめた標準的なベンチマークデータセットの名称はどれか。
【正解の解説】
GLUE
GLUEは、文章分類や論理的関係の判定など、様々な自然言語処理のタスクをまとめたもので、モデルの総合的な賢さを測るための共通テストとして広く使われています。
スポンサーリンク
【その他の選択肢の解説】
SQuAD
SQuADは、人間が作成した質問と文章からなるデータセットで、モデルがどれだけ文章の内容を理解して回答できるかを測るためのテストです。
ILSVRC
ILSVRCは、画像認識技術の精度を競うための世界的なコンテストで、モデルがどれだけ正確に写真を分類できるかを判定する基準となっています。
BERT
BERTは、文章の文脈を双方向から深く読み取ることで、言葉の意味を非常に高い精度で理解できる、現在主流の自然言語処理モデルです。