問題 No.630
文章生成や機械翻訳の前処理として単語をベクトル化する際学習データに存在しない未知の単語が入力されると適切なベクトルを割り当てられず精度が低下する課題がある。単語をさらに細かい文字の単位に分割して内部構造を学習することで未知の単語に対しても前後の文字の並びから柔軟に意味ベクトルを推測できる手法はどれか。
【正解の解説】
fastText
fastTextは、単語を「文字の並び」にまで分解して学習するため、見たことのない未知の単語でも前後の文字から意味を推測することが可能です。
スポンサーリンク
【その他の選択肢の解説】
TF-IDF
TF-IDFは、単語の重要度を計算する手法です。未知語に対応できるベクトル化手法ではありません。
Bag-of-Words
Bag-of-Wordsは、単語の出現回数のみを記録する手法であり、未知語には対応できず、意味関係も無視されます。
ELMo
ELMoは、文脈に応じた単語の表現を学習する手法ですが、文字単位の分解を主眼に未知語対応を最適化する手法とは異なります。