問題 No.27
企業が保有する何万件もの顧客アンケートのテキストデータから、手作業で分類することなく、そこに潜在している「接客への不満」「商品の質」「価格への要望」といった共通のトピック(話題)の構造を自動的に抽出・分類したい。各文書が、どのような潜在的な話題の確率分布から生成されているかを統計的に推定する、代表的な教師なし学習のトピックモデルはどれか。
【正解の解説】
LDA
LDAは、各文書が複数のトピック(話題)から構成されていると仮定し、それを確率的に推定する代表的なトピックモデルです。
スポンサーリンク
【その他の選択肢の解説】
Word2Vec
Word2Vecは、単語をベクトル化して意味的な近さを計算する手法です。文章の中からトピック(話題)を自動抽出するものではありません。
TF-IDF
TF-IDFは、文書中の単語の重要度を計算する統計的手法です。トピックモデルのように話題の確率分布を推定する機能は持っていません。
BERT
BERTは、文章の文脈を深く理解するための事前学習モデルです。トピックモデルそのものではなく、言語理解のための基盤技術です。