問題 No.49
教師あり学習による分類モデルの構築では、事前に人間が膨大なデータに対して「正解ラベル(アノテーション)」を手作業で付与する必要があり、莫大なコストと時間がかかる課題がある。データの正解ラベルを一切使わず、データ同士の幾何学的な「距離(類似度)」のみに基づき、指定された個数のグループ(クラスタ)へ自動的にデータを割り当てる、最も代表的な教師なし学習アルゴリズムはどれか。
【正解の解説】
k-means法
k-means法は、指定された数のクラスタへデータを自動分類する手法です。データ同士の距離を基にグループ化するため、教師ラベルがないデータ分析で最も標準的に使われます。
スポンサーリンク
【その他の選択肢の解説】
主成分分析
主成分分析は、データの散らばりを維持したまま次元を圧縮する手法です。特徴量の整理には使われますが、データをグループ分けしてクラスタを作る手法ではありません。
サポートベクターマシン
サポートベクトルマシンは、境界線を引いてデータをクラス分けする教師あり学習手法です。正解データが必要であり、クラスタリングとは目的が異なります。
ランダムフォレスト
ランダムフォレストは、複数の決定木を組み合わせた教師あり学習手法です。分類や予測には強力ですが、正解ラベルを必要とするため教師なし学習ではありません。