問題 No.827
正解ラベルが付与されていない大量の顧客データがあり、購買傾向が似ているグループを自動的にいくつか発見したい場合。どのような手順で学習を進める手法を選択すべきか。
【正解の解説】
あらかじめいくつのグループに分けるかを決めランダムに配置した中心点と各データとの距離を計算して分類を繰り返す
k-means法と呼ばれ、あらかじめグループ数(k)を決め、中心点との距離で分類を行う、代表的なクラスタリング手法です。
スポンサーリンク
【その他の選択肢の解説】
データを空間上の点として配置し特定の境界線からのマージンが最大となるように分割する
これは境界線を引いてデータを分ける手法であり、教師なし学習のクラスタリングとは異なります。
データの特徴を維持したまま次元数を減らし可視化しやすい少数の主成分へと変換する
これは主成分分析(PCA)と呼ばれる次元圧縮手法であり、グループ分けを行うための手法ではありません。
複数の決定木を並列に構築しそれぞれの木が出力した分類結果の多数決をとって最終的なグループを決める
ランダムフォレストなどの手法であり、主に教師あり学習で予測や分類を行う際に用いられます。