問題 No.1143
アンサンブル学習の一つであるランダムフォレストは、複数の決定木を構築し、それらの予測結果を用いて最終的な予測を行う手法である。このランダムフォレストの特徴や適用場面に関する記述として、最も不適切なものはどれか。
【正解の解説】
前の決定木が誤分類したデータを次の決定木が重点的に学習するように重みを更新していくため、逐次的な学習プロセスが必要となる。
これはブースティング(例:AdaBoost)の特徴です。ランダムフォレストは、複数の木を個別に作って最後にまとめるため、同時並行で学習できます。
スポンサーリンク
【その他の選択肢の解説】
各決定木を構築する際、学習データから重複を許してランダムに抽出したデータセットを用いることでモデルの多様性を確保している。
ランダムフォレストは、学習データをランダムに選び直して複数の決定木を作り、多様な視点を持たせることで精度を高めます。
ノードの分割条件を決定する際、すべての特徴量から最適なものを選ぶのではなく、ランダムに抽出された一部の特徴量の中から最適なものを選ぶ。
各ノードの判断に使う特徴量をランダムに絞ることで、個々の木の個性が強まり、全体として精度が安定します。
個々の決定木が過学習しやすいという弱点を、複数の木の結果を平均化または多数決することで補い、汎化性能を高めている。
個別の木は一つ一つだと不安定(過学習しやすい)ですが、それらをたくさん集めて多数決をとることで、予測の正確さと安定性を高めています。