問題 No.649
機械学習モデルの汎化性能を適切に評価するためのデータ分割手法について不適切な説明をしているものはどれか。
【正解の解説】
学習データの精度が十分に高ければ未知のデータに対しても高い精度が保証されるため検証データの分割は不要である
学習データだけで精度を上げると、そのデータだけに特化しすぎてしまい、初めて見るデータに対応できなくなる「過学習」が起きるため、検証データの分割は必須です。
スポンサーリンク
【その他の選択肢の解説】
ホールドアウトはデータを学習用とテスト用に分割する簡便な手法である
データを「学習用」と「テスト用」に分ける、最も基本的な手法です。シンプルで分かりやすいですが、データの分割方法によって精度がぶれる可能性があります。
k-分割交差検証はデータをK個に分けテストデータの役割を交替させながら学習と評価を繰り返す
データをK個のグループに分け、1つをテスト、残りを学習用として回す手法です。全てのデータが一度はテスト用に使われるため、データの活用効率が高いです。
リーブワンアウト交差検証はデータ数が少ない場合に一つだけをテストデータとして扱う手法である
データを一つずつ取り出してテストデータにする手法です。データ量が少ない場合でも、ほぼ全てのデータを学習に回せるため、無駄がありません。