問題 No.1319
機械学習モデルの開発において、訓練データの中に本来は予測時に利用できないはずの未来の情報やテストデータが誤って混入し、学習時の見かけの精度だけが異常に高くなってしまう致命的な現象はどれか。
【正解の解説】
データリーク
予測したい未来の情報などが誤って学習データに混入し、本来得られない情報を使って学習してしまう現象です。見かけの精度だけが高くなってしまいます。
スポンサーリンク
【その他の選択肢の解説】
データ拡張
元のデータを回転させたり切り抜いたりして水増しし、AIの汎用的な識別能力を高める手法です。
アノテーション
学習データに対して「これは猫」「これは犬」といった正解のラベルを人間が手作業で付ける工程のことです。
サブサンプリング
巨大なデータの中から一部を抽出して扱うことです。計算負荷を減らすなどの目的で使われます。