問題 No.108
機械学習モデルの訓練において、モデルの表現力(パラメータの数)に対して、用意した訓練データの数が圧倒的に少なすぎる場合に発生しやすい問題がある。モデルが訓練データに含まれる特有のノイズや細部にまで過剰に適合してしまい、テストデータや未知のデータに対する予測精度が著しく低下する現象を何というか。
【正解の解説】
オーバーフィッティング
モデルが訓練データに含まれるノイズ(誤差)や細かな特徴まで覚えすぎてしまい、初めて見るデータに正しく対応できなくなる現象です。
スポンサーリンク
【その他の選択肢の解説】
アンダーフィッティング
モデルの表現力が訓練データに対して低すぎて、全体像をうまく捉えきれず、学習不足の状態になることを指します。
次元の呪い
データの特徴(次元)が多すぎることで、必要なデータ量が爆発的に増え、学習が極めて困難になる数学的な難しさのことです。
データドリフト
時間が経過して現実世界のデータ分布が変化し、学習時と状況が変わることでモデルの予測精度が下がってしまう現象です。