問題 No.1272
機械学習モデルの開発プロジェクトにおいて、予測精度を不当に高く見せかけてしまうデータリークが発生する典型的な原因として、最も適切なものはどれか。
【正解の解説】
データの前処理を行う際、データを学習用とテスト用に分割する前に、データセット全体を使って欠損値の平均値補完や正規化の計算を行ってしまった。
テストデータが含まれる全体データで平均値補完を行うと、テストデータの情報が学習に漏れ出し、精度の過大評価につながります。
スポンサーリンク
【その他の選択肢の解説】
モデルのハイパーパラメータを調整する際、グリッドサーチを用いて考えられるすべての組み合わせを網羅的に計算してしまった。
ハイパーパラメータの調整自体は一般的ですが、それだけで必ずしもデータリークが発生するわけではありません。
学習アルゴリズムにバッチ正規化を導入したことで、ミニバッチ内の他のサンプルの特徴量の影響が個々のデータに干渉してしまった。
バッチ正規化は学習を安定させる手法であり、それ自体はデータリークの主要な原因とはみなされません。
時間の経過とともに、運用環境に入力される実データの統計的な確率分布が、開発時の訓練データから大きく乖離してしまった。
これはデータドリフトと呼ばれる現象で、開発時の精度と運用時の精度が乖離する問題であり、データリークとは別の事象です。