資料
前處理造成的資料洩漏
是什麼
先 Split,再 Fit preprocessing on training data,最後 Transform training/test with the same fitted parameters。
解決什麼問題
這題考標準化統計量應由哪一批資料估計,才能讓測試集真正代表未見資料。
考場 Trigger
- 看到『避免 Data Leakage+標準化』→ 先切分,只用 Training Data…
初級深度
掌握主要用途、考試線索與必要邊界即可。
中級深度
要能從程式流程抓出洩漏:特徵篩選、SMOTE、監督式降維(如 LDA 的 fit_transform)與標準化,都只能在切分後的訓練集或每一折內擬合。