機器學習
資料漂移 (Data Drift)
是什麼
上線後輸入資料的分布與訓練資料明顯不同,例如湧入新族群、新裝置或新款商品;輸入對應到答案的規則本身不一定改變。
解決什麼問題
及早發現模型面對的資料已和訓練時不同,以便補充新資料或重新訓練。
考場 Trigger
- 新用戶族群/裝置差異大
- 輸入特徵分布改變
- 判斷標準沒變,準確率卻下降
容易搞混
初級深度
看到名稱能辨識其類型與主要用途即可。
中級深度
要能在拿到真實標籤前,以 PSI、KL 散度比較線上與訓練期輸入分布來預警效能下滑,也知道可用 VAE 潛在空間監控分布偏移。