P0 · 必會
資料
資料不平衡處理 (Imbalanced Data Handling)
是什麼
資料不平衡處理(Imbalanced Data Handling)是在某類別樣本遠少於其他類時採取的對策,包括資料面的過採樣、欠採樣、SMOTE,演算法面的類別權重,以及改用召回率、F1、PR-AUC 等評估指標。
解決什麼問題
避免模型一律猜多數類仍得到高準確率,卻完全抓不到詐欺、罕病等真正重要的少數類。
考場 Trigger
- 正樣本只占 1% 以下
- 準確率很高但少數類召回率為 0
- 過採樣、欠採樣
- 類別權重 class_weight
容易搞混
合成少數類過採樣成本敏感學習PR 曲線下面積
中級深度
能說出隨機過採樣易過擬合、準確率為何失真,並為情境選資料面、演算法面或指標面對策。