← 返回知識庫刷題首頁
P0 · 必會

資料中級

資料不平衡處理 (Imbalanced Data Handling)

是什麼

資料不平衡處理(Imbalanced Data Handling)是在某類別樣本遠少於其他類時採取的對策,包括資料面的過採樣、欠採樣、SMOTE,演算法面的類別權重,以及改用召回率、F1、PR-AUC 等評估指標。

解決什麼問題

避免模型一律猜多數類仍得到高準確率,卻完全抓不到詐欺、罕病等真正重要的少數類。

考場 Trigger

  • 正樣本只占 1% 以下
  • 準確率很高但少數類召回率為 0
  • 過採樣、欠採樣
  • 類別權重 class_weight

容易搞混

合成少數類過採樣成本敏感學習PR 曲線下面積

中級深度

能說出隨機過採樣易過擬合、準確率為何失真,並為情境選資料面、演算法面或指標面對策。

Official Evidence

官方題目正在怎麼考

4 官方題2 考綱節點