P1 · 應會
機器學習
維度災難 (Curse of Dimensionality)
是什麼
維度升高時資料在空間中變得極度稀疏,點與點的距離趨於相近(距離集中),使依賴距離或密度的方法失去鑑別力,所需樣本數也急遽增加。
解決什麼問題
解釋 KNN、DBSCAN、K-means 在高維資料上效果下降的原因,提示應先降維。
考場 Trigger
- 數百維特徵
- 距離趨於相近
- DBSCAN 幾乎全判為雜訊
- 先降維再分群
容易搞混
密度分群演算法主成分分析K-近鄰
中級深度
能用距離集中解釋高維下距離型演算法失效,並提出 PCA 降維或改用餘弦相似度等對策。