P1 · 應會
治理 / 安全
成員推斷攻擊 (Membership Inference Attack, MIA)
是什麼
成員推斷攻擊是攻擊者觀察模型對某筆資料的輸出(例如信心分數或損失),推斷該筆資料是否曾被用於訓練,屬於針對訓練資料的隱私攻擊。
解決什麼問題
用來評估模型是否洩漏訓練資料的成員身分;模型越過擬合、對外輸出的信心資訊越完整,風險越高。
考場 Trigger
- 判斷某筆資料是否在訓練集中
- 對訓練樣本信心異常高
- 只查詢模型輸出就推得隱私
容易搞混
訓練資料記憶與洩漏差分隱私對抗性攻擊
中級深度
能說明攻擊利用過擬合造成的信心差距,並選出差分隱私、只回傳標籤或降低信心精度、正則化等防禦。