P1 · 應會
治理 / 安全
對抗性攻擊 (Adversarial Attack)
是什麼
對輸入加入人眼難以察覺的微小擾動,刻意讓模型輸出錯誤結果的攻擊;對抗樣本(Adversarial Example)走正常輸入管道,外觀與合法輸入無異。
解決什麼問題
說明模型在推論階段可被精心設計的輸入誤導,提醒防禦必須放在 AI 管線本身。
考場 Trigger
- 微小擾動導致誤判
- 對抗樣本
- 防火牆擋不住
- 對抗訓練
容易搞混
對抗性測試資料投毒提示詞注入
中級深度
能列出輸入過濾、對抗訓練、輸出規則檢查等模型層防禦,並說明網路層防火牆為何辨識不了對抗樣本。