P2 · 辨識即可
治理 / 安全
輸出監控 (Output Monitoring)
是什麼
在模型產生回應後、交給使用者或下游系統前,檢查內容是否洩漏敏感資訊、含有害內容或有異常行為,必要時攔截、拒答或轉人工複核。
解決什麼問題
即使惡意輸入繞過入口檢查,仍能在出口擋下不當或洩密的結果。
考場 Trigger
- 生成後再檢查內容
- 攔截不當輸出/拒答
- 偵測漏掉或洩漏重要資訊
容易搞混
輸入驗證AI Guardrails人在迴圈中
初級深度
看到名稱能辨識其類型與主要用途即可。
治理 / 安全
是什麼
在模型產生回應後、交給使用者或下游系統前,檢查內容是否洩漏敏感資訊、含有害內容或有異常行為,必要時攔截、拒答或轉人工複核。
解決什麼問題
即使惡意輸入繞過入口檢查,仍能在出口擋下不當或洩密的結果。
考場 Trigger
容易搞混
初級深度
看到名稱能辨識其類型與主要用途即可。
Official Evidence