AI 投毒是攻擊者污染訓練資料、微調資料、回饋流程、RAG 知識庫或模型本身,讓 AI 在一般測試中看似正常,卻在特定情境產生偏誤、錯誤或不安全行為。它攻擊的是 AI 的「學習材料與供應鏈」,影響可能在污染來源移除後仍留在模型或決策流程中。
AI 投毒包含哪些不同風險?
OWASP LLM04:2025 將資料與模型投毒列為生成式 AI 風險。NIST AI 100-2 E2025 則提供對抗式機器學習的攻擊與緩解分類。企業在討論「投毒」時,至少要分清三種情況:
- 資料投毒:訓練、微調、標註或回饋資料被新增、刪除、修改或錯誤標記,影響模型學到的關係。
- 模型投毒或後門:模型權重、訓練流程或第三方模型被動手腳,使特定輸入觸發異常行為,或整體品質下降。
- 推論階段攻擊:攻擊者只在模型使用時提供對抗輸入,沒有改變訓練資料或模型;這與投毒需要不同控制。
RAG 知識庫也會被投毒嗎?
會。RAG 不一定重新訓練模型,但會把檢索到的內容加入回答上下文。如果錯誤文件、過時規範、被竄改的 FAQ 或惡意上傳內容進入知識庫,AI 就可能在回答時引用它。這比較像「知識來源污染」,仍會直接影響企業決策。
常見入口包括共享資料夾自動同步、外部網站爬取、供應商手冊、使用者上傳、客服回饋,以及沒有審核的內部文件。RAG 的版本、來源與權限若無法追溯,就很難知道錯誤答案是模型問題、檢索問題,還是資料已被污染。
企業 AI 資料供應鏈的五個風險點
- 來源不明:公開資料集或網路資料沒有授權、版本與取得日期紀錄。
- 標註流程脆弱:外包標註、人工回饋或自動標註缺少抽查與雙人覆核。
- 持續回饋失控:使用者評分直接進入再訓練,攻擊者可大量提交偏誤訊號。
- 第三方模型不透明:模型、Adapter、Embedding 或套件來源無法驗證,更新也未經隔離測試。
- 知識庫可任意寫入:上傳者權限過大,文件核准、版本與撤回機制不足。
如何發現資料或模型可能被污染?
投毒不一定讓整體準確率明顯下降,因此不能只看單一平均分數。企業可比較不同資料來源、部門、時間與主題的表現,留意特定類別突然惡化、少數輸入反覆出現異常答案、引用來源集中到新文件,或模型更新後只在某些情境偏離既有政策。
調查時應保留輸入、檢索來源、模型版本、索引版本與工具結果的關聯,但日誌要去除不必要的敏感內容。若懷疑污染,先停止新版本擴散,隔離相關資料與模型,回到最後可信版本,再重建索引與重新評估。不要在尚未確認影響範圍前直接覆蓋證據。
MITRE ATLAS 2026.07 官方資料將 Training Data Poisoning 說明為操弄訓練或微調資料,可能造成目標錯誤、偏誤、不安全行為、效能下降或特定輸入觸發的後門。這提醒企業:資料治理不是單純的品質工作,也是資安控制。
企業情境:客服回饋如何累積成錯誤知識?
假設客服助理會把「獲得正向評分的回答」納入後續優化。如果系統沒有驗證評分者、樣本量與內容來源,同一群帳號可能持續提高錯誤答案的權重。短期看來只是少數錯誤,長期卻可能讓模型在退費、身份驗證或合約條款上形成偏差。
安全做法是先把回饋放入隔離資料集,保留來源與版本,經抽樣、異常分析及業務人員核准後才進入微調或知識庫,不讓線上回饋直接改變 production 行為。
AI 投毒的七項防護措施
- 建立資料清冊:記錄資料擁有者、來源、用途、授權、版本、取得時間與保存期限。
- 保留完整性證據:對資料集、模型、Embedding 與設定保存雜湊、簽章或不可竄改版本紀錄。
- 限制寫入權限:把上傳、審核、發布與撤回權限分離,production 知識庫不接受未核准內容。
- 偵測異常:監看資料分布、標籤比例、來源集中度、重複樣本與突然出現的主題變化。
- 隔離測試:新資料、模型或供應商版本先在測試環境比較基準題、邊界案例與敏感情境。
- 保留回復能力:能快速回到上一版資料、模型與索引,並知道哪些回答受到污染版本影響。
- 管理供應鏈:驗證第三方模型與資料來源、合約責任、更新機制、弱點通報與停止使用程序。
上線前檢查表
- 每一份訓練、微調及 RAG 資料是否可追溯來源?
- 誰能上傳、核准、發布與刪除資料?權限是否分離?
- 是否保存資料、模型、Prompt、索引與評估集版本?
- 新版本是否先通過固定基準與異常情境測試?
- 能否撤回污染文件並重建受影響索引?
- 第三方模型或資料更新時,是否重新驗證?
結論:AI 投毒要從資料生命週期處理
AI 投毒不是多裝一個過濾器就能解決。企業要把資料、模型與 RAG 索引視為正式資產,建立來源、版本、權限、測試與回復流程。AiLab 的平台架構與解決方案可協助釐清資料流與控制責任。
