AI 方法論知識地圖 · 治理與倫理

對抗式攻擊防禦

防止雜訊騙過 AI

在互動地圖中開啟 回AI 方法論知識地圖

觀念教學

在圖片上加一層人眼看不見的微小雜訊,分類器就把熊貓認成長臂猿 — 這就是對抗式攻擊,AI 視覺最著名的罩門。

核心觀念

對抗式攻擊(Adversarial Attack)是刻意製造對抗樣本(Adversarial Examples):在輸入中加入精心計算的微小擾動,人類無感,模型卻大錯特錯。經典手法有 FGSM(快速梯度符號法)PGD(投影梯度下降);PGD 是多步迭代版、攻擊力更強,所以 PGD 準確率(被 PGD 攻擊時仍答對的比例)成了衡量防禦力的標準指標。

白話理解

自駕車看路標:研究者在「停止」標誌貼幾張小貼紙,模型就把它讀成限速標誌。製造業瑕疵檢測同理 — 若微小擾動能讓瑕疵品被判定合格,整條品管防線形同虛設。

防禦手法

  • 對抗訓練(Adversarial Training):訓練時就餵對抗樣本,先讓模型見過招式,是目前最主流有效的方法
  • 輸入淨化(Input Purification):推論前先去噪、平滑、壓縮,把擾動洗掉
  • 梯度遮蔽與偵測器:讓攻擊者算不到梯度,或另訓一個模型專門攔截對抗樣本
  • 成效以攻擊成功率(愈低愈好)與防禦成功率(愈高愈好)量化,一體兩面
🎯 口訣:人看沒變、模型看瘋 = 對抗樣本;最實在的解法是先自打疫苗(對抗訓練)。

iPAS 考點

考辨識題:「在圖片加入微小雜訊導致分類器誤判」就是對抗式攻擊,判斷關鍵字是微小擾動、人眼難辨、發生在推論階段。易混淆對:資料投毒發生在訓練階段(污染訓練資料),對抗樣本發生在推論階段(騙訓練好的模型)— 看攻擊時機分辨。防禦題答案往對抗訓練、輸入淨化的方向選。

應用場景

對抗訓練輸入淨化模型蒸餾防禦認證防禦

評估指標

攻擊成功率防禦成功率PGD 準確率

iPAS 歷屆考題詳解(1 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第24題

某金融機構的 AI風控系統遭受對抗性攻擊,駭客透過對輸入特徵進行微小但惡意的擾動,成功欺騙了模型。為了從根本上解決模型自身對這類攻擊的脆弱性,下列何者並非針對此種攻擊型態的技術手段?

  1. A強化資料前處理,用以過濾掉格式不符或數值極端異常的輸入
  2. B在模型訓練階段導入對抗樣本訓練,以提升模型對惡意特徵擾動的辨識與防禦能力
  3. C於推論後階段使用規則引擎,以確保模型的預測結果不違反既有的業務硬性規定
  4. D在模型部署環境中強化網路防火牆,以阻擋來自未授權來源的網路連線
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 題目要找「並非」針對對抗性攻擊(Adversarial Attack)的技術手段。對抗性攻擊是對輸入特徵施加微小惡意擾動使模型誤判,防禦必須作用在資料與模型層,例如輸入淨化、對抗訓練、輸出防護。強化網路防火牆阻擋的是未授權的網路連線,屬於基礎設施安全;攻擊者若透過合法管道送出精心擾動的輸入,防火牆無從辨識內容,因此 (D) 不是針對此攻擊型態的手段,為本題答案。 【為何其他選項錯了?】 - (A):強化資料前處理、過濾格式不符或數值極端異常的輸入屬於輸入淨化(Input Sanitization)防線,可攔截部分惡意樣本,是針對此攻擊的相關防禦環節。 - (B):對抗樣本訓練(Adversarial Training)把攻擊樣本納入訓練,直接提升模型對惡意擾動的辨識與防禦能力,是最核心的防禦手段。 - (C):推論後以規則引擎把關,即使模型被欺騙,輸出仍不得違反業務硬性規定,屬於輸出端防護,同樣是降低攻擊影響的技術手段。 提示:對抗性攻擊經由合法輸入管道夾帶惡意擾動;防火牆只管連線來源,管不到輸入內容本身。

相關節點