AI 方法論知識地圖 · 治理與倫理
對抗式攻擊防禦
防止雜訊騙過 AI
觀念教學
在圖片上加一層人眼看不見的微小雜訊,分類器就把熊貓認成長臂猿 — 這就是對抗式攻擊,AI 視覺最著名的罩門。
核心觀念
對抗式攻擊(Adversarial Attack)是刻意製造對抗樣本(Adversarial Examples):在輸入中加入精心計算的微小擾動,人類無感,模型卻大錯特錯。經典手法有 FGSM(快速梯度符號法)與 PGD(投影梯度下降);PGD 是多步迭代版、攻擊力更強,所以 PGD 準確率(被 PGD 攻擊時仍答對的比例)成了衡量防禦力的標準指標。
白話理解
自駕車看路標:研究者在「停止」標誌貼幾張小貼紙,模型就把它讀成限速標誌。製造業瑕疵檢測同理 — 若微小擾動能讓瑕疵品被判定合格,整條品管防線形同虛設。
防禦手法
- 對抗訓練(Adversarial Training):訓練時就餵對抗樣本,先讓模型見過招式,是目前最主流有效的方法
- 輸入淨化(Input Purification):推論前先去噪、平滑、壓縮,把擾動洗掉
- 梯度遮蔽與偵測器:讓攻擊者算不到梯度,或另訓一個模型專門攔截對抗樣本
- 成效以攻擊成功率(愈低愈好)與防禦成功率(愈高愈好)量化,一體兩面
🎯 口訣:人看沒變、模型看瘋 = 對抗樣本;最實在的解法是先自打疫苗(對抗訓練)。
iPAS 考點
考辨識題:「在圖片加入微小雜訊導致分類器誤判」就是對抗式攻擊,判斷關鍵字是微小擾動、人眼難辨、發生在推論階段。易混淆對:資料投毒發生在訓練階段(污染訓練資料),對抗樣本發生在推論階段(騙訓練好的模型)— 看攻擊時機分辨。防禦題答案往對抗訓練、輸入淨化的方向選。
應用場景
評估指標
iPAS 歷屆考題詳解(1 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某金融機構的 AI風控系統遭受對抗性攻擊,駭客透過對輸入特徵進行微小但惡意的擾動,成功欺騙了模型。為了從根本上解決模型自身對這類攻擊的脆弱性,下列何者並非針對此種攻擊型態的技術手段?
- A強化資料前處理,用以過濾掉格式不符或數值極端異常的輸入
- B在模型訓練階段導入對抗樣本訓練,以提升模型對惡意特徵擾動的辨識與防禦能力
- C於推論後階段使用規則引擎,以確保模型的預測結果不違反既有的業務硬性規定
- D在模型部署環境中強化網路防火牆,以阻擋來自未授權來源的網路連線
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
題目要找「並非」針對對抗性攻擊(Adversarial Attack)的技術手段。對抗性攻擊是對輸入特徵施加微小惡意擾動使模型誤判,防禦必須作用在資料與模型層,例如輸入淨化、對抗訓練、輸出防護。強化網路防火牆阻擋的是未授權的網路連線,屬於基礎設施安全;攻擊者若透過合法管道送出精心擾動的輸入,防火牆無從辨識內容,因此 (D) 不是針對此攻擊型態的手段,為本題答案。
【為何其他選項錯了?】
- (A):強化資料前處理、過濾格式不符或數值極端異常的輸入屬於輸入淨化(Input Sanitization)防線,可攔截部分惡意樣本,是針對此攻擊的相關防禦環節。
- (B):對抗樣本訓練(Adversarial Training)把攻擊樣本納入訓練,直接提升模型對惡意擾動的辨識與防禦能力,是最核心的防禦手段。
- (C):推論後以規則引擎把關,即使模型被欺騙,輸出仍不得違反業務硬性規定,屬於輸出端防護,同樣是降低攻擊影響的技術手段。
提示:對抗性攻擊經由合法輸入管道夾帶惡意擾動;防火牆只管連線來源,管不到輸入內容本身。