AI 方法論知識地圖 · 治理與倫理

差分隱私

Differential Privacy

在互動地圖中開啟 回AI 方法論知識地圖

觀念教學

讓統計結果「差你一個人也看不出來」— 差分隱私用數學保證:資料庫裡有沒有你,輸出的答案幾乎一樣。

核心觀念

差分隱私(Differential Privacy)透過在資料或模型輸出中加入數學上可證明的雜訊,確保單一個體的資料不會被識別出來。隱私保護強度隱私預算 ε(epsilon)量化:ε 越小、雜訊越大、保護越強,但效用損失也越大;δ(delta)則是允許保證失效的極小機率。

白話理解

研究機構開放統計查詢(平均收入、疾病發生率),攻擊者想用「查全體、再查排除某人的全體」兩次相減鎖定個人。差分隱私在每次查詢結果加入隨機微小誤差 — 整體統計趨勢仍準,個體卻藏進了雜訊裡。

關鍵細節

  • 雜訊機制:常用拉普拉斯(Laplace)或高斯(Gaussian)雜訊,依查詢的敏感度校準
  • 隱私預算會累積:每查一次花一點 ε,查太多次預算耗盡、保護失效,所以要限制查詢次數
  • 兩個戰場:發布統計結果時加雜訊;訓練模型時對梯度加雜訊(如 DP-SGD)
  • 效用與隱私是翹翹板:ε 壓太低,統計結果可能失真到不能用
🎯 口訣:加雜訊、護個體、保趨勢;ε 越小越安全、也越失真。

iPAS 考點

真題長相:「系統在每次查詢結果中加入隨機微小誤差,防止攻擊者多次查詢推測特定個體,但仍維持整體統計趨勢」→ 標準的差分隱私描述。判斷關鍵字:加雜訊、數學可證明、個體不可識別、整體趨勢不變。易混淆對:去識別化是「刪改欄位」,差分隱私是「加數學雜訊」;聯邦學習管「資料在哪訓練」,差分隱私管「輸出洩不洩漏」— 兩者常搭配使用。

📝 本節掛載 1 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

應用場景

隱私保護查詢安全數據發布隱私保護機器學習Apple/Google 數據收集

評估指標

隱私預算 (ε, δ)效用損失隱私保護強度

iPAS 歷屆考題詳解(2 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

115年第二次初級AI應用規劃師第二科生成式AI應用與規劃 第46題

某研究機構開放統計資料查詢服務,允許外界查詢平均收入、疾病發生率等資訊。為避免攻擊者透過多次查詢推測特定個體資料,系統在每次查詢結果中加入隨機微小誤差,但仍能維持整體統計趨勢。下列何者最能敘述此技術?

  1. A透過加密技術確保資料在傳輸與儲存過程中不被竄改;
  2. B透過資料去識別化移除姓名與身分證等個人資訊;
  3. C透過加入隨機雜訊保護統計結果中的個體隱私;
  4. D透過存取權限控管限制不同使用者的查詢範圍
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 題幹描述的機制是:在每次統計查詢結果中加入隨機微小誤差,使整體統計趨勢仍可用,但攻擊者難以透過多次查詢反推特定個體的資料。這正是差分隱私(Differential Privacy)的基本精神:以校準過的隨機雜訊保護統計輸出中的個體隱私,使單一個體的加入或移除不會顯著改變查詢結果,故 (C) 正確。 【為何其他選項錯了?】 - (A):加密確保資料在傳輸與儲存過程中的機密性與完整性,但查詢結果仍是精確值,無法防止由多次統計查詢推論個體資料。 - (B):去識別化移除姓名、身分證字號等直接識別欄位,但個體紀錄仍在資料集中,攻擊者仍可能藉由多次查詢結果的差異回推個體資訊。 - (D):存取權限控管限制的是「誰能查詢」;題幹的機制作用在「查詢結果本身」加入隨機誤差,兩者屬於不同防護層次。 提示:「統計結果加入隨機雜訊、整體趨勢不變、保護個體」是差分隱私的標準描述。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第38題

某 AI 平台的資料治理工程師正在評估三種去識別化技術的適用場景與強度:K 匿名(K-anonymity)、差分隱私合成資料(Differential Privacy Synthetic Data)、亂數回應機制(Randomized Response)。下列敘述何者不正確?

  1. AK匿名主要應用於表格型資料,確保每筆記錄在準識別符(Quasi-identifier)組合上至少與K-1 筆其他記錄相同,防止個體被唯一識別
  2. B差分隱私合成資料是在發布統計查詢結果或訓練模型時直接對原始資料加入雜訊,以確保單一個體的加入或移除不會顯著改變輸出
  3. C亂數回應機制讓受訪者以機率性方式回答敏感問題(如:您是否曾逃稅?),賦予個人對答案的可否認性(Plausible Deniability)
  4. D三種技術中,只有差分隱私提供可組合且可量化的隱私保證,而 K 匿名與亂數回應在面對背景知識攻擊或多次查詢時保護能力有限
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 本題要挑出「不正確」的敘述。(B) 把兩種機制混為一談:「發布統計查詢結果或訓練模型時直接對原始資料或輸出加入校準雜訊」是傳統差分隱私機制(如 Laplace 機制、高斯機制、DP-SGD)的描述;而「差分隱私合成資料」是另一種作法:先以滿足差分隱私的方式訓練生成模型(雜訊加在生成模型的學習過程),再由該模型產生整份可自由使用的合成資料集,對外發布的是合成資料本身,不是逐次查詢的加噪結果。(B) 的描述張冠李戴,故為本題答案。 【為何其他選項錯了?】 - (A):此敘述正確,故非本題答案。K 匿名確保每筆記錄在準識別符組合上至少與 K-1 筆其他記錄相同,是表格型資料防止唯一識別的經典手法。 - (C):此敘述正確,故非本題答案。亂數回應讓受訪者依機率決定誠實回答或隨機回答敏感問題,個人保有可否認性,統計上仍可估計母體比例。 - (D):此敘述正確,故非本題答案。差分隱私具備可組合性(隱私預算 ε 可累計)與可量化保證;K 匿名易受背景知識與同質性攻擊,亂數回應在多次重複詢問下保護力會被稀釋。 提示:差分隱私合成資料的雜訊加在生成模型的訓練過程,發布的是合成資料;直接對查詢輸出加噪是傳統 DP 機制,兩者不可混淆。

相關節點