AI 方法論知識地圖 · 治理與倫理
差分隱私
Differential Privacy
觀念教學
讓統計結果「差你一個人也看不出來」— 差分隱私用數學保證:資料庫裡有沒有你,輸出的答案幾乎一樣。
核心觀念
差分隱私(Differential Privacy)透過在資料或模型輸出中加入數學上可證明的雜訊,確保單一個體的資料不會被識別出來。隱私保護強度由隱私預算 ε(epsilon)量化:ε 越小、雜訊越大、保護越強,但效用損失也越大;δ(delta)則是允許保證失效的極小機率。
白話理解
研究機構開放統計查詢(平均收入、疾病發生率),攻擊者想用「查全體、再查排除某人的全體」兩次相減鎖定個人。差分隱私在每次查詢結果加入隨機微小誤差 — 整體統計趨勢仍準,個體卻藏進了雜訊裡。
關鍵細節
- 雜訊機制:常用拉普拉斯(Laplace)或高斯(Gaussian)雜訊,依查詢的敏感度校準
- 隱私預算會累積:每查一次花一點 ε,查太多次預算耗盡、保護失效,所以要限制查詢次數
- 兩個戰場:發布統計結果時加雜訊;訓練模型時對梯度加雜訊(如 DP-SGD)
- 效用與隱私是翹翹板:ε 壓太低,統計結果可能失真到不能用
🎯 口訣:加雜訊、護個體、保趨勢;ε 越小越安全、也越失真。
iPAS 考點
真題長相:「系統在每次查詢結果中加入隨機微小誤差,防止攻擊者多次查詢推測特定個體,但仍維持整體統計趨勢」→ 標準的差分隱私描述。判斷關鍵字:加雜訊、數學可證明、個體不可識別、整體趨勢不變。易混淆對:去識別化是「刪改欄位」,差分隱私是「加數學雜訊」;聯邦學習管「資料在哪訓練」,差分隱私管「輸出洩不洩漏」— 兩者常搭配使用。
📝 本節掛載 1 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。
應用場景
評估指標
iPAS 歷屆考題詳解(2 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某研究機構開放統計資料查詢服務,允許外界查詢平均收入、疾病發生率等資訊。為避免攻擊者透過多次查詢推測特定個體資料,系統在每次查詢結果中加入隨機微小誤差,但仍能維持整體統計趨勢。下列何者最能敘述此技術?
- A透過加密技術確保資料在傳輸與儲存過程中不被竄改;
- B透過資料去識別化移除姓名與身分證等個人資訊;
- C透過加入隨機雜訊保護統計結果中的個體隱私;
- D透過存取權限控管限制不同使用者的查詢範圍
看正解與逐選項詳解
正解:C
某 AI 平台的資料治理工程師正在評估三種去識別化技術的適用場景與強度:K 匿名(K-anonymity)、差分隱私合成資料(Differential Privacy Synthetic Data)、亂數回應機制(Randomized Response)。下列敘述何者不正確?
- AK匿名主要應用於表格型資料,確保每筆記錄在準識別符(Quasi-identifier)組合上至少與K-1 筆其他記錄相同,防止個體被唯一識別
- B差分隱私合成資料是在發布統計查詢結果或訓練模型時直接對原始資料加入雜訊,以確保單一個體的加入或移除不會顯著改變輸出
- C亂數回應機制讓受訪者以機率性方式回答敏感問題(如:您是否曾逃稅?),賦予個人對答案的可否認性(Plausible Deniability)
- D三種技術中,只有差分隱私提供可組合且可量化的隱私保證,而 K 匿名與亂數回應在面對背景知識攻擊或多次查詢時保護能力有限
看正解與逐選項詳解
正解:B