AI 方法論知識地圖 · 治理與倫理

隱私保護技術

保護數據隱私

在互動地圖中開啟 回AI 方法論知識地圖

觀念教學

資料是 AI 的燃料,但燃料裡混著每個人的隱私。隱私保護技術讓你在保護個資的前提下,照樣把模型練起來 — 資料不需要集中,也能進行有效的機器學習。

核心觀念

隱私保護技術(Privacy-Preserving Techniques)四大家族:去識別化(De-identification)聯邦學習(Federated Learning)(資料不集中、只傳模型更新)、差分隱私(Differential Privacy)(加可證明的雜訊,以隱私預算 ε 量化強度)、同態加密(Homomorphic Encryption)(加密狀態下仍能運算)。共同代價:模型效能可能下降、通訊成本可能上升 — 隱私與效用永遠在拔河。

白話理解

市政府用生成式 AI 做公文摘要,文件分「機密」與「一般」兩級:機密文件不得離開受控環境,就留在地端封閉環境處理;一般文件才走雲端。資料分級分流本身,就是最基本的隱私工程。

常考技術地圖

  • 匿名化 vs 假名化:匿名化不可逆、無法回推;假名化(Pseudonymization)把識別欄位換成不可回推的代碼,保留跨時間追蹤同一人的能力
  • 聯邦學習:資料不出本地,適合跨機構、跨裝置合作
  • 差分隱私:統計輸出加雜訊,防多次查詢拼出個體
  • 同態加密:資料可集中,但全程鎖著算
  • 資料最小化:用不到的個資,從一開始就不要收
🎯 口訣:藏名字(去識別)、不出門(聯邦)、加雜訊(差分)、鎖著算(同態)。

iPAS 考點

三類真題方向:交通局提供刷卡資料做研究、又要保留跨時間追蹤同一乘客 → 選假名化(卡號換成不可回推代碼),直接刪除識別欄位會失去追蹤能力;公文分機密/一般 → 選依機敏等級分流,機密留在受控環境;銀行 AI 助理主動說出當次輸入沒有的客戶資產明細、且已排除入侵與資料庫異常 → 最可能是訓練資料記憶(Memorization)造成的洩漏,模型把訓練時看過的個資背了出來。判斷關鍵字:要可追蹤 → 假名化;機密不出環境 → 分級處理;模型自己吐個資 → 訓練資料洩漏。

📝 本節掛載 3 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

應用場景

醫療數據合作金融數據分析跨機構學習隱私法規遵循

評估指標

隱私預算 (ε)通訊成本模型效能

iPAS 歷屆考題詳解(6 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

115年第二次初級AI應用規劃師第一科人工智慧基礎概論 第17題

某交通局計劃將公車乘客刷卡資料提供給學術機構進行通勤模式研究,該資料包含卡號、上下車時間、路線編號等欄位,且需保留跨時間追蹤同一乘客行為能力。為保護乘客隱私,下列哪種處理方式最符合個人資料保護法的去識別化要求?

  1. A將卡號欄位全部刪除,僅保留上下車時間與路線編號;
  2. B對卡號進行MD5 雜湊處理,並保留對照表供查詢;
  3. C將資料彙總為每日各路線總乘客數統計;
  4. D將卡號替換為隨機編號,且不保留任何對應關係
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 題幹有兩個並存的要求:研究需要「跨時間追蹤同一乘客」的能力,以及符合個資法的去識別化。將卡號替換為隨機編號(假名化)且不保留任何對應關係,研究者仍可透過同一代碼串連該乘客不同時間的乘車紀錄,但無法回推真實身分,兼顧研究可用性與重新識別風險的降低,故 (D) 正確。 【為何其他選項錯了?】 - (A):刪除卡號後,不同時間的紀錄之間失去串連依據,無法追蹤同一乘客的跨時間行為,不符研究需求。 - (B):MD5 雜湊速度快且卡號空間有限,可能被暴力比對回推;更關鍵的是保留對照表即保留還原身分的途徑,重新識別風險高,不符去識別化要求。 - (C):彙總為每日路線總乘客數屬於統計層級資料,雖能保護隱私,但完全失去個體層級的跨時間軌跡,無法支援通勤模式研究。 提示:題幹同時要求匿名化與保留同一人跨時間軌跡,對應不可逆的假名化:替換為隨機編號且不留對照表。
115年第二次初級AI應用規劃師第二科生成式AI應用與規劃 第44題

某市政府導入生成式AI 系統進行公文摘要作業,每日需處理約500 份文件。依資安規範,其中部分文件屬「機密等級」(不得離開受控環境),其餘為「一般等級」。在確保機密資料安全之前提下,且不改變既有AI 模型能力,何種資料處理策略最為適當?

  1. A機密文件與一般文件皆使用相同AI 模型,但機密文件於隔離環境中處理;
  2. B所有文件皆先去識別化後再送入同一AI 模型進行摘要處理;
  3. C機密文件與一般文件採相同處理流程,以避免系統架構複雜化;
  4. D所有文件先壓縮後批次處理,以提升AI 模型運算效率
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 題幹的硬性限制是:機密等級文件「不得離開受控環境」,且不改變既有 AI 模型能力。可行做法是依資料分級設計處理環境:機密文件於隔離的受控環境中以相同能力的模型處理,一般文件走一般流程。如此模型能力不變,又滿足不同資料等級的安全要求,故 (A) 正確。 【為何其他選項錯了?】 - (B):去識別化處理的是可識別個人的資訊,而公文的機密性未必來自個資;去識別化後文件內容仍可能屬於機密,送出受控環境即違反資安規範。 - (C):機密與一般文件採相同流程,等於忽略資料分級要求,使機密文件暴露於一般環境,直接違反題幹前提。 - (D):壓縮與批次處理只影響運算效率,與機密資料的處理環境安全無關,未回應題幹的資安要求。 提示:資料分級題的原則是高敏感資料留在受控或隔離環境處理;方案必須回應「不得離開」的硬性限制。
115年第二次初級AI應用規劃師第二科生成式AI應用與規劃 第49題

某銀行導入AI 理財助理供行員查詢客戶資訊。上線後發現,系統在部分對話中主動提及特定客戶的資產規模與交易紀錄,但這些資訊並未出現在當次輸入中。經調查已排除外部入侵、資料庫存取異常與輸入觸發問題。請問下列何者最可能是此次事件的根本原因?

  1. A行員在查詢過程中無意間輸入了特定關鍵字,觸發系統從資料庫中調用其他客戶的完整資料;
  2. B模型在訓練階段過度記憶了含有真實客戶資訊的訓練資料,在特定對話情境下將這些內容重新輸出;
  3. C客戶行為隨市場變化改變,導致模型對敏感資訊的判斷能力下降;
  4. D系統在不同使用者之間短暫共享對話上下文,導致部分資訊被誤帶入其他對話流程
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 題幹已排除外部入侵、資料庫存取異常與輸入觸發問題,但系統仍輸出「未出現在當次輸入」的特定客戶資產與交易資訊,最可能的根本原因是:模型在訓練階段過度記憶(Memorization)了含真實客戶資訊的訓練資料,並在特定對話情境下將這些內容重新輸出。這是以未經去識別化的真實資料訓練語言模型的典型隱私洩漏風險,故 (B) 正確。 【為何其他選項錯了?】 - (A):關鍵字觸發系統從資料庫調用其他客戶資料,屬於輸入觸發與資料庫存取路徑的問題,題幹已明確排除這兩類成因。 - (C):客戶行為隨市場變化屬於資料飄移議題,影響的是預測準確度,無法解釋模型輸出當次輸入中不存在的敏感紀錄。 - (D):不同使用者間共享對話上下文,敏感資訊仍是經由對話輸入流進入當次對話,屬於題幹已排除的輸入觸發與流程問題,與調查結果不符。 提示:排除外部入侵與輸入因素後,模型輸出訓練資料中的敏感內容,常見根因是訓練資料記憶造成的隱私洩漏。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第20題

某銀行計畫將信用風險評估模型部署至雲端平台,以便即時分析客戶交易行為。由於涉及大量敏感金融資料,銀行要求雲端服務商在不解密原始資料的情況下仍能執行模型運算。為達成此目標,最適合採用下列哪一項技術?

  1. A在上傳資料前進行匿名化(Anonymization),僅保留可識別代碼供比對使用
  2. B利用雜湊(Hash)函數轉換資料,以確保模型可追蹤但無法還原個資
  3. C採用資料本地化(Data Localization)策略,將所有模型訓練限制於內部伺服器中
  4. D透過同態加密(Homomorphic Encryption),讓雲端系統能直接在加密資料上執行運算,解密後結果與原始資料一致
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 銀行的核心需求是「雲端服務商在不解密原始資料的情況下仍能執行模型運算」。同態加密(Homomorphic Encryption)正是為此設計:資料以密文形式上傳,雲端直接對密文執行運算,結果回傳後由銀行解密,且解密後的結果與對明文執行相同運算的結果一致。資料在傳輸、儲存、運算全程維持加密,雲端自始至終接觸不到明文,故 (D) 正確。 【為何其他選項錯了?】 - (A):匿名化只是移除或替換識別欄位,其餘交易資料仍為明文,雲端仍可讀取內容,且匿名化資料存在重新識別風險,不符「不解密仍能運算」的要求。 - (B):雜湊是單向轉換,雜湊值僅適合比對用途,無法用於有意義的數值模型運算,滿足不了「執行模型運算」的需求。 - (C):資料本地化是將運算全部保留在內部伺服器,等於放棄雲端即時分析,未回應題幹「部署至雲端」的目標。 提示:「不解密也要能運算」是同態加密的專屬特徵;匿名化防識別、雜湊供比對、本地化不上雲,皆不符合此需求。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第37題

某金融機構將訓練好的信用評分模型開放 API 供合作夥伴查詢。資安團隊警告此設計可能遭受成員推斷攻擊(Membership Inference Attack)。下列何者最準確說明攻擊原理與對應防禦?

  1. A利用模型對訓練樣本的高信心輸出判斷其是否屬於訓練集;以差分隱私或降低輸出信心防禦
  2. B利用查詢次數與回應頻率差異判斷資料是否在訓練集中;以限制查詢次數防禦
  3. C透過模型輸出推測輸入的敏感特徵;以限制輸出資訊防禦
  4. D透過大量查詢建立替代模型模擬目標模型;以限制模型存取防禦
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 成員推斷攻擊(Membership Inference Attack, MIA)利用模型對「訓練時見過的樣本」往往輸出異常高信心的現象(過擬合的痕跡):攻擊者以某筆資料查詢 API,觀察輸出信心分佈,推斷該筆資料是否屬於訓練集。在金融、醫療場景,「某人存在於該資料集」本身就是敏感資訊。對應防禦包括:訓練時採用差分隱私(如 DP-SGD)以雜訊掩蓋單一樣本的影響,或於部署時降低輸出資訊量(僅回傳標籤、截斷信心分數)。(A) 對攻擊原理與防禦的描述皆正確。 【為何其他選項錯了?】 - (B):查詢次數與回應頻率和樣本是否屬於訓練集無關;限制查詢次數是防濫用的通用手段,無法防止單次查詢即可觀察信心分佈的 MIA。 - (C):由模型輸出推測輸入的敏感特徵屬於屬性推斷或模型反演攻擊(Model Inversion),攻擊對象是特徵值,不是訓練集成員資格。 - (D):以大量查詢建立替代模型屬於模型萃取攻擊(Model Extraction),竊取的是模型功能本身,不是訓練資料的成員資訊。 提示:MIA 的特徵是利用模型對訓練樣本的過高信心;防禦組合為差分隱私訓練加上限制輸出資訊量。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第36題

某金融機構的 AI 信用評分模型需上傳至第三方雲端服務商進行推論。法務部門要求:在不解密資料的前提下,由單一雲端服務商直接對加密資料進行模型運算。下列哪種隱私保護技術最符合此需求?

  1. A聯邦學習(Federated Learning)
  2. B同態加密(Homomorphic Encryption)
  3. C差分隱私(Differential Privacy)
  4. D安全多方計算(Secure Multi-Party Computation, MPC)
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 同態加密(Homomorphic Encryption)允許直接對「密文」執行運算,運算結果解密後與對明文運算的結果一致。流程恰好對應題目條件:金融機構將資料加密後上傳,雲端服務商全程不解密,直接對加密資料執行模型推論,結果回傳後由機構自行解密。「單一服務商、不解密、直接運算」三項條件全部符合,故 (B) 正確。 【為何其他選項錯了?】 - (A):聯邦學習的核心是「資料不出本地」,各方在本地訓練、只交換模型參數或梯度;題目情境是將資料上傳至雲端運算,前提不同。 - (C):差分隱私是對資料或查詢輸出加入雜訊,防止個體被重新識別;運算時資料仍為明文形式,不符「不解密之下運算」的要求。 - (D):安全多方計算需要多個參與方分持秘密份額協同計算;題目明定由單一雲端服務商執行運算,不符合 MPC 的參與架構。 提示:密文直接運算對應同態加密;資料不出本地對應聯邦學習;輸出加噪對應差分隱私;多方分持對應 MPC。

相關節點