AI 方法論知識地圖 · 治理與倫理

公平性與去偏見

避免歧視

在互動地圖中開啟 回AI 方法論知識地圖

觀念教學

模型沒有惡意,但資料有歷史 — 歧視會從舊資料裡原封不動被學回來,公平性就是把這條路堵住。

核心觀念

公平性(Fairness)要求模型不因敏感特徵(Sensitive Attributes)如性別、種族而產生系統性歧視。麻煩在於就算刪掉敏感欄位,代理變數(Proxy Variables)(如郵遞區號暗示族群)仍會把偏見帶回來,所以需在資料層與模型層進行去偏見處理,確保 AI 決策公平。

白話理解

金融風控模型若用歷史核貸紀錄訓練,而過去審核系統性拒絕某族群,模型就會把這套偏見當成「規律」學起來。資料反映的是舊世界,不是應然的世界。

三大公平性指標

  • Demographic Parity(人口統計均等):各群體獲得正向結果(如核貸)的比例相同
  • Equal Opportunity(機會均等):各群體中「真正合格者」被正確通過的比例(TPR)相同
  • Equalized Odds(均等化賠率):最嚴格,各群體的 TPR 與 FPR 都要相同
  • 三者常互相衝突,難以同時滿足,實務依業務場景取捨

去偏見有三個下手點:資料層(重抽樣、重加權、移除敏感與代理特徵)、模型層(把公平性約束加進損失函數)、輸出層(對不同群體校準決策門檻)。

🎯 口訣:Parity 看結果比例、Opportunity 看合格者、Odds 連錯的比例都要一樣。

iPAS 考點

真實考題:保險公司想用「性別」當輸入特徵預測愛滋感染風險,資料治理委員會為何反對?答案方向:這是拿群體統計差異對個人做差別待遇,構成敏感特徵歧視;相關不等於因果,且醫療資訊屬高敏感個資,更不容許。判斷心法:看到「拿性別、種族當特徵」先想直接歧視;看到「刪了敏感欄位還是歧視」,想代理變數。

📝 本節掛載 1 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

應用場景

招募篩選貸款審核人臉辨識去偏見 (De-biasing)

評估指標

Demographic ParityEqual OpportunityEqualized Odds

iPAS 歷屆考題詳解(5 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

115年第二次初級AI應用規劃師第一科人工智慧基礎概論 第11題

某保險公司建立理賠風險預測模型時,資料科學家在特徵選擇階段提出以「性別」作為預測愛滋病毒感染風險的輸入特徵之一。資料治理委員會在審查特徵清單時,對此提出異議。下列哪一項理由最能說明「以性別預測愛滋病毒感染風險」是不適當的原因?

  1. A性別為類別型變數,需進行編碼轉換才能輸入模型,增加前處理複雜度;
  2. B性別特徵在資料集中可能存在缺失值,影響模型訓練的穩定性;
  3. C以性別作為感染風險的代理特徵,會強化對特定族群的歧視性標籤,違反公平性原則;
  4. D性別特徵與感染風險之間的統計相關性有限,可能降低模型預測效能
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 題幹情境是以「性別」作為預測愛滋病毒感染風險的輸入特徵。性別在此成為敏感屬性的代理特徵(Proxy Feature):把疾病風險與特定性別或族群連結,模型學到的不是個人的實際風險因子,而是群體標籤,會強化對特定族群的歧視性刻板印象,違反 AI 公平性(Fairness)與避免不當差別待遇的原則。資料治理委員會的異議屬於倫理與公平性層次的審查,故 (C) 正確。 【為何其他選項錯了?】 - (A):類別型變數需要編碼是一般性的前處理工作,屬工程議題且成本極低;委員會反對的理由在公平性,不在前處理複雜度。 - (B):缺失值可透過補值或刪除處理,屬資料品質議題;即使性別欄位完整無缺,以其預測感染風險的歧視疑慮依然存在。 - (D):統計相關性高低是模型效能考量;即便相關性存在,以敏感屬性作為風險代理特徵仍會強化歧視標籤,問題的本質不在預測效能。 提示:涉及敏感屬性或其代理特徵時,優先檢視公平性與歧視風險,而非工程難度或預測效能。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第49題

某電商平台導入 AI情感分析模型,用以自動偵測顧客評論中的負面情緒並觸發客服機制。然而,上線後發現模型在面對不同語言或族群書寫風格的評論時表現不一致,例如部分語氣強烈的正面評論被誤判為負面,而禮貌但含批評意圖的評論卻被判為中性。若從技術與資料治理的角度分析,下列哪一項描述不正確?

  1. A模型未啟用詞嵌入正規化(Embedding Normalization)可能造成語意距離不穩定,導致預測誤差
  2. B訓練語料若偏向特定文化或語氣特徵,可能使模型產生內隱偏誤(Implicit Bias)
  3. C模型若訓練資料來源不平衡,容易導致對不同語言或族群風格的情緒判斷不準確
  4. DTransformer 架構能捕捉上下文語意,但若訓練資料偏差仍存在,模型仍可能學習到偏誤判斷
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 題目要求挑出「不正確」的敘述。模型對不同語言、族群書寫風格表現不一致,根本原因是訓練語料的文化與語氣分佈偏差,屬於資料治理與公平性(Fairness)議題。選項 (A) 將問題歸因於「未啟用詞嵌入正規化(Embedding Normalization)」,但那只是數值處理細節,並非情感誤判的典型主因,更無法解釋「特定族群風格被系統性誤判」的模式;把資料偏差問題歸咎於單一技術設定,因此是錯誤敘述,為本題答案。 【為何其他選項錯了?】 - (B):此敘述正確,故非本題答案。語料偏向特定文化或語氣時,模型會把該文化的表達習慣當成通用標準,形成內隱偏誤(Implicit Bias)。 - (C):此敘述正確,故非本題答案。資料來源不平衡使少數風格樣本不足,對這些風格的情緒判斷自然失準,正是題目現象的合理解釋。 - (D):此敘述正確,故非本題答案。Transformer 架構雖能捕捉上下文語意,但模型學習的對象是資料;訓練資料存在偏差,模型仍會學到偏誤判斷。 提示:模型偏見的根源多在資料分佈;此類挑錯題,先找出把資料問題錯誤歸因於單一技術細節的選項。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第13題

標籤偏差(Label Bias)通常是因為什麼原因造成?

  1. A訓練資料量過大
  2. B標記資料本身帶有主觀偏見
  3. C模型結構設計不當
  4. D特徵數量設定過多
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 標籤偏差(Label Bias)指訓練資料的「標記本身」帶有系統性偏見,例如標註者的主觀判斷標準不一,或標籤來自帶有歧視的歷史決策(過去審核人員對特定族群較嚴格,其核駁紀錄被直接當成標籤)。模型的學習目標就是這些標籤;標籤本身失真,模型再準確也只是精確地複製並放大既有偏見,故 (B) 正確。 【為何其他選項錯了?】 - (A):訓練資料量影響的是模型的變異與泛化能力;資料量大小與標籤是否帶有主觀偏見沒有因果關係。 - (C):模型結構設計不當造成的是欠擬合或過擬合,屬於模型端問題;標籤偏差是資料端「真值本身失真」的問題。 - (D):特徵數量過多可能導致維度災難或過擬合,同樣與標籤是否被主觀汙染無關。 提示:Label Bias 的根源在標註過程:標籤由誰標註、依什麼標準標註,偏見即由該環節進入資料。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第38題

某公司導入 AI 履歷篩選系統,用於自動決定是否進入面試。模型對男性應徵者的面試通過率為 55%,對女性應徵者為 30%。在其他條件不變的情況下,工程師需評估模型是否符合統計均等(Statistical Parity)的公平性定義。下列何者最正確?

  1. A符合統計均等,因為模型未使用性別作為輸入特徵
  2. B符合統計均等,因為兩個族群皆有部分應徵者被錄取
  3. C不符合統計均等,因為不同群體的正向決策比例(通過率)存在明顯差異
  4. D不符合統計均等,因為女性族群的預測準確率較低
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 統計均等(Statistical Parity,亦稱 Demographic Parity)的定義是:各群體獲得「正向決策的比例」應相等,即 P(通過|男性) 應等於 P(通過|女性)。本題通過率 55% 對 30%,差距達 25 個百分點,明顯違反統計均等,故 (C) 正確。此指標只看結果比例,不問成因,也不管模型是否使用性別欄位。 【為何其他選項錯了?】 - (A):「未使用性別特徵」不代表統計均等成立:科系、工作年資等特徵可能是性別的代理變數,結果仍會失衡;且統計均等的判準是結果比例,不是輸入特徵清單。 - (B):統計均等要求各群體的正向決策比例相等,不是「比例不為零」;兩個族群皆有人錄取不構成符合的依據。 - (D):結論方向雖同,理由錯誤:準確率差異對應 Equalized Odds、校準等其他公平性定義;統計均等只看通過率,不看準確率。 提示:Statistical Parity 只檢驗各群體的正向決策比例是否相等;55% 對 30% 顯然不相等。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第39題

某銀行信貸模型上線後稽核發現,女性申請者中「實際具有還款能力卻被模型拒絕」的比例顯著高於男性,但法務限制不允許在推論階段使用性別欄位調整輸出。下列去偏策略何者在此限制下仍可執行?

  1. A訓練中(In-processing):在損失函數加入公平性懲罰項,降低不同群體的錯誤拒絕比例差異
  2. B前處理(Pre-processing):僅於訓練資料進行重新採樣,無法直接修正既有模型在推論階段的偏誤
  3. C後處理(Post-processing):依性別分組調整決策門檻,使不同群體的錯誤拒絕比例一致
  4. D改用人口統計均等指標(Demographic Parity),錯誤拒絕比例差異將自動消失
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 法務限制是「推論階段不得使用性別欄位調整輸出」。訓練中(In-processing)去偏是在訓練時於損失函數加入公平性懲罰項,例如縮小各群體錯誤拒絕率的差異;模型訓練完成後,推論時只讀取一般特徵,完全不需接觸性別欄位。此方案既遵守限制,又直接針對「實際具還款能力卻被拒絕」的錯誤拒絕率差異進行優化,是此限制下可執行的方案,故 (A) 正確。 【為何其他選項錯了?】 - (B):選項自述「僅於訓練資料重新採樣,無法直接修正既有模型在推論階段的偏誤」;重採樣後仍需重新訓練,且對錯誤拒絕率差異的矯正較間接,依選項描述即非可行解。 - (C):後處理依性別分組設定不同決策門檻,正是在推論階段使用性別欄位調整輸出,直接牴觸法務限制,無法執行。 - (D):更換衡量指標不會改變模型行為;群體間的錯誤拒絕率差異依然存在,不會因改用其他指標而消失。 提示:去偏三階段:前處理改資料、訓練中改損失函數、後處理改決策門檻;推論階段不得使用敏感屬性時,後處理方案首先排除。

相關節點