資料知識地圖 · 2. 資料來源

取樣偏差

Sampling Bias 風險評估

在互動地圖中開啟 回資料知識地圖

觀念教學

樣本挑錯,統計再漂亮都是白算。取樣偏差(Sampling Bias)是「資料還沒分析就已經歪掉」的隱形殺手。

核心觀念

當取樣機制讓某些群體被系統性地多收或少收,樣本就失去代表性(Representativeness),從樣本推論母體的結論全面失真。兩個必考型態:選擇偏差(Selection Bias)——收樣方式本身偏向特定族群;倖存者偏差(Survivorship Bias)——只看得到「活下來」的樣本,失敗者根本不在資料裡。

白話理解

二戰經典:分析返航轟炸機的彈孔,想幫中彈多的機翼加裝甲——錯。該加裝甲的是彈孔少的引擎,因為引擎中彈的飛機沒飛回來。商業版:只訪問現有會員做滿意度調查,永遠聽不到「用一次就走」的人的心聲。

常見偏差來源

  • 管道偏差:只發網路問卷,系統性排除不上網族群
  • 自願者偏差:願意受訪的人,本來就和沉默大眾不同
  • 倖存者偏差:只分析留存客戶、只研究成功企業
  • 時間偏差:只取促銷期資料,誤當日常
  • 防範:隨機抽樣、分層抽樣,再比對樣本與母體組成,量化偏差程度
🎯 口訣:先問「誰不在資料裡」,再開始分析。

iPAS 考點

情境判斷題:給取樣情境問屬於哪種偏差——「只調查回訪客戶」「只研究成功案例」是倖存者/選擇偏差的標配題幹。對策題選隨機抽樣、分層抽樣、檢查樣本代表性。最大陷阱:「加大樣本量可修正偏差」——偏掉的樣本收再多,依然是偏的。

應用場景

隨機抽樣分層抽樣偏差檢測

評估指標

代表性偏差程度

iPAS 歷屆考題詳解(1 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第28題

一家零售電商公司希望建立顧客流失預測模型,用以判斷哪些會員可能在三個月內不再消費。團隊以去年會員資料進行訓練,並僅採用「曾經購買三次以上」的活躍顧客紀錄作為樣本。模型上線後,對整體會員進行預測時,發現模型對於新註冊會員與低消費會員的預測準確率明顯偏低。下列何者為造成此現象最可能的原因?

  1. A特徵設計未排除與會員忠誠度高度相關的變數,導致特徵偏差(Feature Bias)
  2. B標記(Label)由人工標註,導致標籤偏差(Label Bias)
  3. C訓練樣本僅涵蓋高活躍顧客,造成取樣偏差(Sampling Bias)
  4. D模型未進行超參數調整,導致過擬合(Overfitting)
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 訓練樣本只選取「曾購買三次以上」的高活躍顧客,但模型上線後要對「全體會員」預測:訓練分佈與應用母體不一致,新註冊與低消費會員的行為模式從未出現在訓練資料中,模型對這些族群自然出現系統性失準。這是典型的取樣偏差(Sampling Bias):樣本無法代表目標母體,模型在未被涵蓋的族群上泛化能力不足,故 (C) 正確。 【為何其他選項錯了?】 - (A):特徵偏差指特徵設計不當、混入偏頗變數;本題的問題不在特徵設計,而在樣本根本未涵蓋低活躍族群。 - (B):流失與否的標籤由消費行為客觀定義,並非人工主觀標註,不構成標籤偏差。 - (D):過擬合的症狀是訓練集表現佳、新資料普遍表現差;本題是「特定族群」的系統性偏差,且成因明確是樣本選取範圍,而非超參數設定。 提示:訓練樣本的涵蓋範圍決定模型的適用範圍;樣本選取條件排除的族群,就是模型預測失準的族群。

相關節點