資料知識地圖 · 2. 資料來源
取樣偏差
Sampling Bias 風險評估
觀念教學
樣本挑錯,統計再漂亮都是白算。取樣偏差(Sampling Bias)是「資料還沒分析就已經歪掉」的隱形殺手。
核心觀念
當取樣機制讓某些群體被系統性地多收或少收,樣本就失去代表性(Representativeness),從樣本推論母體的結論全面失真。兩個必考型態:選擇偏差(Selection Bias)——收樣方式本身偏向特定族群;倖存者偏差(Survivorship Bias)——只看得到「活下來」的樣本,失敗者根本不在資料裡。
白話理解
二戰經典:分析返航轟炸機的彈孔,想幫中彈多的機翼加裝甲——錯。該加裝甲的是彈孔少的引擎,因為引擎中彈的飛機沒飛回來。商業版:只訪問現有會員做滿意度調查,永遠聽不到「用一次就走」的人的心聲。
常見偏差來源
- 管道偏差:只發網路問卷,系統性排除不上網族群
- 自願者偏差:願意受訪的人,本來就和沉默大眾不同
- 倖存者偏差:只分析留存客戶、只研究成功企業
- 時間偏差:只取促銷期資料,誤當日常
- 防範:隨機抽樣、分層抽樣,再比對樣本與母體組成,量化偏差程度
🎯 口訣:先問「誰不在資料裡」,再開始分析。
iPAS 考點
情境判斷題:給取樣情境問屬於哪種偏差——「只調查回訪客戶」「只研究成功案例」是倖存者/選擇偏差的標配題幹。對策題選隨機抽樣、分層抽樣、檢查樣本代表性。最大陷阱:「加大樣本量可修正偏差」——偏掉的樣本收再多,依然是偏的。
應用場景
評估指標
iPAS 歷屆考題詳解(1 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
一家零售電商公司希望建立顧客流失預測模型,用以判斷哪些會員可能在三個月內不再消費。團隊以去年會員資料進行訓練,並僅採用「曾經購買三次以上」的活躍顧客紀錄作為樣本。模型上線後,對整體會員進行預測時,發現模型對於新註冊會員與低消費會員的預測準確率明顯偏低。下列何者為造成此現象最可能的原因?
- A特徵設計未排除與會員忠誠度高度相關的變數,導致特徵偏差(Feature Bias)
- B標記(Label)由人工標註,導致標籤偏差(Label Bias)
- C訓練樣本僅涵蓋高活躍顧客,造成取樣偏差(Sampling Bias)
- D模型未進行超參數調整,導致過擬合(Overfitting)
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
訓練樣本只選取「曾購買三次以上」的高活躍顧客,但模型上線後要對「全體會員」預測:訓練分佈與應用母體不一致,新註冊與低消費會員的行為模式從未出現在訓練資料中,模型對這些族群自然出現系統性失準。這是典型的取樣偏差(Sampling Bias):樣本無法代表目標母體,模型在未被涵蓋的族群上泛化能力不足,故 (C) 正確。
【為何其他選項錯了?】
- (A):特徵偏差指特徵設計不當、混入偏頗變數;本題的問題不在特徵設計,而在樣本根本未涵蓋低活躍族群。
- (B):流失與否的標籤由消費行為客觀定義,並非人工主觀標註,不構成標籤偏差。
- (D):過擬合的症狀是訓練集表現佳、新資料普遍表現差;本題是「特定族群」的系統性偏差,且成因明確是樣本選取範圍,而非超參數設定。
提示:訓練樣本的涵蓋範圍決定模型的適用範圍;樣本選取條件排除的族群,就是模型預測失準的族群。