資料知識地圖 · 4. 資料清理
離群值偵測
Outlier / Anomaly Detection
觀念教學
一個離群值能把平均數拖到外太空。偵測它不難,難的是判斷:它是打錯的字,還是改變決策的訊號?
核心觀念
離群值(Outlier)是遠離多數樣本的觀測值。四種主流偵測法:Z-score——算「距離平均幾個標準差」,常以正負 3 個標準差為界,源自常態分布的 68-95-99.7 法則;IQR 法——低於 Q1 減 1.5 倍 IQR、高於 Q3 加 1.5 倍 IQR 即離群,箱形圖鬍鬚外的點就是;Isolation Forest——隨機切割資料,越容易被孤立的點越異常,適合高維度;DBSCAN——密度分群,落在低密度區、不屬於任何群的點視為異常。
白話理解
信用卡紀錄平均單筆一千五,突然一筆三十萬——是盜刷(有意義的極端值,要通報),還是多打兩個零(錯誤資料,要修正)?演算法只負責舉手,判斷是錯誤還是訊號永遠需要領域知識。
方法選用
- 近似常態、單變數 → Z-score,簡單直觀
- 偏態分布 → IQR 法,對極端值穩健、不被離群值本身帶歪
- 高維度、多變數交互 → Isolation Forest
- 群聚結構明顯、想順便挑出雜訊點 → DBSCAN
- 評估看偵測率與誤報率的平衡:太鬆漏放異常,太嚴天天狼來了
🎯 口訣:Z 看標準差、IQR 看箱形圖;先偵測、後判斷——錯誤修正、訊號保留。
iPAS 考點
計算題:給 Q1 與 Q3,先算 IQR 等於 Q3 減 Q1,再判斷界線——上界是 Q3 加 1.5 倍 IQR、下界是 Q1 減 1.5 倍 IQR,界外即離群。觀念題:「離群值應一律刪除」是錯的——詐欺偵測裡,離群值正是要找的目標。方法配對:高維資料選 Isolation Forest、基於密度的是 DBSCAN。
應用場景
評估指標
iPAS 歷屆考題詳解(4 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
下列哪一種情境最適合應用異常偵測(Anomaly Detection)技術?
- A根據歷史銷售資料預測特定商品在旺季期間是否會出現供貨短缺,以提前調整庫存策略
- B透過信用風險模型預測顧客是否可能發生違約,以輔助核貸決策
- C即時分析金融交易資料流,偵測與平常交易行為明顯不同的可疑交易紀錄
- D監控線上服務平台的使用者登入次數,預測次日的登入量變化趨勢
看正解與逐選項詳解
正解:C
某金融科技公司以 Z分數(Z-Score)監控交易金額異常狀況。若交易金額平均為新台幣 2,000 元,標準差為400 元,某筆交易金額為 3,200元,且公司以|Z| ≥ 3 判定為異常值(Outlier),下列判斷何者最為正確?
- A該筆交易的 Z分數為 3,應標記為異常值
- B該筆交易的 Z分數為 2.5,屬於合理變異範圍
- C該筆交易的 Z分數為 2,顯示模型標準差估計過高
- D該筆交易的 Z分數為 1.5,無須納入異常檢測
看正解與逐選項詳解
正解:A
某 IoT 平台接收工廠溫度感測器資料,發現在常態分佈(均值 25°C,標準差 2° C)的數萬筆紀錄中,出現數筆「999°C」的極端值,研判為感測器通訊錯誤(網路封包延遲導致數值溢位)所致,且該異常數值在實際情況下不可能發生。在進行模型訓練前的資料清洗階段,針對這類離群值,最適當的處理策略為何?
- A保留所有原始數值,並使用平均數(Mean)作為特徵輸入模型
- B對數據進行 Z-score 標準化,使數值落於約[-3, 3]範圍
- C將999°C 以獨熱編碼(One-Hot Encoding)轉為獨立類別特徵
- D刪除異常的 999°C 記錄,或以中位數(Median)進行填補
看正解與逐選項詳解
正解:D
某 AI 團隊在模型上線後,透過監控系統持續追蹤輸入特徵的分布變化,系統使用 Z- score(Z)作為異常判斷依據,並設定當|Z| ≥ 2時需觸發警示。假設該特徵近似常態分布,某次監控中發現某特徵值的 Z-score為-2,請問就實務判讀而言,此數值最可能代表什麼意義?
- A該特徵值低於該特徵歷史平均值 2個標準差
- B該特徵值高於該特徵歷史平均值 2個標準差
- C該特徵值等於該特徵的歷史平均值
- DZ-score為負值代表該數值位於母體分布之外,無法以常態分布解釋
看正解與逐選項詳解
正解:A