資料知識地圖 · 4. 資料清理

離群值偵測

Outlier / Anomaly Detection

在互動地圖中開啟 回資料知識地圖

觀念教學

一個離群值能把平均數拖到外太空。偵測它不難,難的是判斷:它是打錯的字,還是改變決策的訊號?

核心觀念

離群值(Outlier)是遠離多數樣本的觀測值。四種主流偵測法:Z-score——算「距離平均幾個標準差」,常以正負 3 個標準差為界,源自常態分布的 68-95-99.7 法則;IQR 法——低於 Q1 減 1.5 倍 IQR、高於 Q3 加 1.5 倍 IQR 即離群,箱形圖鬍鬚外的點就是;Isolation Forest——隨機切割資料,越容易被孤立的點越異常,適合高維度;DBSCAN——密度分群,落在低密度區、不屬於任何群的點視為異常。

白話理解

信用卡紀錄平均單筆一千五,突然一筆三十萬——是盜刷(有意義的極端值,要通報),還是多打兩個零(錯誤資料,要修正)?演算法只負責舉手,判斷是錯誤還是訊號永遠需要領域知識。

方法選用

  • 近似常態、單變數 → Z-score,簡單直觀
  • 偏態分布 → IQR 法,對極端值穩健、不被離群值本身帶歪
  • 高維度、多變數交互 → Isolation Forest
  • 群聚結構明顯、想順便挑出雜訊點 → DBSCAN
  • 評估看偵測率誤報率的平衡:太鬆漏放異常,太嚴天天狼來了
🎯 口訣:Z 看標準差、IQR 看箱形圖;先偵測、後判斷——錯誤修正、訊號保留。

iPAS 考點

計算題:給 Q1 與 Q3,先算 IQR 等於 Q3 減 Q1,再判斷界線——上界是 Q3 加 1.5 倍 IQR、下界是 Q1 減 1.5 倍 IQR,界外即離群。觀念題:「離群值應一律刪除」是錯的——詐欺偵測裡,離群值正是要找的目標。方法配對:高維資料選 Isolation Forest、基於密度的是 DBSCAN。

應用場景

Z-scoreIQR 法則Isolation Forest視覺化檢查

評估指標

偵測率誤報率

iPAS 歷屆考題詳解(4 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第10題

下列哪一種情境最適合應用異常偵測(Anomaly Detection)技術?

  1. A根據歷史銷售資料預測特定商品在旺季期間是否會出現供貨短缺,以提前調整庫存策略
  2. B透過信用風險模型預測顧客是否可能發生違約,以輔助核貸決策
  3. C即時分析金融交易資料流,偵測與平常交易行為明顯不同的可疑交易紀錄
  4. D監控線上服務平台的使用者登入次數,預測次日的登入量變化趨勢
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 異常偵測(Anomaly Detection)的任務是找出與大多數樣本行為模式明顯不同的個體,異常樣本通常極少、甚至沒有標籤,重點在衡量樣本偏離常態模式的程度。即時分析交易資料流、偵測與平常行為明顯不同的可疑交易(如盜刷、洗錢),正是異常偵測的典型應用場景。 【為何其他選項錯了?】 - (A):預測旺季是否缺貨屬於需求預測與時間序列預測問題,目標是估計未來數值,不是找出異常個體。 - (B):信用違約預測是典型的監督式二元分類,有歷史標籤(違約/未違約)可供學習,建模邏輯與異常偵測不同。 - (D):預測次日登入量屬於趨勢預測(迴歸或時間序列),關注整體數量的走勢,而非偵測單筆異常行為。 提示:「找出與多數樣本明顯不同的個體」對應異常偵測;「預測未來數值」對應預測模型。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第16題

某金融科技公司以 Z分數(Z-Score)監控交易金額異常狀況。若交易金額平均為新台幣 2,000 元,標準差為400 元,某筆交易金額為 3,200元,且公司以|Z| ≥ 3 判定為異常值(Outlier),下列判斷何者最為正確?

  1. A該筆交易的 Z分數為 3,應標記為異常值
  2. B該筆交易的 Z分數為 2.5,屬於合理變異範圍
  3. C該筆交易的 Z分數為 2,顯示模型標準差估計過高
  4. D該筆交易的 Z分數為 1.5,無須納入異常檢測
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 直接代入公式:Z = (3200 − 2000) ÷ 400 = 1200 ÷ 400 = 3。公司的判定規則為 |Z| ≥ 3 即為異常值,Z = 3 恰好落在門檻上,由於門檻包含等號,仍符合判定條件,因此該筆交易應標記為異常。本題的關鍵在於門檻含等號,「恰好等於 3」即已達標,不可誤判為未超過門檻。 【為何其他選項錯了?】 - (B):Z 值計算錯誤,(3200 − 2000) ÷ 400 = 3,並非 2.5;Z 值既然錯誤,「屬於合理變異範圍」的後續推論也不成立。 - (C):Z = 2 同樣是計算錯誤;且「標準差估計過高」是題目資訊無法支持的推論,題幹並未提供任何關於估計品質的線索。 - (D):Z = 1.5 仍是計算錯誤;若 Z 值確實只有 1.5 固然不構成異常,但該前提與正確計算結果不符。 提示:Z = (x − μ)/σ;判定異常時須確認門檻是「>」還是「≥」,邊界值正是本題的判斷重點。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第38題

某 IoT 平台接收工廠溫度感測器資料,發現在常態分佈(均值 25°C,標準差 2° C)的數萬筆紀錄中,出現數筆「999°C」的極端值,研判為感測器通訊錯誤(網路封包延遲導致數值溢位)所致,且該異常數值在實際情況下不可能發生。在進行模型訓練前的資料清洗階段,針對這類離群值,最適當的處理策略為何?

  1. A保留所有原始數值,並使用平均數(Mean)作為特徵輸入模型
  2. B對數據進行 Z-score 標準化,使數值落於約[-3, 3]範圍
  3. C將999°C 以獨熱編碼(One-Hot Encoding)轉為獨立類別特徵
  4. D刪除異常的 999°C 記錄,或以中位數(Median)進行填補
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 關鍵前提是 999°C 已確認為感測器通訊錯誤產生的數值,且在物理上不可能發生,屬於「錯誤值」而非「罕見但真實的極端觀測」。對已確認的錯誤值,正確處置是刪除該筆紀錄,或以中位數(Median)等穩健統計量填補;本題溫度資料呈常態分佈(均值 25°C),以中位數填補既穩健又不會引入離群影響,可避免錯誤資料污染後續模型訓練。 【為何其他選項錯了?】 - (A):平均數對離群值極不穩健,少數幾筆 999°C 就會把均值大幅拉離真實水準;保留錯誤值並以受污染的平均數作為特徵,等於把雜訊直接帶進模型。 - (B):Z-score 標準化只是線性縮放,不會消除離群值,999°C 標準化後仍是約 487 個標準差外的巨大離群點;且計算 Z-score 所用的均值與標準差本身已先被 999°C 污染。 - (C):One-Hot 編碼適用於真實存在的類別特徵;999°C 是通訊錯誤產生的錯誤值,不是有意義的類別,將其編為獨立特徵等於讓模型學習雜訊。 提示:先判斷離群值的性質:確認為錯誤值即刪除或以中位數填補;可能為真實極端值才考慮保留分析。標準化無法取代資料清洗。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第5題

某 AI 團隊在模型上線後,透過監控系統持續追蹤輸入特徵的分布變化,系統使用 Z- score(Z)作為異常判斷依據,並設定當|Z| ≥ 2時需觸發警示。假設該特徵近似常態分布,某次監控中發現某特徵值的 Z-score為-2,請問就實務判讀而言,此數值最可能代表什麼意義?

  1. A該特徵值低於該特徵歷史平均值 2個標準差
  2. B該特徵值高於該特徵歷史平均值 2個標準差
  3. C該特徵值等於該特徵的歷史平均值
  4. DZ-score為負值代表該數值位於母體分布之外,無法以常態分布解釋
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 Z-score 的定義為 Z = (觀測值 − 平均值) ÷ 標準差,衡量觀測值偏離平均值幾個標準差。Z = −2 代表該特徵值低於歷史平均值 2 個標準差:負號表示方向在平均值以下,絕對值 2 表示偏離幅度達兩個標準差。在 |Z| ≥ 2 的警示規則下,這筆資料屬於偏低方向的異常候選,常態分布下單尾機率約 2.3%,應觸發警示供人工檢視。 【為何其他選項錯了?】 - (B):方向判讀相反,高於平均值 2 個標準差對應的 Z-score 是 +2;Z-score 的正負號承載方向資訊,不可忽略。 - (C):特徵值等於平均值時 Z = 0;Z = −2 與「等於平均值」相差兩個標準差,並不相符。 - (D):Z-score 為負只代表觀測值低於平均值,完全在常態分布的解釋範圍內,常態分布中低於平均值的所有觀測值 Z 皆為負;「負值即位於母體分布之外」是錯誤理解。 提示:Z = (x − μ)/σ,正負號看方向、絕對值看偏離幾個標準差;|Z| ≥ 2 約落在分布最極端的 5% 之內。

相關節點