資料知識地圖 · 8. 交付監控

Data Drift

資料漂移監控

在互動地圖中開啟 回資料知識地圖

觀念教學

模型上線那一天,世界就開始變:疫情改變消費、新客群湧入、上游系統改欄位。模型沒壞,是餵它的資料變了 — 這就是漂移。

核心觀念

兩種漂移要分清楚。Data Drift(資料漂移):輸入資料的分佈改變,例如客群年齡結構整體位移 — 進料變了,規則還在。Concept Drift(概念漂移):輸入與目標之間的關係改變,例如同樣的消費行為,疫情後代表的風險不同了 — 規則本身變了。兩者都會導致效能衰退

白話理解

金融風控模型用疫情前資料訓練:疫情後申貸客群大幅改變(Data Drift),而且「餐飲業等於穩定收入」這條規則失效(Concept Drift)。模型分數照發,預測力卻已悄悄崩壞 — 沒有監控,你不會知道。

監控與應對

  • PSI(群體穩定度指標):比較上線後與訓練時的分佈差異,是業界最常用的漂移量尺
  • KS 統計量:衡量兩個累積分佈的最大差距,同樣用於偵測分佈位移
  • 效能衰退監控:真實標籤常常延遲才拿得到,所以先盯輸入端漂移,當成早期警報
  • 應對機制:漂移超過門檻就觸發重新訓練;若是上游欄位或格式改變,回頭更新 ETL
  • 自動化:定期計算 PSI 與 KS、超標自動告警,不靠人肉巡檢
🎯 口訣:資料漂移是「進料變了」,概念漂移是「規則變了」— 前者看分佈,後者看關係。

iPAS 考點

必考兩種漂移的區分:輸入分佈改變是 Data Drift;特徵與目標的關係改變是 Concept Drift。情境題「模型上線後準確率逐月下滑」— 答案方向是漂移監控、定期重訓與更新 ETL;陷阱選項是「程式有 bug,重寫模型程式」。

應用場景

PSIKS TestEvidentlyWhylogs

評估指標

PSIKS 統計量效能衰退

iPAS 歷屆考題詳解(1 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第22題

某電商平台開發的顧客流失預測模型在上線數月後,預測準確率明顯下降。專案團隊懷疑顧客行為模式改變,導致模型輸入特徵的分佈與原始訓練資料不同,出現典型的資料漂移(Data Drift)問題。為了偵測並確認資料分佈是否發生變化,下列哪一種作法最合適?

  1. A定期重新訓練模型以應對外部變化
  2. B提升模型複雜度以捕捉更多資料變異性
  3. C增加測試資料量以提高評估準確度
  4. D計算輸入特徵分佈間的 KL散度(KL Divergence)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 題目問的是「偵測並確認資料分佈是否發生變化」。KL 散度(KL Divergence)可量化訓練資料與近期輸入資料兩個分佈之間的差異,數值越大代表偏移越明顯,搭配門檻值即可確認資料漂移(Data Drift)是否發生,是漂移檢測的標準統計工具;同類指標還有 PSI 與 KS 檢定。 【為何其他選項錯了?】 - (A):定期重新訓練是「因應」漂移的處置,不是「偵測」;未經偵測就重訓,無法確認漂移是否存在,也難以定位問題來源。 - (B):提升模型複雜度是修改模型,無助於判斷輸入分佈是否改變,且可能引入過擬合。 - (C):增加測試資料量能使效能評估更穩定,但評估的是模型表現,並非直接量測兩個分佈之間的差異,無法回答題目的問題。 提示:偵測資料漂移使用分佈距離指標:KL 散度、PSI、KS 檢定。

相關節點