AI 方法論知識地圖 · 部署與維運

監控與維護

Data Drift, Concept Drift

在互動地圖中開啟 回AI 方法論知識地圖

觀念教學

模型上線不是畢業,是入伍 — 真實世界天天在變,沒人監控的模型會無聲無息地爛掉。

核心觀念

模型上線後效能會隨時間衰退(Model Decay),主因是「世界變了」,分兩種:資料漂移(Data Drift)是輸入特徵分布 P(X) 改變、但 X 對 Y 的關係不變(新客群湧入、季節變化);概念漂移(Concept Drift)是 X 與 Y 的關係 P(Y|X) 本身改變(疫情改變消費行為、詐欺手法翻新),俗稱「答案變了」,最難救。偵測到漂移,就要啟動重新訓練機制

白話理解

電商購買預測模型:上線半年後消費趨勢轉變,「長時間停留 = 高購買意願」這條規律不再成立 — 概念漂移(規則變了)。若只是檔期湧入大量新客、輸入分布改變但規律照舊 — 資料漂移(輸入變了)。

監控什麼、怎麼救

  • 四個監控面向:資料品質(缺失/異常)、預測分佈差異、模型效能指標(準確率/延遲)、流量與資源
  • PSI(族群穩定性指標):量化輸入或預測分布的偏移程度,超過警戒值就示警
  • 代理訊號:真實標籤常延遲取得,先用預測分布變化提早預警
  • 再訓練策略:定期排程(每週/月)或觸發式(偵測到漂移自動啟動),觸發式更省算力、更即時
  • 安全換模型:重訓後先 A/B 測試或影子模式驗證,漸進上線,保留一鍵回滾
  • Training-Serving Skew:訓練與線上服務的特徵處理不一致,離線分數對不上線上表現 — 前處理管線要共用同一套
🎯 口訣:輸入變了是資料漂移,答案變了是概念漂移;PSI 響了就該重練。

iPAS 考點

真題就是「情形甲/情形乙」分辨題:消費趨勢轉變、使用者行為與購買之間的關係改變 → 概念漂移;只是輸入分布改變、關係沒變 → 資料漂移。判斷心法:盯著「變的是 X,還是 X 到 Y 的規則」。延伸考再訓練時機(觸發式 vs 定期)與 A/B 測試的目的 — 離線指標好,不等於線上商業指標好。

📝 本節掛載 1 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

應用場景

偵測 Data Drift效能監控自動觸發重訓A/B Testing

評估指標

PSI (族群穩定性指標)預測分佈差異模型效能指標

iPAS 歷屆考題詳解(6 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

115年第二次初級AI應用規劃師第一科人工智慧基礎概論 第48題

某電商平台建置機器學習模型,用於預測用戶在瀏覽特定商品後的購買機率。 模型上線初期表現穩定,但維運團隊在定期審查中發現兩種不同情形: 情形甲:模型上線半年後恰逢消費趨勢轉變,過去高購買意願的用戶行為模式 (如長時間停留商品頁)不再是強烈的購買訊號,即便輸入特徵分布與訓練期相近,模型預測準確率仍明顯下降。 情形乙:平台新增了行動裝置端的入口,新用戶的年齡分布、裝置類型與使用時段特徵與原訓練資料差異顯著,導致模型對這批用戶的預測偏差增大。 下列哪一項最能正確對應兩種情形所屬的模型劣化類型?

  1. A甲為資料漂移(Data Drift)、乙為概念漂移(Concept Drift);
  2. B甲為概念漂移(Concept Drift)、乙為資料漂移(Data Drift);
  3. C甲為模型過擬合(Overfitting)、乙為資料漂移(Data Drift);
  4. D甲與乙均屬概念漂移(Concept Drift),因為兩者都導致模型預測準確率下降
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 判別漂移類型的依據是「什麼改變了」。情形甲:輸入特徵分布與訓練期相近,但特徵與購買意願之間的關係改變(長時間停留不再是強烈購買訊號),即 P(y|X) 改變,屬概念漂移(Concept Drift)。情形乙:新增行動裝置入口後,新用戶的年齡、裝置類型與使用時段等輸入特徵分布與訓練資料顯著不同,即 P(X) 改變,屬資料漂移(Data Drift)。故甲為概念漂移、乙為資料漂移。 【為何其他選項錯了?】 - (A):兩種漂移的對應完全顛倒;甲的特徵分布未變而關係改變,是概念漂移而非資料漂移,乙則相反。 - (C):過擬合是模型過度記憶訓練資料導致泛化不足,通常上線初期即表現不佳;甲是上線半年後因消費趨勢轉變而劣化,屬外在關係改變,而非模型訓練問題。 - (D):乙的成因是輸入特徵分布改變,屬資料漂移;僅以「準確率下降」將兩者一律歸為概念漂移,忽略了兩種劣化型態在成因上的本質差異。 提示:P(X) 變=資料漂移,P(y|X) 變=概念漂移;先看特徵分布是否改變,再看特徵與答案的關係是否改變。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第32題

某企業已將 AI模型部署於生產環境,為確保系統持續穩定運作,並能提前偵測模型效能可能衰退,技術團隊希望透過監控指標進行預警。下列哪一項監控指標最具預測效力,能提早發現模型效能下滑風險?

  1. A系統CPU 與記憶體使用率波動幅度
  2. B模型推論結果的置信度(Confidence)分佈變化趨勢
  3. CAPI平均回應時間與延遲百分位數變化
  4. D輸入特徵與訓練資料分布差異的 PSI(Population Stability Index)指數
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 模型效能衰退最常見的前兆,是線上輸入資料的分佈逐漸偏離訓練資料分佈。PSI(Population Stability Index)直接比較線上輸入特徵與訓練資料的分佈差異,能在預測效能尚未明顯惡化、真實標籤尚未回收之前偵測到漂移,屬於領先指標(Leading Indicator),對「提早發現效能下滑風險」的預測效力最強。 【為何其他選項錯了?】 - (A):CPU 與記憶體使用率反映基礎設施健康度;系統可以運行順暢而模型預測品質已劣化,兩者關聯薄弱,無法預警模型效能。 - (B):置信度分佈變化是有用的訊號,但屬模型輸出端的「症狀」,通常在漂移已影響模型後才顯現,預警時機晚於直接監測輸入分佈。 - (C):API 回應時間與延遲百分位數屬服務品質指標,衡量的是回應速度,與預測準確度無關。 提示:要提早偵測模型效能下滑,監控輸入分佈;PSI 是領先指標,置信度變化是落後症狀,系統資源指標與準確度無關。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第46題

某企業的AI 模型已部署於線上服務環境中,用於即時預測顧客流失機率。近期團隊注意到模型預測準確率逐漸下降,但系統運作正常且未出現錯誤訊息。經分析發現,近期輸入資料的分布與模型訓練資料相比出現顯著偏移。若要在 MLOps流程中主動偵測並預警此類問題,最應採用下列哪項措施?

  1. A建立即時的資料漂移(Data Drift)與概念漂移(Concept Drift)監測機制
  2. B將模型轉換為量化版本以降低延遲
  3. C增加模型超參數調整次數以強化適應性
  4. D使用固定隨機種子(Random Seed)確保訓練穩定
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 題幹特徵:預測準確率逐漸下降、系統運作正常且無錯誤訊息、輸入資料分布與訓練資料出現顯著偏移,是典型的漂移場景。MLOps 的正解是建立即時監測機制:以 PSI、KL 散度等統計量監測輸入特徵分佈變化(資料漂移, Data Drift),以滾動視窗效能追蹤監測特徵與標籤關係的改變(概念漂移, Concept Drift),並設定告警門檻,超標即觸發調查或自動重訓,將被動發現轉為主動預警。 【為何其他選項錯了?】 - (B):模型量化是壓縮與加速手段,可降低延遲與資源需求,但無法處理資料分布改變造成的準確率下滑。 - (C):增加超參數調整次數仍是在既有訓練資料上優化;輸入分佈偏移的根本原因未處理,調參無法恢復效能。 - (D):固定隨機種子僅確保實驗結果可重現,與偵測線上資料分佈變化無關。 提示:「準確率漸降+系統無錯誤+分布偏移」即指向漂移監測;量化、調參、固定隨機種子都不是偵測機制。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第42題

某保險公司將理賠金額預測模型正式部署上線,MLOps 團隊設計監控機制。三個月後模型整體均方根誤差(RMSE)無明顯變化,但業務單位反映高額理賠案件的預測誤差明顯增加。經分析,高額理賠案件僅佔約 5%的樣本比例,且未被監控機制及時發現。請問最可能的設計缺陷為何?

  1. A監控頻率不足,應由每日批次監控改為即時串流監控
  2. B高額理賠案件屬於長尾分布,難以透過監控指標偵測,因此無法透過監控機制發現問題
  3. CRMSE 無法有效反映高額誤差,應改以平均絕對誤差(MAE)作為主要監控指標
  4. D僅監控整體 RMSE,未針對不同理賠金額區間進行分群監控
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 高額理賠案件僅佔約 5% 樣本,其誤差惡化在整體 RMSE 中被 95% 一般案件的正常表現稀釋,整體指標因此無明顯變化,監控機制自然未能發現問題。設計缺陷在於只監控整體單一指標,未針對不同理賠金額區間進行分群監控(Segmented Monitoring)。正確作法是依理賠金額區間或其他關鍵業務維度分層,分別追蹤各子群的誤差指標與樣本分佈,並為重要子群單獨設定告警門檻,使樣本占比低但業務影響大的族群不致被平均值掩蓋。 【為何其他選項錯了?】 - (A):即時監控看的仍是同一個被稀釋的整體指標,提高監控頻率無法解決子群誤差被平均掩蓋的問題。 - (B):長尾分布的子群並非無法監控;分群監控即可偵測,問題出在監控設計,而非本質上不可偵測。 - (C):MAE 與 RMSE 同屬整體平均型指標,5% 子群的惡化同樣會被稀釋;且 RMSE 對大誤差比 MAE 更敏感,改用 MAE 反而更不易察覺高額案件的誤差。 提示:整體平均指標會掩蓋少數子群的劣化;高價值、低占比的族群(高額案件、VIP、罕見類別)應分群監控、單獨告警。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第48題

某銀行的信用卡風控模型已穩定上線一年,主要用於偵測盜刷交易提醒。近期在未對模型或特徵工程進行調整的情況下,系統觀察到深夜電商交易的核准率明顯上升,盜刷攔截率下降,但模型 AUC 幾乎維持不變,且交易金額、地區與裝置等特徵分布未出現明顯變化。進一步分析發現,疫情後使用者行為改變,使原本被視為高風險的交易型態逐漸轉為一般消費。下列何者最能敘述此現象的原因?

  1. A資料漂移(Data Drift),因輸入特徵分布發生變化
  2. B訓練與服務偏差(Training-Serving Skew),因線上與離線特徵處理不一致
  3. C概念漂移(Concept Drift),因特徵與目標標籤之間的關聯性改變
  4. D決策閾值偏移(Threshold Shift),因分類門檻設定不當導致預測偏差
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 逐一比對題幹條件:交易金額、地區、裝置等輸入特徵分布「未出現明顯變化」,排除資料漂移;模型與特徵工程皆未調整,排除訓練與服務偏差;決策閾值亦未更動。真正改變的是特徵與目標標籤之間的關聯:疫情後使用者行為改變,原本屬於高風險型態的深夜電商交易逐漸轉為一般消費,同樣的輸入 X 對應的標籤分布改變,即 P(y|X) 改變,正是概念漂移(Concept Drift)的定義。AUC 在既有驗證資料上維持不變,也與「模型未變、外在關係改變」的判斷一致。 【為何其他選項錯了?】 - (A):資料漂移指輸入分布 P(X) 改變;題幹已明述特徵分布無明顯變化,前提不成立。 - (B):訓練與服務偏差源於線上與離線特徵處理不一致,通常上線初期即會顯現;題幹明述未調整模型與特徵工程,且系統已穩定運行一年,不符。 - (D):決策閾值從未調整;現象成因是風險型態隨環境改變,而非分類門檻設定不當。 提示:P(X) 變=資料漂移,P(y|X) 變=概念漂移;特徵分布沒變而預測與現實脫節,即為概念漂移。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第49題

某零售電商平台已建立模型監控儀表板,用於追蹤線上推薦模型的運作狀態與效能表現。維運工程師需判斷哪些指標屬於「線上持續監控(Continuous Monitoring)」的範疇。下列指標中,哪一項最不適合在即時監控系統中追蹤,而應改由離線實驗追蹤系統管理?

  1. A訓練實驗中每個 Epoch 的學習率(Learning Rate)變化曲線與超參數(Hyperparameter)設定軌跡
  2. B線上推論 API的P50/P95/P99 回應延遲與每日請求量(RPS)趨勢
  3. C輸入特徵分佈的族群穩定性指數(Population Stability Index, PSI),偵測資料漂移
  4. D模型預測結果分佈(如 CTR)與定期回收的人工標註結果之對比
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 線上持續監控(Continuous Monitoring)追蹤的是服務當下的健康狀態與模型當下的表現:延遲、流量、錯誤率、資料漂移、預測品質等,需要即時或準即時更新並能觸發告警。訓練實驗中每個 Epoch 的學習率曲線與超參數設定軌跡,屬於模型訓練階段的歷史紀錄,訓練結束後即固定,對線上服務狀態不具即時資訊價值,應由離線實驗追蹤系統(如 MLflow、Weights & Biases)管理,供實驗重現與版本比較使用。 【為何其他選項錯了?】 - (B):P50/P95/P99 延遲與每日請求量是線上服務健康度的基本指標,屬即時監控的核心項目。 - (C):PSI 追蹤輸入特徵分佈變化以偵測資料漂移,是線上持續監控的標準項目。 - (D):模型預測分佈與定期回收人工標註結果的對比,是線上模型效能追蹤(含標籤延遲情境)的常規手段,屬持續監控範疇。 提示:訓練期的軌跡歸實驗追蹤系統(MLflow、W&B);上線後的延遲、漂移與預測品質才進即時監控儀表板。

相關節點