資料知識地圖 · 7. 特徵建模

樣本不平衡

重抽樣 / 權重 / 指標

在互動地圖中開啟 回資料知識地圖

觀念教學

詐欺偵測資料裡 99% 都是正常交易 — 模型只要一律猜「正常」就有 99% 準確率,卻一筆詐欺都抓不到。樣本不平衡(Class Imbalance)就是這種「準確率很高、模型沒用」的陷阱。

核心觀念

當一個類別遠多於另一個,模型會偏向多數類,少數類(往往才是你要抓的)被犧牲。解法分兩路:動資料(重抽樣)與動模型(類別權重);同時評估指標必須換掉 — Accuracy 在不平衡資料上會嚴重誤導。

白話理解

製造瑕疵檢測:一萬件產品只有 50 件瑕疵。全部猜「良品」,準確率 99.5%,漏檢率卻是 100%。這時該看的是 F1-Score(精確率與召回率的調和平均)與 PR-AUC,不是準確率。

處理工具箱

  • 過採樣(Over-sampling):增加少數類;SMOTE 在少數類樣本之間內插「合成」新樣本,比單純複製更不容易過擬合
  • 欠採樣(Under-sampling):丟掉部分多數類樣本,快速但可能損失資訊
  • 類別權重調整:訓練時把少數類的錯誤罰得更重,不動資料本身
  • 指標選擇:F1-Score、AUC-ROC;極端不平衡時 PR-AUC 比 ROC 更誠實
  • 重抽樣只能對訓練集做,測試集必須保持真實分佈
🎯 口訣:不平衡三動作 — 重抽樣、調權重、換指標;Accuracy 先丟掉。

iPAS 考點

經典題型:「準確率 99% 但少數類全漏」問診斷與對策 — 答樣本不平衡,改看 F1、AUC 等指標。方法題:SMOTE 屬於過採樣,而且是「合成」新樣本而非複製 — 選項把它說成欠採樣或資料清理,都是陷阱。

應用場景

SMOTERandomOverSamplerclass_weightFocal Loss

評估指標

F1-ScoreAUC-ROCPR-AUC

iPAS 歷屆考題詳解(7 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第12題

在處理分類問題時,若某一類樣本數明顯少於其他類別,研究人員可能採用隨機過採樣(Random Oversampling)以平衡資料比例,此方法最常造成下列哪一種問題?

  1. A增加過擬合風險
  2. B降低模型的收斂速度
  3. C減少資料總筆數數量
  4. D導致訓練資料欄位缺失
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 隨機過採樣是把少數類樣本原封不動地複製,直到類別比例平衡。同一批樣本重複出現多次,模型會反覆看到完全相同的資料點,容易記憶這些特定樣本的細節,而非學到少數類的一般化模式,因此過擬合(Overfitting)風險上升是它最常見的問題。SMOTE 之類的合成方法正是為了緩解此問題而提出。 【為何其他選項錯了?】 - (B):過採樣增加了訓練樣本數,訓練時間可能拉長,但「收斂速度降低」不是它的典型副作用,更不是最常見的問題。 - (C):過採樣是複製樣本,資料總筆數只會增加不會減少;會減少筆數的是欠採樣(Undersampling)。 - (D):複製既有樣本不會產生缺失欄位,資料完整性不受影響。 提示:隨機過採樣=重複複製少數類,重複越多越容易被模型記憶,導致過擬合;欠採樣=丟棄多數類,造成資訊損失。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第37題

若開發一個用於罕見疾病自動診斷的分類模型,目前資料集中確診樣本僅佔不到1%,且因為標註成本高,短期內無法取得更多資料。在此情況下,若希望提升模型對少數類的偵測能力,同時避免過擬合,下列哪一種策略最為合理?

  1. A對少數類進行隨機過採樣(Random Oversampling)
  2. B對多數類進行欠採樣(Random Undersampling)
  3. C使用SMOTE(Synthetic Minority Over-sampling Technique)生成合成少數類樣本後再訓練分類模型
  4. D僅使用現有資料調整模型決策閾值(Decision Threshold)以提升召回率
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 確診樣本不到 1% 且短期無法再蒐集,若用隨機過採樣直接複製,模型會過度記憶那一小批重複樣本而過擬合;SMOTE 改在少數類樣本與其近鄰之間以內插方式生成新的合成樣本,增加少數類的多樣性而非重複性,能在提升少數類偵測能力的同時,比單純複製更能抑制過擬合,正符合題目「提升偵測能力+避免過擬合」的雙重要求。 【為何其他選項錯了?】 - (A):隨機過採樣僅是複製既有樣本,少數類樣本被重複記憶,過擬合風險最高,正是題目要求避免的情況。 - (B):欠採樣需丟棄大量多數類樣本,在資料本就珍貴的醫療場景會損失多數類的重要模式,不利模型學習。 - (D):調整決策閾值只是移動查全率與查準率的取捨點,可拉高召回率,但模型並未學到更多少數類特徵,對偵測能力的本質提升有限。 提示:極度不平衡且無法增補資料時採用 SMOTE 合成內插;複製增加重複性,合成增加多樣性。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第19題

某醫療機構開發疾病早期偵測模型,正樣本(確診病例)僅佔 3%。在模型訓練與評估過程中,下列哪一種作法最不適合用於提升對少數類病例的預測能力?

  1. A使用SMOTE 過採樣
  2. B調整類別權重
  3. C使用準確率(Accuracy)作為評估指標;
  4. D欠採樣多數類(Undersampling the majority class)
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 正樣本僅佔 3% 的極不平衡資料中,模型只要全部預測「陰性」就能得到 97% 的準確率;數字看似良好,實際上一個病例都沒有偵測到,對疾病早期偵測毫無價值。因此準確率(Accuracy)在此情境是最不適合的評估指標,應改用召回率、精確率、F1、AUC-PR 等對少數類敏感的指標。本題問「最不適合」的作法,故選 (C)。 【為何其他選項錯了?】 - (A):SMOTE 以插值方式合成少數類樣本,平衡訓練分布,是處理不平衡資料的常用且適合的手段,故非本題答案。 - (B):調整類別權重使模型漏判病例時付出更大的損失代價,直接提升對少數類的重視程度,屬適合的作法。 - (D):欠採樣多數類同樣能平衡類別比例,雖會捨棄部分多數類資料,但仍是合理可行的作法之一。 提示:極不平衡資料下 Accuracy 會被多數類推高而失去鑑別力;評估少數類請改看 Recall、F1、AUC-PR。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第37題

某製造廠開發產線瑕疵檢測模型時,資料集存在嚴重類別不平衡問題,其中良品約占 99%,瑕疵品僅占 1%。若直接使用原始資料進行訓練,模型容易偏向預測多數類別(良品),導致對少數類別(瑕疵品)辨識能力不足。在不調整模型架構與學習演算法的前提下,僅透過資料前處理方式改善此問題,下列何者最適當?

  1. A使用 SMOTE等過採樣方法進行少數類別擴增
  2. B加入 L1/L2 正則化(Regularization)以防止過擬合
  3. C大幅增加深度神經網路的層數,以強化特徵萃取能力
  4. D複製更多良品數據,以進一步提升模型的準確率(Accuracy)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 題目限定「不動模型架構與學習演算法、僅靠資料前處理」。針對 99:1 的極度不平衡,SMOTE(Synthetic Minority Over-sampling Technique)在少數類樣本與其近鄰之間做插值,合成新的瑕疵樣本,把類別分佈拉向平衡,讓模型在訓練時獲得足夠的少數類訊號,改善對瑕疵品的辨識;它純粹作用在資料層,完全符合題目前提。同屬資料層的作法還有對多數類的欠採樣。 【為何其他選項錯了?】 - (B):L1/L2 正則化是修改損失函數的演算法層手段,且其目的是防止過擬合,並非處理類別不平衡,亦違反「僅資料前處理」的前提。 - (C):加深網路屬於模型架構調整,違反題目前提;且資料不平衡時,加深網路仍會傾向全部預測多數類,問題並未解決。 - (D):複製更多良品是對多數類再擴增,使不平衡更加嚴重;模型全判良品的準確率虛高,對瑕疵品的辨識能力反而更差。 提示:不平衡的資料層解法:少數類過採樣(SMOTE)、多數類欠採樣;評估指標同時改用 Recall/F1 更完整。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第20題

某電信公司的 AI 反詐欺模型在正常交易佔 99.5%、詐欺交易僅佔 0.5%的類別嚴重不平衡資料集上訓練。若工程師僅以整體準確率(Accuracy)作為模型選擇的唯一指標,最可能產生什麼嚴重問題?

  1. A模型訓練時間會因類別不平衡而大幅增加
  2. B一個永遠預測為正常交易的模型即可達到 99.5%準確率,但對詐欺交易的召回率為0%,使準確率失去判別能力
  3. C類別不平衡會導致模型訓練過程出現梯度爆炸
  4. D類別不平衡會直接導致模型過擬合,使測試集表現下降
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 當正常交易占 99.5% 時,一個永遠預測「正常」的模型準確率就有 99.5%,但它對詐欺的召回率是 0%,一筆詐欺都無法攔截。Accuracy 在極度不平衡資料上會被多數類推高,失去鑑別模型好壞的能力;應改看少數類的 Recall、Precision、F1、PR-AUC 等指標。這是反詐欺、罕病篩檢等場景評估設計的基本原則。 【為何其他選項錯了?】 - (A):訓練時間主要取決於資料量與模型複雜度,類別比例本身不會使訓練時間大幅增加。 - (C):梯度爆炸是深度網路中梯度連乘放大的數值問題,成因在網路結構、初始化與學習率,與類別不平衡沒有因果關係。 - (D):不平衡本身不必然導致過擬合;它造成的是模型偏向多數類、少數類學習不足,而過擬合指訓練集與測試集表現落差,兩者是不同的問題。 提示:不平衡資料不可只看 Accuracy;檢視混淆矩陣、Recall 與 PR-AUC,才能確認少數類是否被正確偵測。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第25題

某金融機構導入 AI模型進行信用卡詐欺偵測,由於詐欺交易極為稀少(約佔全部交易0.3%),因此模型在測試階段得到 99.6%準確率(Accuracy),被初步認定為「高效模型」。然而在實際上線後,風控部門發現模型幾乎無法攔截詐欺交易,且大量誤判正常交易。經進一步檢查,發現資料極度不平衡,但模型仍以 Accuracy 作為主要優化與評估指標。在此情境下,下列何者最適當的改善方向?

  1. A持續優化 Accuracy 指標以提升整體分類正確率
  2. B改用精確率(Precision)作為主要評估指標以降低誤報
  3. C引入Class Weight 或Cost-sensitive Learning 調整損失函數
  4. D移除少數類資料以提升模型穩定性與收斂速度
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 問題根源是:0.3% 的極度不平衡下,訓練與評估都以 Accuracy 為準,使「全判正常」被視為好成績。治本方向是讓訓練目標本身重視少數類:引入 Class Weight 或成本敏感學習(Cost-sensitive Learning),在損失函數中調高「漏判詐欺」的代價,迫使模型確實學習少數類的模式;再搭配 Recall、F1、PR-AUC 等指標評估。這是從優化目標著手的正規改善方向。 【為何其他選項錯了?】 - (A):Accuracy 在此場景已證明無法反映攔截能力,繼續以它為優化目標,只會持續獎勵全判正常的模型行為。 - (B):只追求 Precision 會使模型僅在極有把握時才判定詐欺,誤報減少但漏判增加;風控場景漏抓詐欺的代價通常遠高於誤報,方向不正確。 - (D):詐欺樣本僅佔 0.3%,移除少數類資料等於刪除偵測目標本身,模型將完全失去辨識詐欺的能力,是最不可行的作法。 提示:不平衡改善三路線:調整權重或成本敏感學習、重抽樣、改用合適指標;少數類樣本不可刪除。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第32題

某銀行建置貸款違約預測模型,資料共 50,000 筆,其中違約樣本僅 800 筆(佔 1.6%)。在模型建置流程中,先對整體資料使用 SMOTE 對少數類進行過採樣,之後再進行訓練/測試切分,並訓練輕量梯度提升機(LightGBM)模型,並以 AUC-ROC 評估模型表現。模型在測試集的AUC-ROC 達到0.91,團隊認為模型表現良好,準備上線部署。在模型審查過程中,下列何者為使測試集評估結果失真的主要原因?

  1. ASMOTE 不適合用於金融違約預測場景,此類高風險業務應一律採用 class_weight 調整損失函數,而非對資料本身進行過採樣
  2. BSMOTE 的過採樣操作在訓練/測試切分之前即對全體資料執行,導致合成樣本資訊洩漏至測試集,使 AUC-ROC 0.91 虛高而不可信
  3. CAUC-ROC 在1.6%的不平衡場景下過度樂觀,應改用 PR-AUC 作為評估指標,其餘流程均正確
  4. DLightGBM 本身已內建處理不平衡的機制,與 SMOTE 同時使用會造成少數類過度補償,導致過多誤判
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 關鍵錯誤在流程順序:SMOTE 在「切分之前」對全體資料執行。SMOTE 以少數類樣本間的內插生成合成樣本,先過採樣再切分,會使由同一筆原始樣本合成出來的鄰近點分別落入訓練集與測試集;測試集中因此存在與訓練樣本高度相似的合成點,評估等同於用近乎已見過的資料計分,AUC-ROC 0.91 因而虛高失真。正確做法是先切分,SMOTE 只對訓練集(或交叉驗證中的訓練折)執行,測試集始終保持原始分布。 【為何其他選項錯了?】 - (A):SMOTE 用於金融違約並非禁忌,class_weight 也只是另一種可行手段;「一律採用」的說法過於絕對,且未指出本題真正的洩漏問題。 - (C):1.6% 不平衡下 PR-AUC 確實比 AUC-ROC 更能反映少數類表現,這是合理建議;但「其餘流程均正確」的說法忽略了切分前執行 SMOTE 的洩漏錯誤。 - (D):LightGBM 的不平衡處理參數與 SMOTE 並用是否過度補償,屬於可調校的超參數議題,不是評估結果失真的原因;失真根源在資訊洩漏。 提示:重抽樣(SMOTE、過採樣、欠採樣)一律在切分之後、只作用於訓練集;測試集必須維持真實分布。

相關節點