觀念教學
垃圾進垃圾出 (GIGO)。資料清洗包含:遺失值處理 (Imputation)、異常值偵測、重複資料刪除、不平衡資料處理 (Upsampling/Downsampling/SMOTE)。
資料增強(Data Augmentation)
當資料量不夠時,透過對現有資料做變換來「生出」更多訓練樣本,提升模型泛化能力。
表格資料
- SMOTE:對少數類別合成新樣本(插值法)
- 加入隨機噪音:微幅擾動數值特徵
影像資料(最常見)
- 幾何變換:旋轉、翻轉、裁切、縮放
- 色彩變換:亮度、對比、飽和度調整
- 進階:Mixup(混合兩張圖)、CutMix(剪貼拼接)、CutOut(隨機遮擋)
文字資料
- 同義詞替換、隨機插入/刪除/交換
- 回譯(Back Translation):翻成外語再翻回來
注意:增強要合理,亂增強反而引入噪音(例如把數字 6 旋轉 180° 變成 9)
iPAS 歷屆考題詳解(7 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
在自然語言處理任務中,為了減少訓練語料中偏見對模型的影響,下列哪種資料處理策略屬於常見的「資料去偏(Data Debiasing)」做法?
- A讓模型在訓練時隨機替換輸出,以抵消資料中存在的系統性偏差
- B增加模型的參數量,依賴更大的模型自動消除原始資料中的偏見
- C調整或擴充訓練語料,使不同群體或類型資料的比例更加平衡,避免模型過度偏向出現頻率高的類別
- D對訓練資料施加額外正則化或噪音,使模型在學習過程中對偏見敏感度降低
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
資料去偏(Data Debiasing)是從資料層面降低偏見影響的處理策略。訓練語料常見的偏見型態,是特定群體或類型的資料佔比懸殊,使模型過度偏向出現頻率高的類別。透過調整或擴充語料,例如對少數群體過採樣、對多數群體欠採樣,或補充新蒐集與合成資料,使不同群體與類型的比例更平衡,能從源頭降低模型學到偏見的機率,是常見且直接的資料去偏做法,故 (C) 正確。
【為何其他選項錯了?】
- (A):訓練時隨機替換輸出只是加入隨機雜訊,無法針對性抵消資料中的系統性偏差,反而破壞模型學習正確模式的能力。
- (B):增加參數量不會消除資料中的偏見;訓練資料的偏差會隨模型能力一併被學習,更大的模型甚至能更精確地重現偏見。
- (D):正則化與加入噪音是防止過擬合的手段,會全面降低模型對訊號的敏感度,無法選擇性削弱偏見,不屬於資料去偏方法。
提示:題目限定「資料處理策略」;答案應落在調整語料分布本身,而非更動模型結構或訓練技巧。
某大型零售企業準備將商品推薦模型上線,專案團隊在檢視訓練資料時,發現部分商品類別(例如高價商品)樣本數量極少,而多數樣本集中於低價商品。若此不平衡問題未妥善處理,下列何種狀況最可能在實際推薦結果中發生?
- A模型在預測時傾向輸出稀有類別,導致雖能捕捉到少數樣本,但精確率(Precision)顯著下降
- B模型由於類別分布不均,難以建立有效的線性分離邊界,進而無法收斂
- C模型過度聚焦於稀有類別樣本,導致對多數類別的預測能力下降,整體效能受損
- D模型學到的決策邊界主要由多數類別主導,忽視了稀有類別,造成該類別的召回率(Recall)大幅降低
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
訓練資料類別不平衡時,以整體損失最小化為目標的模型,其決策邊界會被樣本數量佔優的多數類別(低價商品)主導;稀有類別(高價商品)因樣本稀少、對整體損失的貢獻小而被忽視。結果是模型對稀有類別的辨識能力不足,許多應被辨識的高價商品樣本遭漏判,該類別的召回率(Recall)大幅降低,推薦結果集中於多數類別,故 (D) 為最可能發生的狀況。
【為何其他選項錯了?】
- (A):類別不平衡下模型傾向輸出「多數」類別而非稀有類別;「傾向輸出稀有類別」的前提不成立。
- (B):類別不平衡不會使模型無法收斂;模型仍會收斂,只是收斂到偏向多數類別的解,問題在預測偏差而非收斂性。
- (C):方向恰好相反;模型是聚焦多數類別、忽視稀有類別,而非過度聚焦稀有樣本。
提示:記住不平衡資料的典型病徵:決策邊界被多數類別主導,稀有類別召回率大幅下降,整體準確率卻可能依然好看。
某醫院研究團隊蒐集了大量病患的「收縮壓」數據,經檢驗後顯示此數值大致呈現常態分布。在進行後續模型分析前,研究人員希望妥善處理可能存在的極端血壓數值。下列哪一種做法最為合適?
- A將所有極端偏高或偏低的血壓數據直接刪除,以保留最具代表性的病患樣本
- B使用對數轉換(Log Transformation),將數據壓縮至更接近常態以降低極端值的影響
- C透過 Z 分數(Z-score)或標準差範圍檢測異常值,並依研究需求決定是否調整或移除
- D將檢測到的離群值以 Label Encoding 編碼,轉換為序號標籤以避免影響原始分布
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
題幹指出收縮壓資料大致呈常態分布,要處理的是可能存在的極端數值。近似常態的資料,標準做法是以 Z 分數(Z-score)或標準差範圍(如平均值正負三個標準差)檢測異常值,再結合研究需求與臨床意義判斷處置方式:屬量測錯誤者修正或移除,屬真實生理極端值者可考慮保留或調整。先客觀偵測、再依脈絡決定,兼顧資料品質與樣本代表性,故 (C) 最為合適。
【為何其他選項錯了?】
- (A):不經檢視即刪除所有極端血壓,可能移除具臨床意義的真實個案(如重度高血壓、休克前兆),使模型失去對高風險族群的辨識能力,並造成樣本偏差。
- (B):對數轉換用於矯正右偏分布;資料已近似常態,再做轉換反而扭曲原有分布,且轉換屬尺度調整,並非異常值的檢測與處置程序。
- (D):Label Encoding 是類別變數的編碼方法,將連續血壓數值轉為序號標籤會摧毀數值的量化意義,完全不適用於離群值處理。
提示:近似常態的資料以 Z-score 檢測離群值;處理原則是「先偵測、後判斷」,直接刪除或轉換都跳過了判斷步驟。
下列何者不屬於資料整合(Data Integration)的主要目的?
- A統一不同來源資料的格式與欄位定義,以確保分析一致性
- B識別並處理重複資料,避免影響模型訓練結果
- C整併多來源資料,以提升資料完整性與應用價值
- D依資料保存政策延長原始資料留存期限,以利未來可能的分析需求
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
資料整合(Data Integration)的目的,是將分散於不同來源的資料經清理、轉換後合併為一致且可用的資料集,核心工作包括統一格式與欄位定義、識別並處理重複資料、整併多來源資料以提升完整性與應用價值。選項 (D) 的資料保存期限管理屬資料生命週期與保存政策議題,歸屬資料治理(Data Governance)範疇,與「整理、合併」的整合目的無關,故 (D) 為本題答案。
【名詞白話語典】
- 資料整合(Data Integration):將來自多個來源的資料進行清理、轉換並合併,使其一致且可用的過程。
【為何其他選項錯了?】
- (A):統一不同來源資料的格式與欄位定義是整合的基礎工作,確保各系統的對應欄位能正確銜接,分析結果才具一致性。
- (B):識別並處理重複資料是整合的必要步驟,避免同一實體被重複計算,影響分析與模型訓練品質。
- (C):整併多來源資料以提升完整性與應用價值,正是資料整合最直接的目的。
提示:題目問「不屬於」;與「清理、統一、合併」無關的管理性事項(如保存期限),即為答案。
某保險公司建立 AI 理賠金額預測模型。歷史理賠資料經檢定後呈近似常態分佈, 但仍存在少數極端高額案件。資料科學團隊在不破壞整體分佈特性的前提下,規 劃進行離群值處理。下列何者最不適當?
- A依統計準則(如 Z-score 或IQR)評估後,再決定是否調整或處理極端值
- B採用截尾(Trimming)處理極端值,以提升模型穩定性
- C使用 One-hot 編碼(One-hot Encoding)將離群值轉換為類別特徵以改善數值穩 定性
- D結合領域知識評估其合理性,再決定保留或修正
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
理賠金額為連續數值變數,離群值處理應在數值尺度上進行。One-hot 編碼(One-hot Encoding)是將「類別型」變數展開為 0/1 向量的技術,並不適用於連續金額;把極端數值當成獨立類別編碼,既喪失金額的量化意義,也無法降低極端值對模型的影響,更與題幹「不破壞整體分佈特性」的前提無關,故 (C) 為最不適當的做法。
【名詞白話語典】
- 離群值(Outlier):與多數觀測值明顯偏離的極端數值。
- One-hot 編碼:處理類別資料的常用技巧,將每個類別展開為獨立的 0/1 欄位,避免模型誤解類別間的順序或大小關係。
【為何其他選項錯了?】
- (A):以 Z-score 或 IQR 等統計準則先評估、再決定是否調整或處理,是離群值處理的標準流程,屬適當做法。
- (B):截尾(Trimming)移除分布兩端的極端觀測值,是常見的離群值處理方法,可提升模型穩定性,屬適當做法。
- (D):結合領域知識判斷極端理賠案件屬量測錯誤或真實罕見事件,再決定保留或修正,是實務上關鍵的判斷步驟,屬適當做法。
提示:題目問「最不適當」;把數值變數硬套類別編碼技術,即是資料型態錯配的選項。
某銀行建立 AI 詐欺交易偵測模型。歷史交易資料中,詐欺樣本比例極低,導致模 型訓練時偏向預測為「正常交易」。資料科學團隊評估採用 SMOTE (Synthetic Minority Over-sampling Technique)改善訓練資料分佈。下列何者最符合SMOTE 技術的主要功能?
- A透過隨機刪除部分正常交易資料,以降低類別失衡程度
- B依據少數類別樣本的特徵空間,合成產生新的少數類別樣本
- C調整模型的損失函數(Loss Function)權重,使誤判少數類別時的懲罰提高
- D以交叉驗證(Cross-validation)方式重新分割資料集,使各折資料類別比例一
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
SMOTE(Synthetic Minority Over-sampling Technique)是處理類別不平衡的過採樣技術。其做法是在特徵空間中,於少數類別樣本與其近鄰樣本之間內插,合成產生新的少數類別樣本,而非單純複製既有樣本。詐欺樣本經合成擴增後,訓練資料的類別分布改善,模型不再一面倒地偏向預測正常交易,故 (B) 符合 SMOTE 的主要功能。
【名詞白話語典】
- SMOTE:解決資料不平衡問題的一種過採樣技術,精髓在於「合成」新的少數類別樣本,而非單純複製舊樣本。
- 資料不平衡(Imbalanced Data):資料集中不同類別的樣本數量差距懸殊。
【為何其他選項錯了?】
- (A):隨機刪除正常交易屬欠採樣(Under-sampling),雖也能降低失衡程度,但會損失多數類別的資訊,且與 SMOTE 的合成機制方向相反。
- (C):調整損失函數權重是演算法層面的成本敏感學習(Cost-sensitive Learning),不改變資料分布,並非 SMOTE 的做法。
- (D):交叉驗證是模型評估方法,重新分割資料不會增加少數類別樣本,無法改善不平衡問題。
提示:SMOTE 的關鍵詞是「特徵空間內插、合成新樣本」;刪多數類是欠採樣,調權重屬損失函數層面,切資料屬驗證方法。
某醫院欲建立一套加護病房(ICU)敗血症預測模型,資料來自 120位病患之生命徵象(如心率、血壓、體溫等),每 5 分鐘記錄一次。資料中敗血症相關樣本僅佔 3.2%,屬於高度不平衡資料。在資料檢查過程中發現數項問題,包括血氧資料會出現 10 至 30分鐘的連續缺失、部分血壓感測器隨使用時間產生系統性偏高(感測器漂移)、敗血症標註時間存在約±2小時誤差,以及不同病患之正常生命徵象基準差異甚大。請問下列何種資料處理與建模方式最為適當?
- A將缺失值以整體平均填補,未額外處理感測器漂移,並將敗血症標註區間由 6小時擴大至8小時以涵蓋時間誤差,模型評估採用 ROC-AUC 作為主要指標
- B對缺失值進行線性插值,若連續缺失時間過長則刪除該段資料,並以 Z-score 標準化處理感測器漂移,交叉驗證採隨機切分,未避免同一病患資料同時出現在訓練與測試集中
- C刪除所有含缺失值之資料,對資料進行 Min-Max 正規化處理,未考慮病患間差異直接建模,並以 Accuracy 作為評估指標,交叉驗證採分層 K-Fold 方式進行
- D對缺失值採前向填補並加入缺失指標特徵,利用感測器 72 小時滾動中位數進行漂移校正,並處理標註雜訊,同時以個別病患基準建模,交叉驗證採病患分組,評估採PR-AUC 與 Recall 指標
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
選項 (D) 對題幹列出的每項資料問題都給出對症處理:血氧連續缺失採前向填補並加入缺失指標特徵,保留「缺失本身可能是臨床訊號」的資訊;感測器漂移以 72 小時滾動中位數校正,可吸收隨時間累積的系統性偏移;敗血症標註時間誤差納入處理;病患間基準差異大,則以個別病患基準建模;交叉驗證採病患分組(Group K-Fold),避免同一病患資料同時出現於訓練與測試集造成洩漏;在 3.2% 的高度不平衡下改以 PR-AUC 與 Recall 評估,較 ROC-AUC 更能反映少數類別的偵測能力,故 (D) 最為適當。
【為何其他選項錯了?】
- (A):以整體平均填補會抹平病患間差異,且完全未處理感測器漂移;將標註區間擴大只是把標註雜訊的範圍拉寬,並非校正。
- (B):最嚴重的缺陷是隨機切分且未避免同一病患資料跨訓練與測試集;時間序列與同病患資料高度相關,如此切分會造成資料洩漏,離線評估虛高;Z-score 標準化也無法校正隨時間累積的漂移。
- (C):刪除所有含缺失值的資料,會大量損失 10 至 30 分鐘連續缺失的片段,樣本折損嚴重;高度不平衡資料以 Accuracy 評估更是典型陷阱。
提示:醫療時序資料三原則:缺失加指標、病患分組切分、不平衡改看 PR-AUC 與 Recall;隨機切分是資料洩漏的高發區。