AI 方法論知識地圖 · 模型開發
特徵工程
資料前處理與轉換
觀念教學
「特徵決定上限,模型逼近上限」— 這句 ML 老話的意思是:料不好,再神的廚師也救不回來。
核心觀念
特徵工程(Feature Engineering)是把原始資料轉換為模型可用特徵的過程,涵蓋標準化(Standardization)、編碼(Encoding)、特徵選擇(Feature Selection)等。鐵律一條:所有轉換的統計量只能從訓練集學,並且在資料切分之後進行,否則就是資料洩漏(Data Leakage)。
白話理解
零售客戶分析的常見慘況:資料倉儲裡 amount_usd、total_price、transaction_value 三個欄位存的是同一筆購買金額,但單位、命名、格式不一致。特徵工程第一步往往不是花式轉換,而是把冗餘欄位整併成單一乾淨來源,否則模型會吃進三份互相矛盾的訊號。
三大常考技術
- 特徵縮放:各特徵數值範圍差異大(績效 1 到 5、加班 0 到 80、年齡 20 到 65)時,梯度下降類模型會被大範圍特徵綁架 → 標準化(轉成平均 0、標準差 1)或正規化(壓到 0 至 1 區間)
- 類別編碼:無順序的名目變數(交通方式:火車/飛機/自駕/公車)用 One-Hot Encoding;有順序的變數(會員等級:普通/進階/白金)用順序編碼(Ordinal Encoding)保留大小關係
- 特徵選擇(Feature Selection)兩派:監督式(Supervised)計算特徵與目標變數(Target)的相關性,如 Correlation、Mutual Information,選出對預測結果貢獻最大的特徵;非監督式(Unsupervised)僅看特徵本身的變異數(Variance)、不參考目標變數,如 Variance Threshold,過濾掉變化太小的特徵
🎯 口訣:縮放防綁架、名目 One-Hot、有序留順序;看不看 Target,分監督不監督。
iPAS 考點
五個真題方向:同一資訊存多個不一致欄位 → 資料整合、整併冗餘特徵;交通方式與會員等級 → 編碼要分「名目用 One-Hot、有序用順序編碼」;數值範圍差異大又用梯度下降類模型 → 先做標準化/特徵縮放;「參考目標變數挑特徵」的敘述 → 監督式特徵選擇;正規化/標準化的正確做法 → 先切分資料,再只用訓練集擬合轉換參數,套用到驗證與測試集,避免資料洩漏。陷阱選項最愛「先對全部資料標準化再切分」— 看到直接淘汰。
📝 本節掛載 7 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。
iPAS 歷屆考題詳解(13 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
在零售業進行客戶行為分析時,資料倉儲中發現多個欄位儲存相同的購買金額資訊(例如:amount_usd、total_price、transaction_value)但其單位、命名慣例及格式不一致,進而導致特徵工程階段混淆模型輸入。針對此種跨欄位語義重疊與結構冗餘問題,下列哪一種資料處理策略最合適且具實務可行性?
- A利用資料探勘技術自動選擇資料集中對目標變數最敏感的欄位,其他欄位捨棄即可,避免過度清理干擾原始結構
- B保留所有相似欄位,交由高階模型(如 Gradient Boosting 或 Deep Learning)自動學習特徵關聯,無需手動處理
- C建立欄位命名標準,統一金額單位與格式,進行欄位正規化與語義合併,減少重複資訊影響特徵重要性估計
- D將重複欄位視為類別欄位,進行 One-hot 編碼後輸入模型,以避免數值誤導模型學習過程
看正解與逐選項詳解
正解:C
一家旅遊平台希望建立模型,預測顧客下次是否會再次透過該平台訂房。資料包含:顧客 ID、年齡、旅遊次數、平均花費金額、主要交通方式(火車/飛機/自駕/公車)、會員等級(普通/進階/白金)、是否為海外旅遊等。下列哪一種特徵工程方法最適合處理「主要交通方式」欄位?
- A布林轉換(Boolean Conversion)
- B序數編碼(Ordinal Encoding)
- C數值標準化(Normalization)
- DOne-hot 編碼(One-hot Encoding)
看正解與逐選項詳解
正解:D
某公司欲建立員工離職風險預測模型,資料集中包含「年度績效分數」、「平均每月加班時數」、「年齡」等數值型特徵。由於各特徵的數值範圍差異極大(例如績效分數 1-5、加班時數 0-80、年齡 20-65),若直接輸入至使用梯度下降的邏輯迴歸模型,可能導致模型收斂緩慢或權重偏斜。為提升模型訓練效率與準確度,下列哪一種特徵工程方法最適合應用於這些數值特徵?
- A布林轉換(Boolean Conversion)
- B時間序列分解(Time Series Decomposition)
- COne-hot 編碼(One-hot Encoding)
- D數值標準化(Numerical Standardization)
看正解與逐選項詳解
正解:D
某電商公司想預測用戶是否會購買特定商品,資料中包含多種用戶屬性與行為特徵。分析師希望選出對購買結果最有預測價值的特徵,以提升模型效能。下列哪一種描述最符合監督式特徵選擇(Supervised Feature Selection)的概念?
- A根據特徵的整體分布、變異度或資訊量進行篩選,而不直接參考目標變數
- B評估每個特徵與目標變數之間的相關性,選擇對預測結果貢獻最大的特徵
- C使用模型評估特徵對預測結果的重要性,並保留對目標變數影響較大的欄位
- D將特徵透過降維方法(如 PCA)轉換為新特徵,再用於模型訓練
看正解與逐選項詳解
正解:B
資料科學團隊在模型訓練前,需對數值特徵進行正規化(Normalization)或標準 化(Standardization)。為確保模型評估結果具真實性並避免資料洩漏(Data Leakage),下列何者為最適當的作法?
- A於資料分割前,先對完整資料集計算統計量並進行標準化處理
- B先分割訓練資料(Training Data)和測試資料(Test Data),並各自獨立計算 統計量後進行標準化
- C先分割訓練資料(Training Data)和測試資料(Test Data),僅以訓練資料計算 統計量,再套用至測試資料
- D僅對訓練資料(Training Data)進行標準化處理,測試資料(Test Data)保持原 始數值
看正解與逐選項詳解
正解:C
某電信公司建立機器學習模型預測用戶流失風險。資料中包含多個類別型特徵 (Categorical Features),例如「資費方案類型」與「客戶地區」。為使模型能有效 使用這些特徵,下列何者最直接用於將類別型特徵轉換為模型可處理的數值格 式?
- A資料分群 (Data Clustering)
- B特徵交叉 (Feature Cross)
- COne-hot 編碼(One-hot Encoding)
- D寬深模型(Wide and Deep)
看正解與逐選項詳解
正解:C
某零售業者建立顧客行為預測模型,資料集中包含「年消費金額」、「平均單筆交 易金額」及「會員年資」等數值型特徵。資料分析顯示,部分金額特徵呈現高度 偏態分布,少數樣本的數值顯著高於多數觀測值。為降低極端值對模型學習穩定 性的影響,下列哪一種特徵工程方法最適合?
- A對數轉換 (Log Transformation)
- B區間化(Binning)
- COne-hot 編碼(One-hot Encoding)
- D隨機重抽樣(Random Resampling)
看正解與逐選項詳解
正解:A
某企業需分析半結構化的系統日誌(JSON格式),以提取關鍵的時序特徵供故障預測模型使用。考量日誌結構複雜且包含巢狀欄位(Nested Fields),下列哪一種策略最有效且實務可行?
- A先將JSON 資料扁平化轉成CSV,再對欄位計算統計量(如均值、次數)作為特徵
- B使用遞歸神經網路(RNN)直接輸入原始 JSON字串進行時序特徵抽取
- C設計遞迴函式展開巢狀欄位,並基於時間窗口(Time Window)進行聚合與特徵萃取
- D只保留時間戳記欄位,忽略其他巢狀內容以簡化特徵工程
看正解與逐選項詳解
正解:C
某電子商務公司為開發商品評論情感分析模型,希望模型能捕捉評論中不同特徵之間的關聯影響,例如「商品價格」與「顧客滿意度」的互動效果。下列哪一種特徵工程設計方式最適合用於建立互動特徵(Interaction Features)?
- A將單一特徵取平方
- B對所有特徵進行對數轉換
- C將兩個或多個特徵進行乘積或交互組合
- D對特徵進行標準化
看正解與逐選項詳解
正解:C
某生物醫學研究機構正在建構一個整合「基因序列特徵」與「電子病歷文本特徵」的疾病風險預測模型。由於高維數值特徵和語意文本特徵的性質差異顯著,請問下列哪一種特徵處理與選擇策略最為合適?
- A將所有特徵合併為單一特徵矩陣後,使用主成分分析(PCA)進行降維,作為模型輸入
- B採分層策略,先對基因序列特徵進行特徵選擇,再對文本特徵進行語意表示,最後將兩類特徵融合(Feature Fusion)後輸入模型
- C將所有特徵合併後,使用隨機森林(Random Forest)的特徵重要性進行一次性排序與篩選
- D將文本特徵轉換為簡單統計特徵(如詞頻)後與基因特徵一併建模,以降低特徵處理複雜度
看正解與逐選項詳解
正解:B
某電商推薦系統的資料工程師在建構模型特徵時,將使用者的訂單 UNIX時間戳記(連續數值)轉換為「早晨(6–12時)、下午(12–18時)、夜晚(18–6時)」三個區間類別,以讓推薦模型更容易學習消費時段規律。在資料前處理中,這種將連續數值轉換為有序類別的操作最精確的名稱為何?
- A特徵離散化(Feature Discretization)
- B特徵縮放(Feature Scaling)
- C數據降維(Dimensionality Reduction)
- DOne-Hot 編碼(One-Hot Encoding)
看正解與逐選項詳解
正解:A
某工程師建立房價預測模型,輸入特徵包含屋齡與距捷運站距離(公尺)。他發現距捷運站距離分布嚴重右偏,經對數(Log)轉換後模型表現明顯改善;但將同樣轉換套用於屋齡後,模型表現反而下降。下列何者為最可能的原因?
- A屋齡與房價若呈線性關係,Log轉換反而破壞此結構
- BLog轉換會壓縮所有特徵的變異數,導致模型失去鑑別能力
- CLog轉換不適用於有單位的連續變數,應改用 Box-Cox
- D兩特徵須套用相同轉換,否則尺度不一致導致梯度不穩定
看正解與逐選項詳解
正解:A
在時間序列資料的特徵工程中,工程師常使用滑動窗口(Sliding Window)方法,將過去多個時間點的觀測值組合為模型輸入。下列何者為此方法的主要目的?
- A資料增強
- B去除資料雜訊
- C降低特徵維度
- D建立滯後特徵
看正解與逐選項詳解
正解:D