AI 方法論知識地圖 · 模型開發

特徵工程

資料前處理與轉換

在互動地圖中開啟 回AI 方法論知識地圖

觀念教學

「特徵決定上限,模型逼近上限」— 這句 ML 老話的意思是:料不好,再神的廚師也救不回來。

核心觀念

特徵工程(Feature Engineering)是把原始資料轉換為模型可用特徵的過程,涵蓋標準化(Standardization)編碼(Encoding)特徵選擇(Feature Selection)等。鐵律一條:所有轉換的統計量只能從訓練集學,並且在資料切分之後進行,否則就是資料洩漏(Data Leakage)

白話理解

零售客戶分析的常見慘況:資料倉儲裡 amount_usd、total_price、transaction_value 三個欄位存的是同一筆購買金額,但單位、命名、格式不一致。特徵工程第一步往往不是花式轉換,而是把冗餘欄位整併成單一乾淨來源,否則模型會吃進三份互相矛盾的訊號。

三大常考技術

  • 特徵縮放:各特徵數值範圍差異大(績效 1 到 5、加班 0 到 80、年齡 20 到 65)時,梯度下降類模型會被大範圍特徵綁架 → 標準化(轉成平均 0、標準差 1)或正規化(壓到 0 至 1 區間)
  • 類別編碼:無順序的名目變數(交通方式:火車/飛機/自駕/公車)用 One-Hot Encoding;有順序的變數(會員等級:普通/進階/白金)用順序編碼(Ordinal Encoding)保留大小關係
  • 特徵選擇(Feature Selection)兩派:監督式(Supervised)計算特徵與目標變數(Target)的相關性,如 Correlation、Mutual Information,選出對預測結果貢獻最大的特徵;非監督式(Unsupervised)僅看特徵本身的變異數(Variance)、不參考目標變數,如 Variance Threshold,過濾掉變化太小的特徵
🎯 口訣:縮放防綁架、名目 One-Hot、有序留順序;看不看 Target,分監督不監督。

iPAS 考點

五個真題方向:同一資訊存多個不一致欄位 → 資料整合、整併冗餘特徵;交通方式與會員等級 → 編碼要分「名目用 One-Hot、有序用順序編碼」;數值範圍差異大又用梯度下降類模型 → 先做標準化/特徵縮放;「參考目標變數挑特徵」的敘述 → 監督式特徵選擇;正規化/標準化的正確做法 → 先切分資料,再只用訓練集擬合轉換參數,套用到驗證與測試集,避免資料洩漏。陷阱選項最愛「先對全部資料標準化再切分」— 看到直接淘汰。

📝 本節掛載 7 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

iPAS 歷屆考題詳解(13 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第34題

在零售業進行客戶行為分析時,資料倉儲中發現多個欄位儲存相同的購買金額資訊(例如:amount_usd、total_price、transaction_value)但其單位、命名慣例及格式不一致,進而導致特徵工程階段混淆模型輸入。針對此種跨欄位語義重疊與結構冗餘問題,下列哪一種資料處理策略最合適且具實務可行性?

  1. A利用資料探勘技術自動選擇資料集中對目標變數最敏感的欄位,其他欄位捨棄即可,避免過度清理干擾原始結構
  2. B保留所有相似欄位,交由高階模型(如 Gradient Boosting 或 Deep Learning)自動學習特徵關聯,無需手動處理
  3. C建立欄位命名標準,統一金額單位與格式,進行欄位正規化與語義合併,減少重複資訊影響特徵重要性估計
  4. D將重複欄位視為類別欄位,進行 One-hot 編碼後輸入模型,以避免數值誤導模型學習過程
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 題幹的問題是多個欄位儲存相同的購買金額資訊,但單位、命名與格式不一致,造成特徵工程階段的語義重疊與結構冗餘。實務上正規的處理方式,是建立欄位命名標準、統一金額單位與格式,再進行欄位正規化與語義合併,把重複欄位收斂為單一可信欄位。如此可消除冗餘資訊對特徵重要性估計的干擾,讓模型輸入乾淨一致,是資料倉儲與 ETL 流程的標準做法,故 (C) 最合適且具實務可行性。 【為何其他選項錯了?】 - (A):自動挑選對目標變數最敏感的欄位並捨棄其餘,並未解決單位與格式不一致的根本問題;冗餘欄位間的敏感度排序也不穩定,不同批資料可能選到不同欄位。 - (B):將冗餘欄位全數保留交給高階模型,重複資訊會使特徵重要性被稀釋分散,模型還可能擬合格式差異造成的雜訊,增加過擬合風險,並未治本。 - (D):金額是連續數值,將重複欄位視為類別做 One-hot 編碼會造成維度暴增,且金額的量化意義完全喪失,屬資料型態錯配的處理。 提示:遇到「同義欄位、單位不一」的情境,正解方向是標準化與語義合併;交給模型自行吸收或改變資料型態都不是治本之道。
第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第41題

一家旅遊平台希望建立模型,預測顧客下次是否會再次透過該平台訂房。資料包含:顧客 ID、年齡、旅遊次數、平均花費金額、主要交通方式(火車/飛機/自駕/公車)、會員等級(普通/進階/白金)、是否為海外旅遊等。下列哪一種特徵工程方法最適合處理「主要交通方式」欄位?

  1. A布林轉換(Boolean Conversion)
  2. B序數編碼(Ordinal Encoding)
  3. C數值標準化(Normalization)
  4. DOne-hot 編碼(One-hot Encoding)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 「主要交通方式」包含火車、飛機、自駕、公車四個類別,彼此之間沒有大小或順序關係,屬名目型(Nominal)類別特徵。One-hot 編碼將每個類別展開為獨立的 0/1 欄位,例如火車=[1,0,0,0]、飛機=[0,1,0,0],使模型將各類別視為互相獨立,不會引入不存在的順序資訊,是處理無順序多類別特徵的標準方法,故 (D) 最適合。 【為何其他選項錯了?】 - (A):布林轉換適用於僅有兩種狀態的二元欄位(如「是否為海外旅遊」);交通方式有四個類別,無法以單一真假值表達。 - (B):序數編碼將類別對應為 1、2、3、4 等整數,隱含大小順序;交通方式並無高低之分,模型會學到不存在的順序關係,造成偏誤。 - (C):數值標準化是對連續數值(如年齡、金額)調整尺度的方法;交通方式不是數值,無從標準化。 提示:類別特徵先判斷有無順序:無順序(名目型)用 One-hot;有順序者(如會員等級普通/進階/白金)才考慮序數編碼。
第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第43題

某公司欲建立員工離職風險預測模型,資料集中包含「年度績效分數」、「平均每月加班時數」、「年齡」等數值型特徵。由於各特徵的數值範圍差異極大(例如績效分數 1-5、加班時數 0-80、年齡 20-65),若直接輸入至使用梯度下降的邏輯迴歸模型,可能導致模型收斂緩慢或權重偏斜。為提升模型訓練效率與準確度,下列哪一種特徵工程方法最適合應用於這些數值特徵?

  1. A布林轉換(Boolean Conversion)
  2. B時間序列分解(Time Series Decomposition)
  3. COne-hot 編碼(One-hot Encoding)
  4. D數值標準化(Numerical Standardization)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 題幹的三個特徵皆為數值型,但數值範圍差異大(1 至 5、0 至 80、20 至 65)。使用梯度下降訓練的邏輯迴歸對特徵尺度敏感:範圍大的特徵會主導梯度方向,使損失面拉長變形,導致收斂緩慢與權重偏斜。數值標準化將各特徵轉換為平均值 0、標準差 1 的一致尺度,讓梯度下降在各方向均衡前進,加快收斂並穩定權重估計,故 (D) 最適合。 【為何其他選項錯了?】 - (A):布林轉換僅適用於二元狀態欄位;績效、加班時數與年齡是多值連續數值,轉為真假值會嚴重損失資訊,也未解決尺度問題。 - (B):時間序列分解用於拆解具時間軸資料的趨勢、季節與殘差成分;題幹特徵為靜態屬性,沒有時間結構可分解。 - (C):One-hot 編碼處理類別特徵;對連續數值逐值編碼會造成維度暴增,且尺度差異的問題依然存在。 提示:題幹出現「梯度下降、收斂緩慢、數值範圍差異大」的組合,對應的標準解法即是數值標準化。
第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第46題

某電商公司想預測用戶是否會購買特定商品,資料中包含多種用戶屬性與行為特徵。分析師希望選出對購買結果最有預測價值的特徵,以提升模型效能。下列哪一種描述最符合監督式特徵選擇(Supervised Feature Selection)的概念?

  1. A根據特徵的整體分布、變異度或資訊量進行篩選,而不直接參考目標變數
  2. B評估每個特徵與目標變數之間的相關性,選擇對預測結果貢獻最大的特徵
  3. C使用模型評估特徵對預測結果的重要性,並保留對目標變數影響較大的欄位
  4. D將特徵透過降維方法(如 PCA)轉換為新特徵,再用於模型訓練
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 監督式特徵選擇(Supervised Feature Selection)的核心,是利用目標變數(標籤)的資訊評估特徵的預測價值:計算每個特徵與目標變數之間的相關性或關聯程度(如相關係數、卡方檢定、互資訊),保留對預測結果貢獻大的特徵。題幹要選出對「是否購買」最有預測價值的特徵,評估特徵與目標變數的相關性正是監督式選擇的概念核心,故 (B) 最符合。 【為何其他選項錯了?】 - (A):僅依特徵自身的分布、變異度或資訊量篩選、不參考目標變數,是非監督式特徵選擇(如變異數門檻法)的做法。 - (C):以模型評估特徵重要性屬包裹式(Wrapper)或嵌入式(Embedded)方法,是監督式選擇的其中一種實作;但監督式特徵選擇的定義核心在「參考目標變數」,不限定必須透過模型,(B) 的敘述更直接對應概念本身。 - (D):PCA 等降維方法屬特徵萃取(Feature Extraction),將原特徵轉換合成新特徵,而非從原有特徵中挑選,且 PCA 本身不使用目標變數。 提示:先分辨兩件事:是否用到標籤(監督/非監督)、是挑選原特徵還是產生新特徵(選擇/萃取);監督式選擇=依特徵與目標的關聯挑選原特徵。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第6題

資料科學團隊在模型訓練前,需對數值特徵進行正規化(Normalization)或標準 化(Standardization)。為確保模型評估結果具真實性並避免資料洩漏(Data Leakage),下列何者為最適當的作法?

  1. A於資料分割前,先對完整資料集計算統計量並進行標準化處理
  2. B先分割訓練資料(Training Data)和測試資料(Test Data),並各自獨立計算 統計量後進行標準化
  3. C先分割訓練資料(Training Data)和測試資料(Test Data),僅以訓練資料計算 統計量,再套用至測試資料
  4. D僅對訓練資料(Training Data)進行標準化處理,測試資料(Test Data)保持原 始數值
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 標準化需以資料的統計量(平均值、標準差)進行轉換,而測試資料模擬的是模型上線後才會遇到的未知資料,其統計資訊在訓練階段不應被使用。正確流程是:先分割訓練集與測試集,僅以訓練集計算統計量,再以同一組統計量分別轉換訓練集與測試集。如此測試資料的資訊完全未參與轉換規則的建立,評估結果才能反映真實的泛化能力,故 (C) 最為適當。 【名詞白話語典】 - 資料洩漏(Data Leakage):模型訓練過程中接觸到上線時不應知道的資訊(例如測試集的統計量),導致評估結果過於樂觀。 【為何其他選項錯了?】 - (A):分割前以完整資料集計算統計量,測試資料的資訊已滲入轉換規則,是最典型的資料洩漏。 - (B):訓練集與測試集各自計算統計量,兩者使用不同的轉換基準,特徵尺度不一致,評估失去可比性。 - (D):僅標準化訓練資料、測試資料保持原始數值,兩者尺度完全不同,模型面對的輸入分布與訓練時不一致,無法正確預測。 提示:轉換統計量一律只從訓練集取得,再以相同規則套用至測試集;任何在分割前接觸全體資料統計量的流程都構成洩漏。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第7題

某電信公司建立機器學習模型預測用戶流失風險。資料中包含多個類別型特徵 (Categorical Features),例如「資費方案類型」與「客戶地區」。為使模型能有效 使用這些特徵,下列何者最直接用於將類別型特徵轉換為模型可處理的數值格 式?

  1. A資料分群 (Data Clustering)
  2. B特徵交叉 (Feature Cross)
  3. COne-hot 編碼(One-hot Encoding)
  4. D寬深模型(Wide and Deep)
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 「資費方案類型」與「客戶地區」是類別型特徵,模型無法直接處理文字標籤,必須先轉換為數值格式。One-hot 編碼為每個類別建立獨立欄位,屬於該類別者標 1、否則標 0,例如「地區」欄位展開為「是否台北」「是否台中」等多個欄位,是將類別特徵轉為模型可處理數值格式最直接且常用的方法,故 (C) 正確。 【名詞白話語典】 - 類別型特徵(Categorical Features):值為文字或標籤的特徵,例如性別、顏色、城市。 - One-hot 編碼:將類別變數轉換為二元(0 或 1)向量的過程,避免模型誤解類別之間的順序或大小關係。 【為何其他選項錯了?】 - (A):資料分群是非監督式學習方法,用於找出資料中的群體結構,並非特徵格式轉換技術。 - (B):特徵交叉是將兩個以上特徵組合產生新特徵(如「地區×資費方案」),屬特徵衍生技巧,不是把類別轉為數值的基礎轉換方法。 - (D):寬深模型(Wide and Deep)是一種模型架構,而非特徵轉換技術。 提示:題目問「最直接」的轉換方法;分群是學習任務、特徵交叉是特徵衍生、寬深是模型架構,唯有 One-hot 是編碼技術。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第44題

某零售業者建立顧客行為預測模型,資料集中包含「年消費金額」、「平均單筆交 易金額」及「會員年資」等數值型特徵。資料分析顯示,部分金額特徵呈現高度 偏態分布,少數樣本的數值顯著高於多數觀測值。為降低極端值對模型學習穩定 性的影響,下列哪一種特徵工程方法最適合?

  1. A對數轉換 (Log Transformation)
  2. B區間化(Binning)
  3. COne-hot 編碼(One-hot Encoding)
  4. D隨機重抽樣(Random Resampling)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 金額類特徵呈高度偏態時,少數樣本的數值遠高於多數觀測值,會干擾模型學習的穩定性。對數轉換(Log Transformation)可壓縮數值範圍,將相差數個數量級的數值(如 1,000 與 1,000,000)映射到相近的尺度,使分布更接近常態、降低極端值的影響力,同時保留數值間的大小順序與相對關係,是處理右偏金額特徵的標準技巧,故 (A) 最適合。 【為何其他選項錯了?】 - (B):區間化(Binning)將連續數值切成類別區間,雖能鈍化極端值影響,但會損失數值的精細資訊,並非本情境的首選。 - (C):One-hot 編碼用於處理類別型特徵,不適用於連續數值欄位。 - (D):隨機重抽樣處理的是「類別樣本不平衡」問題,作用於樣本層面,與單一特徵的數值分布偏態無關。 提示:金額、收入這類右偏長尾特徵,首選是對數轉換;分箱會損失精度、編碼是類別工具、重抽樣處理的是類別比例。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第27題

某企業需分析半結構化的系統日誌(JSON格式),以提取關鍵的時序特徵供故障預測模型使用。考量日誌結構複雜且包含巢狀欄位(Nested Fields),下列哪一種策略最有效且實務可行?

  1. A先將JSON 資料扁平化轉成CSV,再對欄位計算統計量(如均值、次數)作為特徵
  2. B使用遞歸神經網路(RNN)直接輸入原始 JSON字串進行時序特徵抽取
  3. C設計遞迴函式展開巢狀欄位,並基於時間窗口(Time Window)進行聚合與特徵萃取
  4. D只保留時間戳記欄位,忽略其他巢狀內容以簡化特徵工程
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 JSON 日誌的巢狀欄位(Nested Fields)需以遞迴方式展開,才能完整取出各層級的資訊;而故障預測需要的是時序特徵,因此展開後應以時間窗口(Time Window)聚合,例如每五分鐘的錯誤次數、延遲平均與峰值、事件間隔統計等。遞迴展開結合時間窗聚合,兼顧結構完整性與時序資訊,是實務上最有效且可行的特徵工程策略,故 (C) 正確。 【為何其他選項錯了?】 - (A):直接扁平化成 CSV 後計算全域統計量(如均值、次數),會失去時間軸上的變化資訊;故障前兆通常表現為指標隨時間的趨勢變化,僅保留整體統計量無法捕捉。 - (B):RNN 無法直接以原始 JSON 字串作為輸入,仍須先解析結構並轉為數值表徵;將結構解析工作交由模型處理,既低效也不可行。 - (D):僅保留時間戳記、捨棄其他巢狀內容,等於丟棄最具預測力的事件與狀態資訊,無法支撐故障預測。 提示:巢狀日誌的特徵工程兩步驟:遞迴展開取得完整欄位,再以時間窗聚合保留趨勢;故障前兆藏在時序變化之中。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第20題

某電子商務公司為開發商品評論情感分析模型,希望模型能捕捉評論中不同特徵之間的關聯影響,例如「商品價格」與「顧客滿意度」的互動效果。下列哪一種特徵工程設計方式最適合用於建立互動特徵(Interaction Features)?

  1. A將單一特徵取平方
  2. B對所有特徵進行對數轉換
  3. C將兩個或多個特徵進行乘積或交互組合
  4. D對特徵進行標準化
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 互動特徵(Interaction Features)的定義,是將兩個以上的特徵做乘積或交互組合以產生新特徵,使模型能捕捉特徵聯合作用的效應,例如「商品價格×顧客滿意度」這種單看任一變數都無法呈現的交互影響。多項式特徵展開中的交叉項(x1·x2)即為此設計,對線性模型尤其重要,因為線性模型無法自行學出特徵間的乘積關係,故 (C) 正確。 【為何其他選項錯了?】 - (A):單一特徵取平方屬多項式特徵,僅描述單一變數自身的非線性效果,不涉及兩個特徵之間的互動。 - (B):對數轉換用於調整單一特徵的分布形狀(如壓縮右偏長尾),與特徵之間的關聯無關。 - (D):標準化僅將特徵縮放至相同尺度,不會產生任何新的互動資訊。 提示:互動特徵=特徵相乘產生新欄位;當兩變數的聯合效果不等於各自效果相加時,就需要交互項。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第35題

某生物醫學研究機構正在建構一個整合「基因序列特徵」與「電子病歷文本特徵」的疾病風險預測模型。由於高維數值特徵和語意文本特徵的性質差異顯著,請問下列哪一種特徵處理與選擇策略最為合適?

  1. A將所有特徵合併為單一特徵矩陣後,使用主成分分析(PCA)進行降維,作為模型輸入
  2. B採分層策略,先對基因序列特徵進行特徵選擇,再對文本特徵進行語意表示,最後將兩類特徵融合(Feature Fusion)後輸入模型
  3. C將所有特徵合併後,使用隨機森林(Random Forest)的特徵重要性進行一次性排序與篩選
  4. D將文本特徵轉換為簡單統計特徵(如詞頻)後與基因特徵一併建模,以降低特徵處理複雜度
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 基因序列特徵屬高維數值資料(維度可達數萬且雜訊多),電子病歷文本屬語意資訊,兩類特徵性質差異顯著,適合採分層(分而治之)策略:先對基因特徵進行特徵選擇或降維,濾除雜訊並保留與疾病相關的訊號;文本特徵則以語意表示方法(如 BERT embedding)轉為向量;各自處理為合適的表徵後,再進行特徵融合(Feature Fusion)輸入預測模型。依各類特徵的性質分別處理再融合,才能維持融合後的資訊品質,故 (B) 最為合適。 【為何其他選項錯了?】 - (A):將異質特徵直接合併為單一矩陣做 PCA,量綱與語意混雜,高維基因數值容易淹沒文本語意方向;且 PCA 保留的最大變異方向未必是最具預測力的方向。 - (C):隨機森林特徵重要性排序的前提是各特徵已是合理表徵;文本尚未轉為有效語意向量即混入排序,重要性估計會失真。 - (D):將病歷文本降為詞頻等簡單統計特徵,語境與語意資訊大量流失,浪費臨床敘述中最有價值的內容。 提示:異質特徵的處理原則是先各自建立合適表徵(選擇或語意表示),再進行融合;直接合併降維或一次性排序都會犧牲資訊品質。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第26題

某電商推薦系統的資料工程師在建構模型特徵時,將使用者的訂單 UNIX時間戳記(連續數值)轉換為「早晨(6–12時)、下午(12–18時)、夜晚(18–6時)」三個區間類別,以讓推薦模型更容易學習消費時段規律。在資料前處理中,這種將連續數值轉換為有序類別的操作最精確的名稱為何?

  1. A特徵離散化(Feature Discretization)
  2. B特徵縮放(Feature Scaling)
  3. C數據降維(Dimensionality Reduction)
  4. DOne-Hot 編碼(One-Hot Encoding)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 將連續數值(UNIX 時間戳記)依區間切分為「早晨、下午、夜晚」等有限個有序類別,正是特徵離散化(Feature Discretization),常見實作亦稱分箱(Binning)。離散化能把連續變數中的非線性規律(如消費時段效應)轉為模型容易學習的類別訊號,並提升對雜訊與極端值的穩健性,是資料前處理的常見手法,故 (A) 為最精確的名稱。 【為何其他選項錯了?】 - (B):特徵縮放(如標準化、Min-Max)只改變數值的尺度與範圍,結果仍是連續數值,並未轉換為類別。 - (C):降維是減少特徵欄位數(如 PCA 將 100 維壓縮至 10 維);本操作是單一欄位內的值域轉換,欄位數不變,概念不同。 - (D):One-Hot 編碼是將「已經是類別」的欄位展開為 0/1 向量,屬離散化之後可能接續的步驟;題目問的是連續值轉為區間類別的動作本身,名稱應為離散化。 提示:連續轉類別=離散化(分箱);類別轉 0/1 向量=One-Hot;改尺度不改型態=縮放。流程上常是先離散化再編碼。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第25題

某工程師建立房價預測模型,輸入特徵包含屋齡與距捷運站距離(公尺)。他發現距捷運站距離分布嚴重右偏,經對數(Log)轉換後模型表現明顯改善;但將同樣轉換套用於屋齡後,模型表現反而下降。下列何者為最可能的原因?

  1. A屋齡與房價若呈線性關係,Log轉換反而破壞此結構
  2. BLog轉換會壓縮所有特徵的變異數,導致模型失去鑑別能力
  3. CLog轉換不適用於有單位的連續變數,應改用 Box-Cox
  4. D兩特徵須套用相同轉換,否則尺度不一致導致梯度不穩定
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 對數轉換適用於右偏、跨數量級、與目標變數呈乘法或彈性關係的特徵;距捷運站距離嚴重右偏,取對數後模型表現改善屬合理結果。但若屋齡與房價原本大致呈線性關係,對數轉換會將等距的屋齡差壓縮為不等距,把原本的直線關係扭曲為曲線,模型反而更難擬合,表現下降是自然結果。轉換是否有益,取決於特徵與目標之間的關係形狀,故 (A) 為最可能的原因。 【為何其他選項錯了?】 - (B):對數轉換僅作用於被轉換的該特徵,不會壓縮「所有」特徵的變異數,也不必然使模型喪失鑑別能力,敘述過度延伸。 - (C):對數轉換對正值連續變數(距離、金額)完全適用;Box-Cox 只是把對數轉換納入其中的廣義轉換家族,「有單位就不能取對數」並非成立的規則。 - (D):並沒有「所有特徵必須套用相同轉換」的原則;尺度不一致的問題應以標準化處理,與各特徵各自採用何種轉換無關。 提示:轉換前先檢視特徵與目標的關係形狀:右偏且呈乘法關係適合取對數;原本已是線性關係的特徵,再轉換反而破壞結構。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第26題

在時間序列資料的特徵工程中,工程師常使用滑動窗口(Sliding Window)方法,將過去多個時間點的觀測值組合為模型輸入。下列何者為此方法的主要目的?

  1. A資料增強
  2. B去除資料雜訊
  3. C降低特徵維度
  4. D建立滯後特徵
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 滑動窗口(Sliding Window)將過去 k 個時間點的觀測值(t-1, t-2, …, t-k)排列為預測時刻 t 的輸入特徵,即建立滯後特徵(Lag Features),讓模型直接取得近期歷史的趨勢、慣性與週期型態。這是時間序列特徵工程最基本且重要的手法,可將時序預測問題轉換為一般表格式的監督式學習,供樹模型與線性模型使用,故 (D) 正確。 【為何其他選項錯了?】 - (A):資料增強是產生額外的訓練樣本(如影像翻轉、加入雜訊)以提升多樣性;滑動窗口是把既有觀測值重組為特徵,目的不同。 - (B):滑動窗口特徵保留原始觀測值,本身不做平滑或去噪;具去噪效果的是移動平均等聚合統計,且去噪並非此法的主要目的。 - (C):將 k 個歷史時間點展開為 k 個特徵是「增加」特徵維度,與降維方向相反。 提示:滑動窗口的本質是讓模型看得到過去:以 t-1 至 t-k 的觀測值作為特徵預測時刻 t,即滯後特徵。

相關節點