機器學習知識地圖 · 監督式學習

決策樹/隨機森林

樹狀結構,易於理解

在互動地圖中開啟 回機器學習知識地圖

觀念教學

決策樹透過 If-Then 規則分類,像流程圖一樣一步步問問題;隨機森林由多棵決策樹投票,準確度更高且不易過擬合。

白話說明
決策樹:像玩「猜猜我是誰」遊戲,每次問一個問題(年齡>30?收入>50萬?)把人分成兩邊,問到最後就得到答案。
隨機森林:找 100 棵決策樹各自猜,最後投票決定答案,少數服從多數。

使用場景
客戶分群、風險評估、醫療診斷、信用卡詐欺偵測。

優點
直覺好懂(可以畫出來給老闆看)、不需要標準化、能處理數值和類別混合資料。

缺點
單棵決策樹容易過擬合(長太深就背答案);隨機森林不容易解釋(100 棵樹誰看得完)。

集成學習(Ensemble Learning)

「三個臭皮匠,勝過一個諸葛亮」——把多個弱模型組合成一個強模型。

三大策略

  • Bagging(裝袋):多個模型各自獨立訓練,最後投票/平均。隨機森林就是 Bagging 的代表。降低 Variance(過擬合)。
  • Boosting(提升):模型一個接一個,後面的專門修正前面的錯誤。GBDT/XGBoost 是代表。降低 Bias(欠擬合)。
  • Stacking(堆疊):用多個模型的預測結果當作新特徵,再訓練一個「元模型」做最終決策。
比喻:Bagging = 班級投票選班長(大家同時投);Boosting = 接力賽(後面的人補前面的不足);Stacking = 先讓各科老師打分,再讓校長綜合評分。

應用場景

客戶分群風險評估醫療診斷

評估指標

準確率F1-ScoreAUC-ROCOOB 誤差 (RF)

iPAS 歷屆考題詳解(6 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第21題

某金融科技公司正開發一套違約風險預測系統,需大量處理不同客戶的財務特徵資料。考量特徵眾多且希望提升泛化能力,下列哪一種鑑別式 AI 模型最適合?

  1. A邏輯迴歸(Logistic Regression)
  2. B支援向量機(Support Vector Machine)
  3. C決策樹(Decision Tree)
  4. D隨機森林(Random Forest)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 題幹有三個關鍵條件:特徵眾多(高維財務資料)、希望提升泛化能力、限定鑑別式(Discriminative)模型。隨機森林(Random Forest)以裝袋法(Bagging)對樣本隨機抽樣,並在每次節點分裂時隨機抽選特徵子集,訓練多棵決策樹後以投票或平均整合輸出。這種集成設計能降低單棵樹的變異,面對高維特徵具備良好的抗過擬合能力,泛化表現穩定,最符合題幹需求。 【為何其他選項錯了?】 - (A):邏輯迴歸是線性模型,僅能刻畫特徵與違約機率之間的線性關係;面對眾多且可能存在交互作用的財務特徵,表達能力不足,泛化提升有限。 - (B):支援向量機在高維空間可尋找最大間隔邊界,但訓練計算複雜度高,客戶資料量龐大時成本顯著上升,且對雜訊與參數設定敏感,不是此情境的首選。 - (C):單棵決策樹在高維資料上容易生長過深而過擬合,訓練資料稍有變動,樹結構與預測結果就可能大幅改變,穩定性與泛化能力皆不足;隨機森林正是為了改善這些弱點而設計。 提示:題幹同時出現「特徵眾多」與「泛化能力」時優先聯想集成學習;隨機森林=Bagging+隨機特徵選擇,以多樹投票降低變異。
115年第二次初級AI應用規劃師第一科人工智慧基礎概論 第15題

某醫療院所建置病患再住院風險預測模型,特徵包含「年齡」、「體重」、「血壓數值」及「診斷類別代碼」等,資料科學家考慮是否需對數值特徵進行標準化 (Standardization)處理。下列何種模型對特徵尺度最不敏感、最適合在不進行標準化的情況下直接使用上述特徵進行訓練?

  1. A線性迴歸(Linear Regression);
  2. B支援向量機(Support Vector Machine);
  3. CK 近鄰演算法(K-Nearest Neighbors);
  4. D決策樹(Decision Tree)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 題幹的關鍵是「對特徵尺度最不敏感、可在不標準化的情況下直接訓練」。決策樹依特徵門檻值進行節點切分,例如「血壓是否大於某數值」,判斷的是資料點落在門檻哪一側,與特徵的數值尺度或單位無關;各特徵尺度差異再大,樹模型仍能在各自的數值範圍內找到最佳切分點,因此對標準化最不敏感,適合直接以原始數值特徵訓練。 【為何其他選項錯了?】 - (A):線性迴歸在特徵尺度差異很大時,係數大小失去可比性,也可能影響數值最佳化的穩定性,通常建議先標準化。 - (B):支援向量機以間隔與距離為核心,特徵尺度會直接影響決策邊界的形成,對尺度敏感,通常需要標準化。 - (C):K 近鄰演算法以距離衡量鄰近程度,尺度大的特徵會主導距離計算,未標準化時結果嚴重偏向大尺度特徵。 提示:距離型(KNN、SVM)與梯度型模型對尺度敏感;以門檻切分的樹模型通常不需標準化。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第14題

某組資料共 10 項標籤如下:A, A, A, A, A, B, B, B, B, B。若該標籤僅有 A、B 兩種,請問這組資料的「正規化吉尼不純度(Normalized Gini impurity)」為何?

  1. A0
  2. B0.42
  3. C0.84
  4. D1
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 吉尼不純度的公式為 Gini = 1 − Σp²。本題 A、B 兩類各 5 筆,p(A) = p(B) = 0.5,故 Gini = 1 − (0.25 + 0.25) = 0.5。正規化吉尼不純度(Normalized Gini Impurity)是再除以該類別數之下的最大可能值:二類別時最大不純度發生在兩類各半的情形,值為 0.5,因此 Normalized Gini = 0.5 ÷ 0.5 = 1。兩類完全均勻混合是不純度最高的狀態,正規化後即為最大值 1。 【為何其他選項錯了?】 - (A):0 代表節點完全純淨,即全部樣本同屬一類(例如 10 筆皆為 A);本題兩類各半,是最混雜而非最純的情況,恰為另一個極端。 - (B):0.42 對不上正確計算;兩類比例為 7:3 時未正規化的 Gini 才約為 0.42,本題比例是 5:5。 - (C):0.84 同樣沒有計算依據;本題未正規化的 Gini 為 0.5,正規化後為 1,兩者皆非 0.84。 提示:二元分類的 Gini 最大值為 0.5,發生在兩類各半;正規化即除以最大值,故兩類各半時 Normalized Gini = 1。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第8題

資訊增益(Information Gain)常用於衡量特徵對分類結果的不確定性貢獻程度,並據以進行特徵選擇。此方法主要應用於下列哪一類模型架構中?

  1. A使用 L1 正則化進行特徵篩選的線性模型
  2. B利用激活函數(Activation Function)進行特徵擷取的深度神經網路
  3. C透過核函數(Kernel Function)將特徵映射至高維空間的分類模型
  4. D透過遞迴分裂方式建立分類規則的決策樹模型
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 資訊增益(Information Gain)定義為分裂前的熵減去分裂後的加權熵,衡量「以某特徵切分資料後,不確定性下降多少」。它是決策樹家族(如 ID3、C4.5)在每個節點挑選分裂特徵的核心準則:計算各候選特徵的資訊增益,選擇增益最大者進行切分,並遞迴地對子節點重複此程序,逐步建立樹狀分類規則,正是選項 (D) 所述「透過遞迴分裂方式建立分類規則的決策樹模型」。 【為何其他選項錯了?】 - (A):L1 正則化透過懲罰項將部分係數壓縮至零以達成特徵篩選,是基於權重大小的線性模型技術,與熵或資訊增益無關。 - (B):深度神經網路以梯度下降配合激活函數逐層學習特徵表示,特徵擷取由網路自動完成,並不使用資訊增益作為特徵選擇準則。 - (C):核函數是支援向量機將特徵映射至高維空間以處理線性不可分問題的技巧,其運作機制與資訊增益無關。 提示:熵、資訊增益、吉尼不純度皆為決策樹的節點分裂準則;看到「遞迴分裂」即指向樹模型。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第2題

吉尼不純度(Gini Impurity)的計算公式為:G = 1 − Σᵢ₌₁ᵏ pᵢ²(即 1 減去各類別 pᵢ 的平方總和,i 從 1 加總到 k)。在決策樹(Decision Tree)中,吉尼不純度用於評估節點分裂的品質。關於吉尼不純度,下列敘述何者不正確?

  1. A公式中的 pᵢ代表第 i 類在該節點中的樣本數,並直接帶入公式計算
  2. B公式中的 k代表節點內資料的類別數量
  3. C吉尼不純度用於衡量節點內資料的類別混雜程度,數值越高代表越混雜
  4. D當節點內所有樣本屬於同一類別時(完全純淨),吉尼不純度為 0
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 公式 G = 1 − Σpᵢ² 中的 pᵢ 是「第 i 類樣本在該節點中所占的比例」,為介於 0 與 1 之間的相對次數,而非樣本數。若直接以樣本數代入,平方總和會遠大於 1,G 將成為絕對值極大的負數,完全失去「不純度介於 0 至 1 − 1/k」的意義。決策樹分裂時,即是比較分裂前後的加權吉尼不純度,選擇能使不純度下降最多的切分方式。本題要求選出不正確的敘述,(A) 將比例誤述為樣本數,正是錯誤選項。 【為何其他選項錯了?】 - (B):此為正確敘述,故非本題答案。k 代表該節點內的類別數量,例如二元分類 k = 2、三類別 k = 3。 - (C):此為正確敘述,故非本題答案。吉尼不純度衡量節點內類別的混雜程度,數值越高越混雜;二元分類時兩類各半最混雜,G = 0.5。 - (D):此為正確敘述,故非本題答案。節點內樣本全屬同一類時,該類 pᵢ = 1、其餘為 0,G = 1 − 1 = 0,代表完全純淨。 提示:吉尼公式代入的是類別「比例」而非「樣本數」;純淨節點 G = 0,越混雜 G 越大。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第28題

某房仲平台要預測物件成交價,資料集含 50 個特徵,其中部分特徵與房價呈非線性關係,且業務單位要求模型須能提供整體特徵重要性以供稽核。下列哪一種模型選擇策略最符合需求?

  1. A使用羅吉斯迴歸(Logistic Regression),透過線性係數解釋特徵影響,但無法有效建模非線性關係
  2. B使用隨機森林迴歸(Random Forest Regression),可處理非線性關係,並提供整體特徵重要性(Feature Importance)作為解釋依據
  3. C用K-means 分群(K-means Clustering)後分別建立迴歸模型,以提升預測準確度並間接提升可解釋性
  4. D使用支持向量迴歸(Support Vector Regression, SVR),透過核函數(Kernel Function)捕捉非線性關係,並以支持向量解釋模型決策
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 題幹有兩項需求:能建模非線性關係、能提供整體特徵重要性以供稽核。隨機森林迴歸(Random Forest Regression)以多棵決策樹集成,樹的分裂規則天生能捕捉非線性關係與特徵交互作用,毋須事先指定函數形式;同時可輸出整體特徵重要性(Feature Importance,如不純度減少量或 permutation importance),恰好滿足稽核所需的解釋依據。面對 50 個混合線性與非線性關係的特徵,隨機森林是最符合需求的選擇。 【為何其他選項錯了?】 - (A):羅吉斯迴歸是分類模型,不適用於預測成交價此類連續值的迴歸任務;且選項自述無法有效建模非線性關係,不符題幹條件。 - (C):先以 K-means 分群再對各群分別建立迴歸模型,流程複雜且群集邊界難以向稽核單位說明,也未提供明確的整體特徵重要性,無法滿足稽核需求。 - (D):支持向量迴歸經核函數映射後決策過程難以解讀,支持向量本身無法轉譯為特徵層級的影響力說明,也無法直接輸出整體特徵重要性清單。 提示:「非線性關係+整體特徵重要性」指向樹系集成模型(隨機森林、梯度提升樹);若需逐筆解釋,可再搭配 SHAP。

相關節點