機器學習知識地圖 · 監督式學習
決策樹/隨機森林
樹狀結構,易於理解
觀念教學
決策樹透過 If-Then 規則分類,像流程圖一樣一步步問問題;隨機森林由多棵決策樹投票,準確度更高且不易過擬合。
白話說明
決策樹:像玩「猜猜我是誰」遊戲,每次問一個問題(年齡>30?收入>50萬?)把人分成兩邊,問到最後就得到答案。
隨機森林:找 100 棵決策樹各自猜,最後投票決定答案,少數服從多數。
使用場景
客戶分群、風險評估、醫療診斷、信用卡詐欺偵測。
優點
直覺好懂(可以畫出來給老闆看)、不需要標準化、能處理數值和類別混合資料。
缺點
單棵決策樹容易過擬合(長太深就背答案);隨機森林不容易解釋(100 棵樹誰看得完)。
集成學習(Ensemble Learning)
「三個臭皮匠,勝過一個諸葛亮」——把多個弱模型組合成一個強模型。
三大策略
- Bagging(裝袋):多個模型各自獨立訓練,最後投票/平均。隨機森林就是 Bagging 的代表。降低 Variance(過擬合)。
- Boosting(提升):模型一個接一個,後面的專門修正前面的錯誤。GBDT/XGBoost 是代表。降低 Bias(欠擬合)。
- Stacking(堆疊):用多個模型的預測結果當作新特徵,再訓練一個「元模型」做最終決策。
比喻:Bagging = 班級投票選班長(大家同時投);Boosting = 接力賽(後面的人補前面的不足);Stacking = 先讓各科老師打分,再讓校長綜合評分。
應用場景
評估指標
iPAS 歷屆考題詳解(6 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某金融科技公司正開發一套違約風險預測系統,需大量處理不同客戶的財務特徵資料。考量特徵眾多且希望提升泛化能力,下列哪一種鑑別式 AI 模型最適合?
- A邏輯迴歸(Logistic Regression)
- B支援向量機(Support Vector Machine)
- C決策樹(Decision Tree)
- D隨機森林(Random Forest)
看正解與逐選項詳解
正解:D
某醫療院所建置病患再住院風險預測模型,特徵包含「年齡」、「體重」、「血壓數值」及「診斷類別代碼」等,資料科學家考慮是否需對數值特徵進行標準化 (Standardization)處理。下列何種模型對特徵尺度最不敏感、最適合在不進行標準化的情況下直接使用上述特徵進行訓練?
- A線性迴歸(Linear Regression);
- B支援向量機(Support Vector Machine);
- CK 近鄰演算法(K-Nearest Neighbors);
- D決策樹(Decision Tree)
看正解與逐選項詳解
正解:D
某組資料共 10 項標籤如下:A, A, A, A, A, B, B, B, B, B。若該標籤僅有 A、B 兩種,請問這組資料的「正規化吉尼不純度(Normalized Gini impurity)」為何?
- A0
- B0.42
- C0.84
- D1
看正解與逐選項詳解
正解:D
資訊增益(Information Gain)常用於衡量特徵對分類結果的不確定性貢獻程度,並據以進行特徵選擇。此方法主要應用於下列哪一類模型架構中?
- A使用 L1 正則化進行特徵篩選的線性模型
- B利用激活函數(Activation Function)進行特徵擷取的深度神經網路
- C透過核函數(Kernel Function)將特徵映射至高維空間的分類模型
- D透過遞迴分裂方式建立分類規則的決策樹模型
看正解與逐選項詳解
正解:D
吉尼不純度(Gini Impurity)的計算公式為:G = 1 − Σᵢ₌₁ᵏ pᵢ²(即 1 減去各類別 pᵢ 的平方總和,i 從 1 加總到 k)。在決策樹(Decision Tree)中,吉尼不純度用於評估節點分裂的品質。關於吉尼不純度,下列敘述何者不正確?
- A公式中的 pᵢ代表第 i 類在該節點中的樣本數,並直接帶入公式計算
- B公式中的 k代表節點內資料的類別數量
- C吉尼不純度用於衡量節點內資料的類別混雜程度,數值越高代表越混雜
- D當節點內所有樣本屬於同一類別時(完全純淨),吉尼不純度為 0
看正解與逐選項詳解
正解:A
某房仲平台要預測物件成交價,資料集含 50 個特徵,其中部分特徵與房價呈非線性關係,且業務單位要求模型須能提供整體特徵重要性以供稽核。下列哪一種模型選擇策略最符合需求?
- A使用羅吉斯迴歸(Logistic Regression),透過線性係數解釋特徵影響,但無法有效建模非線性關係
- B使用隨機森林迴歸(Random Forest Regression),可處理非線性關係,並提供整體特徵重要性(Feature Importance)作為解釋依據
- C用K-means 分群(K-means Clustering)後分別建立迴歸模型,以提升預測準確度並間接提升可解釋性
- D使用支持向量迴歸(Support Vector Regression, SVR),透過核函數(Kernel Function)捕捉非線性關係,並以支持向量解釋模型決策
看正解與逐選項詳解
正解:B