機器學習知識地圖 · 監督式學習
Ridge (L2)
L2 正規化,防止過擬合
觀念教學
線性回歸有時太自信,把某些係數養得超大 — Ridge 回歸加上 L2 懲罰,像替每個係數綁上彈簧,全部往零的方向拉,但不會拉到零。
核心觀念
在線性回歸的損失函數加上 L2 懲罰項 = 係數平方和乘上懲罰強度,新的損失 = 誤差平方和 + 懲罰項。係數越大罰越重,模型不敢把任何一個係數調太大,有效防止過擬合。
白話理解
房價模型裡「坪數」與「房間數」高度相關(多重共線性),普通線性回歸的係數會亂跳 — 一個變超大正、一個變超大負,互相打架;Ridge 把兩者都壓小、分攤權重,模型立刻變穩定。
關鍵細節
- 懲罰方式:係數平方和(L2)
- 係數只會縮小、不會變成零 — 所有特徵都保留,因此不能做特徵選擇
- 強項:處理多重共線性;適合特徵多且可能都有用的情境
- 懲罰強度是超參數:太小沒效果,太大會欠擬合
- 評估仍用回歸家族指標:MAE、MSE、RMSE、R²
🎯 口訣:L2 像彈簧,拉近不拉斷 — 係數變小不歸零。
iPAS 考點
L1 與 L2 的敘述判斷是歷屆常客,一句話分清:L1(Lasso)會把係數壓到零、能做特徵選擇;L2(Ridge)只縮小不歸零、更穩定。看到「處理共線性」「係數平方和」「保留所有特徵」等關鍵字,答案方向就是 Ridge;選項若說 L2 能自動篩特徵,直接淘汰。
📝 本節掛載 1 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。
應用場景
評估指標
iPAS 歷屆考題詳解(2 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
關於資料正則化 (Regularization) L1、L2方法,下列敘述何者正確?
- AL1 權重個數愈多,愈可以提升模型的正確率
- BL2 稱為 Lasso 正則化
- CL1 運用減少權重的絕對值來控制模型的複雜度
- DL2 較 L1 正則化方法會將特徵權重趨近於零
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
L1 正則化(Lasso)在損失函數加入權重絕對值總和作為懲罰項,藉由縮減權重的絕對值控制模型複雜度;其幾何特性使部分不重要特徵的權重被壓縮至零,產生稀疏解,兼具特徵選擇效果。(C) 正確描述 L1 的運作方式。
【為何其他選項錯了?】
- (A):正則化的目的是限制模型複雜度以防止過擬合;權重個數越多模型越複雜,越容易過擬合,並不會因此提升正確率,與正則化的精神相反。
- (B):名稱對應錯誤。L1 稱為 Lasso(Least Absolute Shrinkage and Selection Operator),L2 稱為 Ridge。
- (D):效果描述顛倒。L1 才會把部分權重壓縮至恰好為零(稀疏解);L2 以平方懲罰使權重整體變小,但通常不會歸零。
提示:L1=Lasso=絕對值懲罰=稀疏、可歸零;L2=Ridge=平方懲罰=縮小但不歸零。
某工程師的多元線性迴歸模型包含 150個特徵,其中許多特徵高度相關(如「建坪」與「總面積」)。他同時希望控制過擬合且保留所有特徵的解釋能力,不讓任何特徵係數歸零,下列哪一項正則化方案最適當?
- ALasso 迴歸(L1 正則化):透過絕對值懲罰使部分係數歸零,具有特徵選擇效果
- BRidge 迴歸(L2 正則化):透過平方懲罰縮小所有係數,在共線性下穩定估計且不歸零
- CElastic Net(L1+L2):結合稀疏性與穩定性,但部分係數仍可能被壓為 0
- D無正則化的 OLS 迴歸:不控制過擬合,在共線性下係數估計不穩定
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
題目的需求有三:控制過擬合、保留全部 150 個特徵的解釋能力、不讓任何係數歸零。Ridge(L2)以平方懲罰把所有係數整體縮小但不會壓到恰好為零,且在「建坪」與「總面積」這類高度共線的情況下能穩定係數估計、降低估計變異,三個條件全部符合。
【為何其他選項錯了?】
- (A):Lasso 的稀疏性會把部分係數直接歸零,違反「不讓任何特徵係數歸零」的明確需求;共線性下它還會在相關特徵間擇一保留,係數清單不穩定。
- (C):Elastic Net 含 L1 成分,部分係數仍可能被壓為 0,選項描述本身已說明不符合題目條件。
- (D):無正則化的 OLS 既不控制過擬合,在共線性下係數估計的變異數也會急遽放大,兩項需求皆無法滿足。
提示:全部特徵都要保留用 Ridge;需要自動篩選特徵用 Lasso;Elastic Net 折衷但仍可能歸零,本題不適用。