機器學習知識地圖 · 監督式學習

Lasso (L1)

L1 正規化,特徵選擇

在互動地圖中開啟 回機器學習知識地圖

觀念教學

100 個特徵裡只有 10 個真有用?Lasso 回歸加上 L1 懲罰,直接把沒用特徵的係數壓到零 — 等於模型自帶特徵選擇功能。

核心觀念

在損失函數加上 L1 懲罰項 = 係數絕對值的總和乘上懲罰強度。與 L2 不同,L1 的約束範圍是有「尖角」的菱形,最佳解容易剛好落在角點上 — 角點的意義就是某些係數恰好為零。這正是 L1 導致參數收斂為零、而 L2 做不到的幾何原因。

白話理解

基因分析有上萬個基因特徵、文字分類有幾萬個詞,真正有訊號的是少數 — Lasso 自動把其餘九成特徵的係數砍成零,留下一份精簡、好解釋的特徵名單。

關鍵細節

  • 懲罰方式:係數絕對值和(L1)
  • 係數會被壓到恰好為零 — 自動特徵選擇,模型稀疏、好解釋
  • 適合稀疏問題:特徵超多但有用的不多
  • 缺點:多個特徵高度相關時,Lasso 只隨機留一個、砍掉其餘,結果不穩定
  • 評估除了 MAE、MSE、RMSE、R²,還可看非零係數數量衡量模型精簡度
🎯 口訣:L1 有稜角,把不重要的係數逼到零。

iPAS 考點

兩大歷屆方向:一是 L1 與 L2 敘述配對 — L1 稀疏化、能特徵選擇,L2 縮小不歸零、求穩定;二是「Lasso 中 L1 為何導致參數收斂為零」— 答案方向是絕對值懲罰的菱形約束有角點,最佳解落在座標軸上,而不是「因為懲罰力道比較大」這種似是而非的選項。

📝 本節掛載 2 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

應用場景

特徵選擇稀疏模型建構基因表達分析

評估指標

MAEMSERMSE非零係數數量

iPAS 歷屆考題詳解(6 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第4題

關於資料正則化 (Regularization) L1、L2方法,下列敘述何者正確?

  1. AL1 權重個數愈多,愈可以提升模型的正確率
  2. BL2 稱為 Lasso 正則化
  3. CL1 運用減少權重的絕對值來控制模型的複雜度
  4. DL2 較 L1 正則化方法會將特徵權重趨近於零
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 L1 正則化(Lasso)在損失函數加入權重絕對值總和作為懲罰項,藉由縮減權重的絕對值控制模型複雜度;其幾何特性使部分不重要特徵的權重被壓縮至零,產生稀疏解,兼具特徵選擇效果。(C) 正確描述 L1 的運作方式。 【為何其他選項錯了?】 - (A):正則化的目的是限制模型複雜度以防止過擬合;權重個數越多模型越複雜,越容易過擬合,並不會因此提升正確率,與正則化的精神相反。 - (B):名稱對應錯誤。L1 稱為 Lasso(Least Absolute Shrinkage and Selection Operator),L2 稱為 Ridge。 - (D):效果描述顛倒。L1 才會把部分權重壓縮至恰好為零(稀疏解);L2 以平方懲罰使權重整體變小,但通常不會歸零。 提示:L1=Lasso=絕對值懲罰=稀疏、可歸零;L2=Ridge=平方懲罰=縮小但不歸零。
第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第6題

在 Lasso 模型中,L1 正則化 (Regularization) 導致參數收斂為零的原因為何?

  1. AL1 正則化忽略目標變數
  2. BL1 對梯度有平滑作用
  3. CL1 對大係數懲罰較強,促使稀疏解
  4. DL1 會轉換損失函數為非凸形
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 L1 正則化在損失函數加入權重絕對值總和作為懲罰項。絕對值懲罰對非零係數施加不隨係數變小而減弱的收縮力,且在 0 點形成不可微的尖角,使貢獻不足的係數在最佳化過程中被直接推至 0 並停留在 0;結果是不重要特徵的係數收斂為零,產生稀疏解(Sparse Solution),這正是 Lasso 兼具特徵選擇功能的原因。 【為何其他選項錯了?】 - (A):L1 正則化並未忽略目標變數;模型仍在最小化包含目標變數的損失函數,懲罰項只是附加的複雜度約束。 - (B):平滑是 L2 正則化的特性;L1 在 0 點不可微、存在尖角,正因如此才促成稀疏解,與平滑作用相反。 - (D):L1 懲罰(絕對值函數)是凸函數,與凸的均方誤差相加後整體仍為凸;稀疏性來自 0 點的不可微性,而非非凸性。 提示:L1 稀疏解的來源是絕對值懲罰加上 0 點尖角;L2 平滑縮小係數但不歸零。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第26題

在房價預測任務中,若發現特徵如「房間數」與「坪數」存在高度多重共線性(Multicollinearity),為降低共線性對模型參數估計的負面影響,應優先選擇下列哪種模型?

  1. A不受多重共線性影響的決策樹模型
  2. B傳統線性迴歸模型,不含正則化項
  3. C支持向量機搭配線性核函數
  4. D含L1正則化的 LASSO迴歸模型
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 多重共線性(Multicollinearity)會使迴歸係數的估計變異數暴增、數值不穩定。LASSO 迴歸在損失函數加入 L1 正則化項,會把部分係數直接壓縮到零,等於自動在高度相關的特徵之間做選擇、剔除冗餘變數,同時抑制係數膨脹,能有效降低共線性對參數估計的負面影響,是四個選項中最合適的模型。 【為何其他選項錯了?】 - (A):決策樹的預測對共線性確實較不敏感,但「不受影響」的說法過於絕對;且題目關注參數估計的穩定性,樹模型不提供迴歸係數,無法回應題目需求。 - (B):不含正則化的傳統線性迴歸正是受共線性影響最嚴重的模型,係數不穩定的問題完全沒有處理。 - (C):線性核 SVM 沒有針對共線性的處理機制,也不以係數估計與解釋見長,無法解決題目的問題。 提示:高度共線且需要穩定參數估計時採用正則化迴歸;L1 可將冗餘特徵係數壓至零,兼具特徵選擇。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第2題

在建立迴歸或分類模型時,若希望避免模型過度擬合(Overfitting),可透過加入正則化項以限制模型的複雜度。其中,L1正則化(Lasso)的主要效果為何?

  1. A增加模型參數的數量,以提升表現靈活度
  2. B強化梯度穩定性,避免參數更新過度震盪
  3. C產生稀疏模型(Sparse Model),使部分參數權重收斂為零
  4. D提高學習率(Learning Rate),加速模型收斂速度
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 L1 正則化(Lasso)在損失函數中加入權重絕對值總和作為懲罰項。絕對值懲罰的幾何特性(約束區域是有稜角的菱形)使最佳解容易落在座標軸上,讓部分不重要特徵的係數被壓縮到恰好為零,產生稀疏模型(Sparse Model),同時達到內建特徵選擇的效果。這也是 Lasso 常用於高維資料自動挑選變數的原因。 【為何其他選項錯了?】 - (A):正則化的目的是限制模型複雜度,不是增加參數數量;參數越多越容易過擬合,方向完全相反。 - (B):強化梯度穩定性、避免更新震盪依靠批次正規化、梯度裁剪或調整學習率等技巧,不是 L1 懲罰項的功能。 - (D):學習率是優化器的超參數,與正則化項無關;L1 的作用是將不重要的權重壓縮至零,並不會提高學習率或加速收斂。 提示:L1=Lasso=稀疏並內建特徵選擇;L2=Ridge=縮小權重但不歸零。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第32題

某電信公司開發客戶流失預測模型,使用大量顧客行為特徵,例如通話時長、上網頻率、帳單金額、客服聯絡次數等。在訓練過程中,團隊發現部分特徵彼此高度相關,但同時也懷疑有些特徵對流失預測的貢獻度有限。若希望模型在避免過擬合(Overfitting)的同時,能自動篩選出較具代表性的特徵,採用下列哪一種方法最為合適?

  1. A使用早期停止法(Early Stopping)控制訓練回合數,避免過擬合(Overfitting)
  2. B同時移除多重共線性特徵並採用 L2正則化(Ridge),以確保模型穩定收斂
  3. C僅使用L2正則化(Ridge),抑制所有權重幅度但保留全部特徵
  4. D採用L1正則化(Lasso),透過懲罰項使部分特徵係數縮為 0
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 L1 正則化(Lasso)在損失函數加入係數絕對值懲罰,最佳化過程會把貢獻度低、冗餘的特徵係數直接壓縮到 0,等於模型自動完成特徵篩選,同時抑制過擬合。題目要求「避免過擬合的同時,自動篩選出較具代表性的特徵」,兩個需求 Lasso 一次滿足,對高度相關且貢獻有限的特徵尤其適用。 【為何其他選項錯了?】 - (A):早期停止只透過控制訓練回合數防止過擬合,對「哪些特徵重要」沒有任何篩選作用。 - (B):先手動移除共線特徵再使用 Ridge 雖屬可行流程,但「手動移除」不符合題目要求的「自動篩選」,且 Ridge 仍保留所有剩餘特徵。 - (C):L2(Ridge)只把權重整體縮小、不會歸零,全部特徵都留在模型中,沒有特徵選擇效果。 提示:需要模型自動淘汰特徵用 L1(Lasso);只需權重穩定收斂、特徵全數保留用 L2(Ridge)。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第7題

某金融團隊建立信貸風險模型,特徵工程後共產生 200個變數,其中「月收入」、「年收入」、「季收入」三者高度相關。模型上線後業務單位反映:每次重新訓練後,模型輸出的重要特徵清單在這些高度相關特徵間反覆變動,難以向審查單位解釋。請問下列何者為造成此現象最可能的原因?

  1. A模型使用 L2 正則化,導致所有特徵係數被壓縮至接近零,重要性難以區分
  2. B模型使用 L1正則化,面對高度相關特徵時隨機保留其中之一,導致每次訓練保留的特徵不穩定
  3. C模型未使用任何正則化,過擬合導致係數每次收斂至不同極值
  4. D特徵數量過多導致梯度消失,應優先進行 PCA 降維再套用正則化
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 L1(Lasso)正則化傾向產生稀疏解:面對「月收入、年收入、季收入」這種近乎完全共線的特徵群,L1 只需保留其中一個就能達到幾乎相同的損失;至於保留哪一個,取決於資料的微小擾動與求解路徑。因此每次重新訓練,被保留的特徵可能不同,重要特徵清單自然反覆變動。這是 L1 面對高度相關特徵的固有行為,但對需要穩定解釋的審查場景確實構成困擾。 【為何其他選項錯了?】 - (A):L2 會把相關特徵的權重分攤並全部保留、不歸零,係數估計反而穩定;「所有特徵係數被壓縮至接近零、重要性難以區分」並非 L2 的實際行為。 - (C):無正則化的過擬合會使係數數值不穩定,但不會出現「三者擇一、每次選擇不同」的稀疏選擇行為;題目現象正是稀疏選擇的典型表現。 - (D):梯度消失是深度神經網路的問題,與特徵數量無關;此選項的診斷與處方都不對應題目情境。 提示:高度相關特徵搭配 L1,保留對象具不確定性;需要穩定解釋用 L2,兼顧稀疏與穩定用 Elastic Net。

相關節點