機器學習知識地圖 · 監督式學習
線性回歸
最基礎的回歸演算法
觀念教學
一條直線打天下 — 線性回歸(Linear Regression)是最基礎的回歸演算法,也是理解一切機器學習的起點。
核心觀念
用一條直線(特徵多時是超平面)去擬合資料點,預測連續數值。公式白話版:預測值 = 截距 + 係數一乘特徵一 + 係數二乘特徵二,依此類推;訓練就是找出讓「誤差平方和」最小的那組係數。
白話理解
給一堆(坪數, 房價)的資料,它畫出一條最佳直線;之後輸入坪數,沿著線讀出預測房價。銷售額預測、氣溫預測這類「特徵變大、結果跟著變」的問題都適用。
優缺點
- 優點:簡單、快速、可解釋 — 係數直接告訴你每個特徵的影響力,例如坪數每加一坪、房價加多少萬
- 缺點:只能抓線性關係,資料是曲線或複雜模式就失準
- 缺點:特徵太多容易過擬合,需搭配 Ridge 或 Lasso 正則化
- 缺點:對離群值敏感,一筆天價豪宅能拉歪整條線
- 評估用 MAE、MSE、RMSE、R²;R² 越接近 1 代表解釋力越好
🎯 口訣:一條直線找關係,係數就是影響力。
iPAS 考點
判斷關鍵字「預測連續數值、模型可解釋」→ 線性回歸。最經典的陷阱是它與邏輯斯回歸的分工:線性回歸預測數值,邏輯斯回歸做分類 — 兩個名字都有「回歸」,用途卻不同,選項故意互換時別上當。
應用場景
評估指標
iPAS 歷屆考題詳解(4 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某研究人員欲使用線性迴歸模型(Linear Regression Model)分析變數Y與X之間的關係,但發現 Y的分佈明顯右偏,且其變異數隨 X 的增大而增加。為滿足模型假設並提升配適效果,下列哪一種前處理方法最為合適?
- A對X進行標準化(Standardization)
- B對Y進行Box–Cox轉換(Box–Cox Transformation)
- C對資料進行一次差分(First Differencing)
- D將Y中變異較大的樣本移除
看正解與逐選項詳解
正解:B
使用行銷資料集(DataFrame 變數為 df,欄位為 youtube、facebook、newspaper、sales),且資料集已填補遺漏值。執行以下程式碼: from sklearn.linear_model import LinearRegression import statsmodels.api as sm X = df[['youtube', 'facebook', 'newspaper']] y = df['sales'] reg = 空格1 print(reg.coef_) X2 = sm.add_constant(X) model_sm = 空格2 print(model_sm.summary()) OLS 迴歸結果(No. Observations: 200,R-squared: 0.898)的係數表如下: const:coef 3.5561,P>|t| 0.000 youtube:coef 0.0455,P>|t| 0.000 facebook:coef 0.1891,P>|t| 0.000 newspaper:coef -0.0006,P>|t| 0.914 針對下列敘述: A:空格1完整語法 reg = LinearRegression().fit(y, X) B:空格1完整語法 reg = LinearRegression().fit(X, y) C:print(reg.coef_) 結果為包括截距項等 4 個係數值 D:空格2完整語法 sm.OLS(X2, y).fit() E:model_sm 迴歸模型的所有迴歸係數在 α=0.05 之下具有顯著的解釋力 F:截距項係數值為 3.5561 下列何者正確?
- AB、C、F
- BB、F
- CA、C、D、F
- DB、E
看正解與逐選項詳解
正解:B
某房地產公司利用多元迴歸模型(Multiple Regression Model)預測房價,並繪製殘差圖(Residual Plot)檢查模型品質。結果顯示部分資料點的殘差極大,且在高價區樣本中出現系統性彎曲分佈現象。根據此觀察,下列何者為最可能的正確解釋?
- A模型過度擬合(Overfitting),導致在訓練資料上表現過好、泛化能力不足
- B模型特徵數量不足,導致欠擬合(Underfitting)
- C模型存在異常值(Outlier)或非線性關係,違反迴歸假設
- D殘差圖呈現隨機分佈,表示模型已完全符合所有假設
看正解與逐選項詳解
正解:C
某工程師完成多元線性迴歸模型後,繪製殘差圖(Residual Plot),發現殘差隨預測值增大而呈現擴散現象(右側明顯比左側分散)。此現象最可能代表什麼問題?
- A殘差之間存在關聯
- B特徵之間高度相關
- C殘差變異數不一致
- D殘差不符合常態分布
看正解與逐選項詳解
正解:C