機器學習知識地圖 · 監督式學習

回歸問題

預測連續數值(房價、氣溫)

在互動地圖中開啟 回機器學習知識地圖

觀念教學

只要答案是「一個數字」而不是「一個類別」,就是回歸問題(Regression) — 房價多少錢、明天幾度、下個月營收多少。

核心觀念

目標是預測連續數值輸出。模型學的是輸入特徵與數值目標之間的關係,輸出可以是任何實數,而不是從有限選項中挑一個。

白話理解

這間房子值多少錢?明天氣溫幾度?答案是數字 → 回歸。「客戶會不會買」只有會與不會兩個選項 → 那是分類。一句話分清:回歸輸出連續數值(房價 1200 萬),分類輸出類別(會買/不會買)。

常用評估指標

  • MAE = 誤差絕對值的平均:好懂,對離群值不敏感
  • MSE = 誤差平方的平均:會放大大錯誤,對離群值敏感
  • RMSE = MSE 開根號:單位與預測目標相同,最好對人解釋
  • R²(判定係數)= 模型解釋了目標變異的比例,越接近 1 擬合越好
  • 選用原則:在意大錯誤用 MSE/RMSE,要穩健用 MAE,對老闆報告用 R²
  • 殘差分析:預測值與實際值的差距若呈現規律,代表模型漏學了某種模式
🎯 口訣:報數字用回歸,選類別用分類;誤差平方是 MSE,開根號變 RMSE。

iPAS 考點

「這是回歸還是分類」的情境判斷是送分題,關鍵只看輸出型態。真正的陷阱在指標配對:拿準確率評回歸就是錯誤選項,回歸只配 MAE、MSE、RMSE、R²;反過來拿 MSE 評分類任務,同樣是張冠李戴。另一考法是給資料型態問任務類型:目標欄位是連續數值,就往回歸家族找答案。

應用場景

房價預測氣溫預測銷售額預測趨勢分析

評估指標

MAEMSERMSE

iPAS 歷屆考題詳解(2 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第39題

某企業的資料科學團隊利用 ARIMA模型(AutoRegressive Integrated Moving Average Model)預測每週產品銷售量。模型建立完成後,分析人員發現預測誤差隨時間呈現週期性波動,且自相關函數(ACF)顯示殘差在多個時滯(Lag)上仍顯著不為零。根據上述現象,最合理的模型診斷結論為何?

  1. A模型殘差符合白噪音(White Noise)假設,預測表現穩定
  2. B模型殘差雖有輕微異常,但可視為隨機誤差忽略不計
  3. C模型存在配適不足(Underfitting)問題,需重新調整 p 或 q參數以捕捉時間依賴性
  4. D殘差特性不影響預測結果,無須進一步修正
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 ARIMA 模型配適良好時,殘差應接近白噪音(White Noise):無自相關、無規律可循。題目中預測誤差呈週期性波動,且自相關函數(ACF)顯示殘差在多個時滯(Lag)仍顯著不為零,代表資料中還有時間依賴結構未被模型吸收,這就是配適不足(Underfitting)。正確處置是重新識別模型階數,調整自迴歸階數 p 或移動平均階數 q,必要時加入季節項(SARIMA),把殘留的週期結構納入模型。 【為何其他選項錯了?】 - (A):殘差存在顯著自相關,正好違反白噪音假設,「符合白噪音、表現穩定」與題目給的證據直接矛盾。 - (B):多個時滯顯著自相關且呈週期性,是系統性訊號而非隨機誤差;忽略它等於放任模型漏學可預測的資訊。 - (D):殘差存在結構代表點估計與預測區間都會失真,「不影響預測結果、無須修正」忽視了殘差診斷提供的證據。 提示:配適良好的殘差應如白噪音;ACF 在多個時滯仍顯著,表示時間結構尚未學完,應回頭調整 p、q。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第33題

某金融機構的量化分析師在建立資產風險評估模型時,發現報酬率資料分佈明顯非對稱,且出現多次極端損失事件,使得傳統假設常態分佈的模型無法準確反映真實風險。若希望在不依賴常態分佈假設的前提下,採取更能捕捉資料極端情況的建模策略,下列哪一種方法最為合適?

  1. A採用線性迴歸模型(Linear Regression Model),以常態分佈殘差(Residuals)為基礎進行推估
  2. B使用平均數(Mean)與標準差(Standard Deviation)估計波動範圍
  3. C將資料裁剪至 ±3σ 範圍內以排除異常值影響
  4. D採用分位數回歸模型(Quantile Regression Model),聚焦於尾部分位(Tail Quantiles)以評估極端風險
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 分位數迴歸不對誤差分佈做常態假設,而是直接對條件分位數(如第 5、第 95 百分位)建模,能刻畫報酬率分佈的尾部行為,而極端損失正是發生在尾部。對非對稱、厚尾的金融資料,聚焦尾部分位的建模比只描述平均行為的傳統模型更能反映真實風險,也與 VaR(風險值)等風險管理指標直接接軌,完全符合題目「不依賴常態假設、捕捉極端情況」的要求。 【為何其他選項錯了?】 - (A):線性迴歸以常態殘差假設為推估基礎,題目明確要求不依賴常態分佈假設,直接不符前提。 - (B):平均數與標準差只描述分佈的中心與整體離散程度,無法反映厚尾與不對稱,極端事件的資訊會在平均化過程中消失。 - (C):將 ±3σ 以外的資料裁掉,等於刪除最需要分析的極端損失事件,使模型系統性低估尾部風險。 提示:題幹關鍵詞「不依賴常態假設、捕捉極端情況」對應分位數迴歸;裁剪異常值會直接刪除研究對象。

相關節點