深度學習知識地圖 · 基礎架構
損失函數
MSE, Cross-Entropy
觀念教學
模型要進步,得先知道自己「錯多少」。損失函數(Loss Function)就是那把尺:把預測值與真實值的差距量化成一個數字 — Loss 值,整個訓練就是想辦法讓它變小。
核心觀念
損失函數是模型優化的目標。訓練迴圈長這樣:模型預測 → 損失函數比對預測值與實際值的差距 → 反向傳播計算梯度 → 更新內部參數 → 再預測,反覆進行,直到 Loss 趨於穩定。訓練曲線上那條往下掉的線,就是它。
白話理解
射箭教練的兩種評分表:MSE 量「箭離靶心幾公分」,量的是數值差距;交叉熵量「你有多不相信正確答案」,量的是機率差距。任務不同,評分表就不同 — 拿分類的尺去量回歸,模型會練歪。
兩大經典與使用守則
- MSE(Mean Squared Error,均方誤差):回歸任務用。白話公式:誤差平方後取平均;平方會放大離譜的錯,逼模型別犯大錯。房價、氣溫、銷量這類數值預測都是它
- Cross-Entropy(交叉熵):分類任務用;模型給正確類別的機率越低,罰得越重。搭配 Sigmoid 或 Softmax 輸出使用
- 對應是鐵律:回歸 → MSE(或 MAE);分類 → Cross-Entropy
- Loss 是給機器看的優化目標;準確率等指標才是給人看的成績單
- 訓練 Loss 持續下降、驗證 Loss 回升 = 過擬合警訊
🎯 口訣:回歸量距離用 MSE,分類量機率用交叉熵。
iPAS 考點
兩個真實考向。一、直球題:「預測房價(數值)該用哪種損失函數」→ MSE,判斷關鍵字是連續數值預測。二、敘述題:「持續比對預測值與實際值之間的差距,並透過一套機制逐步調整模型內部參數,直到結果趨於穩定」→ 講的正是損失函數搭配梯度下降的訓練機制;陷阱選項會塞激活函數、資料前處理,認明「比對差距+逐步調參」兩個動作就能鎖定。
📝 本節掛載 2 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。
應用場景
評估指標
iPAS 歷屆考題詳解(6 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
在訓練機器學習模型時,若任務為預測房價(數值),應選用下列哪一種損失函數(Loss Function)來衡量預測誤差?
- A均方誤差(MSE)
- B交叉熵損失(Cross-Entropy Loss)
- CHinge 損失(Hinge Loss)
- DKL 散度(Kullback-Leibler Divergence)
看正解與逐選項詳解
正解:A
小明剛加入一間電商公司擔任 AI 專案的業務窗口,在與技術團隊的交接會議中,工程師說明模型訓練時,會持續比對預測值與實際值之間的差距,並透過一套機制逐步調整模型內部參數,直到預測結果趨於穩定為止。請問工程師敘述的是深度學習中哪個元件的功能?
- A優化器(Optimizer);
- B資料前處理模組;
- C模型架構;
- D激活函數(Activation Function)
看正解與逐選項詳解
正解:A
某金融科技公司導入多任務學習架構,讓單一 Transformer 模型同時執行OCR(Optical Character Recognition)後的文檔分類以及命名實體辨識(Named Entity Recognition, NER)任務,以協助自動歸檔與抽取關鍵金融資訊。在部署初期,團隊發現當模型的NER準確率(Accuracy)提升時,文檔分類準確率反而下降。若模型架構正確且資料品質良好,下列哪一項最可能是造成此現象的原因?
- A模型架構無法同時支援文字分類與序列標註任務(Sequence Labeling)
- B文檔分類任務不需要語意化表徵(Contextualized Representation)
- C損失函數(Loss Function)未進行權重平衡,導致任務間競爭
- D所使用的 BERT模型無法支援多任務輸出頭(Multi-Head Outputs)
看正解與逐選項詳解
正解:C
某工程師在建立房價預測模型時,訓練資料中存在少數豪宅(成交價超過一般物件10倍以上)。若工程師希望模型對這些極端高價物件的預測誤差更敏感,並在訓練時產生較大的梯度更新影響,應優先選擇下列哪種損失函數?
- A平均絕對誤差(MAE):對誤差進行線性懲罰,對離群值較不敏感,梯度近似固定
- BHuber 損失(Huber Loss):小誤差採平方懲罰,大誤差轉為線性懲罰,以降低離群值影響
- C均方誤差(MSE):對誤差進行平方處理,使大誤差產生更大的懲罰與梯度
- D交叉熵損失(Cross-Entropy Loss):用於分類問題的機率分布差異衡量
看正解與逐選項詳解
正解:C
某工程師同時開發兩個模型:一個預測使用者「隔日 App使用時長(分鐘)」,另一個預測使用者「隔日是否流失(是/否)」。關於上述兩個任務,他應分別選擇哪種適當的損失函數?
- A使用時長預測:均方誤差(MSE);流失預測:二元交叉熵(Binary Cross- Entropy)
- B使用時長預測:交叉熵損失(Cross-Entropy);流失預測:均方誤差(MSE)
- C使用時長預測:Hinge 損失(Hinge Loss);流失預測:MAE(平均絕對誤差)
- D兩個任務均使用交叉熵損失,因為兩者的輸出都有不確定性
看正解與逐選項詳解
正解:A
工程師在 PyTorch 中建構貓、狗、鳥三分類 CNN,並使用交叉熵損失函數(CrossEntropyLoss)作為訓練目標。由於此損失函數在內部已包含 Softmax 計算,輸出層的設計需特別注意。請問輸出層的激活函數(Activation Function)與輸出維度應如何設定?
- A使用 ReLU 作為激活函數,輸出維度設為 1,直接輸出單一數值作為預測結果;
- B使用 Sigmoid 作為激活函數,輸出維度設為 3,使每個類別獨立輸出 0到1的機率
- C不使用任何激活函數,直接輸出未經正規化的 logits,輸出維度設為 3 對應三個類別
- D使用 Softmax 作為激活函數,輸出維度設為 3,輸出為已正規化的機率分布
看正解與逐選項詳解
正解:C