深度學習知識地圖 · 評估指標
評估指標
Perplexity, Loss
觀念教學
語言模型好不好,不能只憑「讀起來順」的感覺。RNN 時代傳下來的量尺有三:Perplexity(困惑度)、Loss,語音任務再加 WER。
核心觀念
- Perplexity:衡量語言模型品質,越低越好。白話理解:模型預測下一個字時,平均在幾個候選之間猶豫 — 困惑度 10,約等於每步在 10 個字裡拿不定主意
- Loss:訓練時的交叉熵損失,量預測分佈與正確答案的差距;Perplexity 本質上是這個損失的指數版,一體兩面
- WER(語音):RNN 常用於語音辨識,產出的文字以詞錯誤率驗收,同樣越低越好
白話理解
客服機器人接話測試:好模型看到「請問要退…」,幾乎篤定下一個詞是「貨」或「款」,困惑度低;爛模型在幾百個詞之間亂猜,困惑度爆表。訓練有沒有進展,就看這兩條線有沒有一路往下走。
關鍵細節
- 困惑度只能在同一份測試資料上比較模型,跨資料集比大小沒有意義
- Loss 降,Perplexity 必降:訓練盯 Loss,對外報 Perplexity
- 這些是「模型內功」指標;翻譯、摘要等下游任務另有 BLEU、ROUGE 伺候
🎯 口訣:困惑度=模型的猶豫程度,猶豫越少,功力越深。
iPAS 考點
定義題:「衡量語言模型品質、數值越低越好」→ Perplexity。方向陷阱:選項寫「Perplexity 越高,語言模型越好」必錯。配對:語音辨識品質 → WER;訓練過程的優化目標 → Loss。三個指標,三種戰場,別張冠李戴。