深度學習知識地圖 · 評估指標

評估指標

Perplexity, Loss

在互動地圖中開啟 回深度學習知識地圖

觀念教學

語言模型好不好,不能只憑「讀起來順」的感覺。RNN 時代傳下來的量尺有三:Perplexity(困惑度)Loss,語音任務再加 WER

核心觀念

  • Perplexity:衡量語言模型品質,越低越好。白話理解:模型預測下一個字時,平均在幾個候選之間猶豫 — 困惑度 10,約等於每步在 10 個字裡拿不定主意
  • Loss:訓練時的交叉熵損失,量預測分佈與正確答案的差距;Perplexity 本質上是這個損失的指數版,一體兩面
  • WER(語音):RNN 常用於語音辨識,產出的文字以詞錯誤率驗收,同樣越低越好

白話理解

客服機器人接話測試:好模型看到「請問要退…」,幾乎篤定下一個詞是「貨」或「款」,困惑度低;爛模型在幾百個詞之間亂猜,困惑度爆表。訓練有沒有進展,就看這兩條線有沒有一路往下走。

關鍵細節

  • 困惑度只能在同一份測試資料上比較模型,跨資料集比大小沒有意義
  • Loss 降,Perplexity 必降:訓練盯 Loss,對外報 Perplexity
  • 這些是「模型內功」指標;翻譯、摘要等下游任務另有 BLEU、ROUGE 伺候
🎯 口訣:困惑度=模型的猶豫程度,猶豫越少,功力越深。

iPAS 考點

定義題:「衡量語言模型品質、數值越低越好」→ Perplexity。方向陷阱:選項寫「Perplexity 越高,語言模型越好」必錯。配對:語音辨識品質 → WER;訓練過程的優化目標 → Loss。三個指標,三種戰場,別張冠李戴。

應用場景

Perplexity - 語言模型品質Loss - 訓練損失

評估指標

PerplexityLossWER (語音)

相關節點