深度學習知識地圖 · 評估指標
評估指標
Perplexity, BLEU
觀念教學
生成出來的文章沒有唯一標準答案,那要怎麼打分數?GPT 這類生成式模型的成績單,靠的是 Perplexity、BLEU、ROUGE 加上人工評估這幾把尺。
核心觀念
GPT 用於生成任務,評估走三條路。困惑度(Perplexity)衡量語言模型本身的品質:模型對下一個字有多「猶豫」,越篤定分數越低,越低越好。BLEU 與 ROUGE 則拿生成文本和參考文本比重疊:BLEU 偏精確率(生成內容有多少出現在參考答案裡),是機器翻譯標配;ROUGE 偏召回率(參考答案的重點被涵蓋多少),衡量摘要品質。
白話理解
把模型當成翻譯社的新進譯者。Perplexity 像他下筆時的猶豫程度;BLEU 像對照標準譯文,檢查他翻對多少;ROUGE 像檢查摘要有沒有漏掉原文重點。人工評估(Human Eval)則是請資深編輯直接讀 — 最貴最慢,但最接近真實感受。
四把尺怎麼分工
- Perplexity:語言模型內在指標,不需參考答案,越低越好
- BLEU:精確率導向,翻譯任務用,越高越好
- ROUGE:召回率導向,摘要任務用
- Human Eval:流暢度、相關性、有用性等主觀維度的最終防線
- 跨領域「理解力」另有一路:綜合基準測試(Benchmark),用涵蓋多學科的大題庫測模型,如 MMLU
🎯 口訣:BLEU 比翻譯、ROUGE 比摘要、Perplexity 比猶豫 — 前兩個越高越好,最後一個越低越好。
iPAS 考點
真題方向:題目描述「評估 LLM 在法律、醫學、數學、歷史等多學科的整體理解,未見過的題型也要能推理作答」— 答案指向大規模多任務基準評測(MMLU 這類跨領域題庫),不是單一自動指標。陷阱:拿 BLEU 或 Perplexity 冒充「理解能力」評測;另一組經典混淆是 BLEU(精確率、翻譯)對 ROUGE(召回率、摘要),方向別記反。
📝 本節掛載 1 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。
應用場景
評估指標
iPAS 歷屆考題詳解(1 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某研究團隊希望評估大型語言模型在不同學科領域的整體理解能力,包含法律、醫學、數學與歷史等,並要求模型在未見過的題型中仍能正確推理與作答。下列何者最符合此類評測設計的核心概念?
- A單一領域專業知識記憶測驗;
- B多領域、多任務之語言理解能力評估;
- C對話流暢度與語言生成品質測試;
- D資料檢索準確率評估
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
題幹條件是評估模型在法律、醫學、數學、歷史等不同學科的整體理解能力,並要求在未見過的題型上仍能正確推理作答。這對應「多領域、多任務語言理解能力評估」的設計概念:以跨學科題庫測驗模型的通用知識與推理能力,而非侷限單一領域,MMLU 即為此類基準的代表,故 (B) 正確。
【為何其他選項錯了?】
- (A):單一領域知識記憶測驗只檢視特定專業的記憶表現,無法衡量跨學科的整體理解,也不符合「未見題型仍能作答」的泛化要求。
- (C):對話流暢度與生成品質測試針對語言表達層面,無法評估多領域知識掌握與推理正確性。
- (D):資料檢索準確率評估的是系統找到相關資料的能力,屬於檢索系統指標,不是模型本身的多任務理解與推理評測。
提示:「多學科、多任務、未見題型」三個關鍵詞同時出現,即指向 MMLU 類的多領域語言理解評測。