深度學習知識地圖 · 評估指標
評估指標
Accuracy, F1
觀念教學
BERT 是「理解型」選手:做分類、判斷、抽取,不做生成。所以驗收用分類指標四件套:Accuracy、Precision、Recall、F1-Score。
核心觀念
- Accuracy(準確率):整體判對的比例
- Precision(精確率):模型說「是」的裡面,真的是的比例 — 量誤報多不多
- Recall(召回率):所有真正的「是」裡面,被抓出來的比例 — 量漏抓多不多
- F1-Score:精確率與召回率的調和平均,綜合兩者;偏廢任何一邊,F1 都高不起來
白話理解
金融風控用 BERT 判斷詐騙訊息:Precision 低=常誤殺正常訊息,客戶被騷擾;Recall 低=詐騙漏網,賠掉真金白銀。兩邊都要顧,所以對外驗收看 F1。白話公式順手背:精確率 = 抓對的 除以 全部抓的;召回率 = 抓對的 除以 應該抓的。
關鍵細節
- 情感分析、垃圾訊息過濾、意圖分類 — BERT 的典型任務全是分類,四件套通用
- 類別不平衡(詐騙佔比極低)時 Accuracy 虛胖,以 F1 為準
- 分水嶺:理解任務用分類指標,生成任務用 BLEU、ROUGE 或人工評測 — GPT 這類生成模型別拿四件套硬套
🎯 口訣:Precision 抓誤報,Recall 抓漏網,F1 一手抓兩邊。
iPAS 考點
配對題:「綜合精確率與召回率的指標」→ F1-Score。情境題:「漏判代價高」(如詐騙、疾病篩檢)→ 重 Recall;「誤判代價高」(如誤鎖正常帳戶)→ 重 Precision。陷阱:拿 BLEU、ROUGE 評 BERT 的分類任務 — 那是生成任務的尺,拿錯尺整題泡湯。