深度學習知識地圖 · 評估指標

評估指標

Accuracy, F1

在互動地圖中開啟 回深度學習知識地圖

觀念教學

BERT 是「理解型」選手:做分類、判斷、抽取,不做生成。所以驗收用分類指標四件套:Accuracy、Precision、Recall、F1-Score

核心觀念

  • Accuracy(準確率):整體判對的比例
  • Precision(精確率):模型說「是」的裡面,真的是的比例 — 量誤報多不多
  • Recall(召回率):所有真正的「是」裡面,被抓出來的比例 — 量漏抓多不多
  • F1-Score:精確率與召回率的調和平均,綜合兩者;偏廢任何一邊,F1 都高不起來

白話理解

金融風控用 BERT 判斷詐騙訊息:Precision 低=常誤殺正常訊息,客戶被騷擾;Recall 低=詐騙漏網,賠掉真金白銀。兩邊都要顧,所以對外驗收看 F1。白話公式順手背:精確率 = 抓對的 除以 全部抓的;召回率 = 抓對的 除以 應該抓的。

關鍵細節

  • 情感分析、垃圾訊息過濾、意圖分類 — BERT 的典型任務全是分類,四件套通用
  • 類別不平衡(詐騙佔比極低)時 Accuracy 虛胖,以 F1 為準
  • 分水嶺:理解任務用分類指標,生成任務用 BLEU、ROUGE 或人工評測 — GPT 這類生成模型別拿四件套硬套
🎯 口訣:Precision 抓誤報,Recall 抓漏網,F1 一手抓兩邊。

iPAS 考點

配對題:「綜合精確率與召回率的指標」→ F1-Score。情境題:「漏判代價高」(如詐騙、疾病篩檢)→ 重 Recall;「誤判代價高」(如誤鎖正常帳戶)→ 重 Precision。陷阱:拿 BLEU、ROUGE 評 BERT 的分類任務 — 那是生成任務的尺,拿錯尺整題泡湯。

應用場景

Accuracy - 分類正確率F1-Score - 綜合指標

評估指標

AccuracyF1-ScorePrecisionRecall

相關節點