深度學習知識地圖 · 評估指標
評估指標
FID, CLIP Score
觀念教學
擴散模型是「照文字畫圖」,評估自然要考兩科:畫得好不好(FID),以及有沒有照題目畫(CLIP Score)。
核心觀念
FID 與 GAN 共用同一把尺:衡量生成圖像與真實圖像的特徵分布差異,越低代表畫質越逼真。CLIP Score 是文生圖特有:把文字提示與生成圖像分別編碼進 CLIP 的共同嵌入空間,計算相似度 — 分數越高,圖文一致性越好,代表模型「聽懂了描述」,衡量的正是文字描述與生成圖像的匹配程度。
白話理解
美術比賽的兩個評分項。FID 評「畫工」:作品質感和真實照片差多遠;CLIP Score 評「切題」:題目是「戴帽子的柴犬逛夜市」,畫出一隻沒帽子的貓,畫工再好也不行。畫質與聽話是兩回事,所以要兩把尺一起量。
關鍵細節
- FID 低 = 畫質好;CLIP Score 高 = 圖文對齊好 — 兩者互補,單看一個會偏
- IS(Inception Score)也可用,衡量生成品質與多樣性
- CLIP Score 的上限是 CLIP 自己的理解力,太冷門的概念可能量不準
- 文生圖評測慣例:FID 加 CLIP Score 一起報,再用人工評估把關美感
🎯 口訣:FID 管像不像、CLIP Score 管聽不聽話 — 畫質一把尺、切題一把尺。
iPAS 考點
題目給「評估文字描述與生成圖像的匹配程度」→ 答 CLIP Score;給「生成影像與真實影像分布的差距」→ 答 FID。陷阱:拿 BLEU、ROUGE 這類文字任務指標來評圖像;或把 CLIP Score 當成畫質指標 — 它只管圖文一致,不管美醜。