機器學習知識地圖 · 半監督式學習

偽標籤

Pseudo-Labeling

在互動地圖中開啟 回機器學習知識地圖

觀念教學

沒有標籤?自己造一個。偽標籤就是把模型的預測「當真」,讓未標記資料也能上場訓練。

核心觀念

偽標籤(Pseudo-Labeling)把模型對未標記資料的預測結果當作「偽標籤」,與真實標籤一起訓練。它常用於深度學習,搭配 Dropout資料增強(Data Augmentation)效果更好 — 擾動讓模型不至於對自己的假答案過度自信。

白話理解

製造業瑕疵檢測只有三千張人工標註影像,產線每天卻新增上萬張。用現有模型幫新影像打偽標籤,挑高信心的混入訓練;再配隨機翻轉、亮度擾動等增強,模型愈練愈壯,標註成本幾乎不變。

實務要點

  • 偽標籤品質決定成敗:錯的偽標籤等於餵毒,錯誤會被模型放大
  • 常設信心門檻過濾,只收預測機率極高的樣本
  • 偽標籤的損失通常先給較小權重,再隨訓練逐步提高,顧好訓練穩定性
  • 與自訓練搭配,就是「打偽標籤 → 收編 → 再訓練」的迭代循環
🎯 口訣:假標籤、真訓練 — 挑有把握的用,配增強才不走鐘。

iPAS 考點

判斷關鍵字:把模型預測當標籤、與真實標籤混合訓練、深度學習常用。易混淆對:偽標籤是「技巧與產物」,自訓練是「迭代流程」— 看題目重點在「標籤怎麼來」還是「流程怎麼跑」。陷阱:偽標籤不是人工標註,也不保證正確,品質管控是必要配套。

應用場景

影像分類物件偵測語意分割

評估指標

偽標籤品質訓練穩定性

相關節點