機器學習知識地圖 · 半監督式學習

自訓練

Self-Training

在互動地圖中開啟 回機器學習知識地圖

觀念教學

模型當自己的老師:先學會一點,再幫沒答案的題目寫參考解,只把有把握的收進題庫,愈學愈多。

核心觀念

自訓練(Self-Training,又稱自我訓練)最簡單的半監督方法。流程:先用標記資料訓練初始模型;拿模型預測未標記資料;把高信心預測連同其標籤加入訓練集;重新訓練,反覆迭代

白話理解

客服中心只標了五千筆工單分類,還有二十萬筆沒標。先用五千筆訓練,模型對某些未標工單的預測信心高達九成八,就直接收編;信心只有六成的先放著。幾輪下來,訓練集像滾雪球一樣長大。

成敗關鍵

  • 信心閾值:設太低會收進錯誤標籤,設太高則幾乎擴充不了資料
  • 偽標籤準確率:早期收進錯標籤,模型會把錯誤愈學愈深,形成確認偏誤與誤差累積
  • 初始模型要夠準 — 差老師教不出好學生
  • 可限制每輪只收信心最高的前幾名樣本,守住品質
🎯 口訣:自己教自己 — 只抄有把握的答案,亂抄會愈錯愈深。

iPAS 考點

判斷關鍵字:用模型自身的高信心預測擴充訓練集、反覆迭代,且是半監督家族中最簡單的一支。易混淆對:偽標籤(Pseudo-Labeling)是它的核心零件,兩者常互相指涉;協同訓練是「兩個模型互教」,自訓練只有一個模型。陷阱選項:「把所有未標記預測全部收進來」— 錯,只收高信心的。

應用場景

文本分類情感分析垃圾郵件偵測

評估指標

偽標籤準確率信心閾值

相關節點