機器學習知識地圖 · 半監督式學習
自訓練
Self-Training
觀念教學
模型當自己的老師:先學會一點,再幫沒答案的題目寫參考解,只把有把握的收進題庫,愈學愈多。
核心觀念
自訓練(Self-Training,又稱自我訓練)是最簡單的半監督方法。流程:先用標記資料訓練初始模型;拿模型預測未標記資料;把高信心預測連同其標籤加入訓練集;重新訓練,反覆迭代。
白話理解
客服中心只標了五千筆工單分類,還有二十萬筆沒標。先用五千筆訓練,模型對某些未標工單的預測信心高達九成八,就直接收編;信心只有六成的先放著。幾輪下來,訓練集像滾雪球一樣長大。
成敗關鍵
- 信心閾值:設太低會收進錯誤標籤,設太高則幾乎擴充不了資料
- 偽標籤準確率:早期收進錯標籤,模型會把錯誤愈學愈深,形成確認偏誤與誤差累積
- 初始模型要夠準 — 差老師教不出好學生
- 可限制每輪只收信心最高的前幾名樣本,守住品質
🎯 口訣:自己教自己 — 只抄有把握的答案,亂抄會愈錯愈深。
iPAS 考點
判斷關鍵字:用模型自身的高信心預測擴充訓練集、反覆迭代,且是半監督家族中最簡單的一支。易混淆對:偽標籤(Pseudo-Labeling)是它的核心零件,兩者常互相指涉;協同訓練是「兩個模型互教」,自訓練只有一個模型。陷阱選項:「把所有未標記預測全部收進來」— 錯,只收高信心的。