機器學習知識地圖 · 半監督式學習
半監督式學習
Semi-Supervised Learning
觀念教學
標記資料貴到肉痛,未標記資料卻堆成山 — 半監督式學習就是「少量標籤帶大量無標籤」的省錢打法。
核心觀念
半監督式學習(Semi-Supervised Learning)結合少量標記資料與大量未標記資料一起訓練。核心假設:資料分布本身藏著結構,相似樣本應有相似標籤;未標記資料雖然沒答案,卻能幫模型看清這個結構。當標記成本昂貴或標記稀少時特別有用,能有效利用未標記資料提升模型效能與泛化能力。
白話理解
連鎖超市要做生鮮損耗預測:資料庫有 120 萬筆銷售紀錄,只有約 8 萬筆標了「正常銷售/損耗發生」,其餘全未標註。全部人工補標不現實 — 半監督讓上百萬筆未標記資料也出力,把標記資料利用率與未標記資料貢獻度一起最大化。這正是 iPAS 考過的原題情境。
主要方法家族
- 自訓練(Self-Training)與偽標籤:模型自己幫未標記資料打標籤,高信心的收進訓練集
- 協同訓練(Co-Training):兩個不同視角的分類器互相教學
- 標籤傳播(Label Propagation):把資料建成圖,標籤沿著「相似邊」流動
- 一致性正則化(Consistency Regularization):同一筆資料加擾動,預測不准變
🎯 口訣:有標籤是監督、沒標籤是非監督、部分標籤就是半監督 — 少量老師帶大量自習生。
iPAS 考點
題目給「僅少部分資料有標記、標註資源有限、想提升模型表現」→ 答半監督式學習。判斷關鍵字:少量標記+大量未標記、標註成本高昂。陷阱:「完全沒標籤」是非監督式、「靠獎勵回饋試錯」是強化學習;別被「資料量很大」帶偏,看的是標籤比例,不是資料量。
📝 本節掛載 1 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。
應用場景
評估指標
iPAS 歷屆考題詳解(1 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某大型連鎖超市建置生鮮商品損耗預測模型,以減少報廢損失。資料庫中共有 120 萬筆銷售紀錄,但僅有約8 萬筆資料標記為「正常銷售」或「損耗發生」, 其餘資料均未標註。在標註資源有限的情況下,團隊希望提升模型預測表現。 請問下列哪一種機器學習方式最適合此情境?
- A監督式學習(Supervised Learning),以8 萬筆已標註資料訓練分類模型,捨棄其餘112 萬筆無標註資料;
- B半監督式學習(Semi-supervised Learning),同時利用少量已標註資料學習分類邊界,並從大量無標註資料中學習資料整體分布特性;
- C非監督式學習(Unsupervised Learning),對全部120 萬筆資料進行自動分群,再由專家事後人工確認各群所代表的損耗類型;
- D強化學習(Reinforcement Learning),讓模型在每次預測後依據實際損耗結果作為回饋訊號,持續調整損耗預警策略
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
題幹條件是 120 萬筆資料中僅約 8 萬筆有標註,其餘大量資料未標註,且標註資源有限。半監督式學習(Semi-supervised Learning)正是為此情境設計:以少量已標註資料學習分類邊界,同時利用大量無標註資料掌握整體資料分布特性(如群聚結構、決策邊界應落在低密度區的假設),比只使用標註資料訓練更能提升模型表現。
【為何其他選項錯了?】
- (A):只使用 8 萬筆標註資料,等於捨棄 112 萬筆無標註資料所蘊含的分布資訊,在標註稀少時模型表現受限。
- (C):純非監督式分群無法直接學到「正常銷售/損耗發生」的分類目標,分群結果仍需大量人工解讀,無法直接滿足預測需求。
- (D):強化學習適用於序列決策與環境回饋情境;本題是標註不足的分類預測問題,沒有行動與獎勵的互動結構。
提示:「少量標註搭配大量未標註」是半監督式學習的典型情境;應同時利用兩類資料的資訊。