機器學習知識地圖 · 監督式學習

分類問題

預測類別(垃圾郵件、疾病)

在互動地圖中開啟 回機器學習知識地圖

觀念教學

答案是「從選項中挑一個類別」的問題,都是分類問題(Classification) — 這封信是不是垃圾郵件、這張 X 光有沒有腫瘤、客戶信用等級是 A、B 還是 C。

核心觀念

目標是把輸入資料分配到預先定義的類別中。模型學的是決策邊界:邊界這側判 A 類、那側判 B 類;輸出可以是硬標籤,也可以是各類別的機率。二元分類只有兩個答案(是/否),多類別分類有多個答案(貓/狗/鳥/魚)。

白話理解

健保醫療影像判讀「有無病灶」是二元分類;把商品評論分成正面、中立、負面是多類別分類。金融風控的「會不會違約」、製造業的「良品或瑕疵」,全是分類問題的地盤。

評估指標怎麼選

  • 準確率:整體答對比例,類別不平衡時會騙人
  • 精確率 = 說是陽性中真的對的比例;召回率 = 真陽性中被抓到的比例
  • F1-Score = 精確率與召回率的調和平均,不平衡資料首選
  • AUC-ROC 看不同門檻下的整體判別力;Log Loss 評機率品質;混淆矩陣是一切指標的來源
  • 進階:隨機森林另有 OOB 誤差與特徵重要性,SVM 看邊界間距,LDA 看類別分離度
🎯 口訣:答案是類別就是分類;資料不平衡,別信準確率,改看 F1。

iPAS 考點

兩類必考:一是回歸與分類的判斷(看輸出型態);二是指標選用情境 — 癌症篩檢怕漏診重召回率,垃圾郵件怕誤殺重精確率。萬年陷阱:「準確率 95% 所以模型很好」— 若 95% 的樣本本來就是負類,全部猜負類也有 95%。

應用場景

垃圾郵件分類疾病診斷信用評估影像辨識客戶分群風險評估文字分類手寫辨識推薦系統情感分析人臉辨識醫學診斷

評估指標

準確率精確率召回率F1-ScoreAUC-ROCLog Loss混淆矩陣OOB 誤差特徵重要性邊界間距類別分離度

相關節點