機器學習知識地圖 · 監督式學習
分類問題
預測類別(垃圾郵件、疾病)
觀念教學
答案是「從選項中挑一個類別」的問題,都是分類問題(Classification) — 這封信是不是垃圾郵件、這張 X 光有沒有腫瘤、客戶信用等級是 A、B 還是 C。
核心觀念
目標是把輸入資料分配到預先定義的類別中。模型學的是決策邊界:邊界這側判 A 類、那側判 B 類;輸出可以是硬標籤,也可以是各類別的機率。二元分類只有兩個答案(是/否),多類別分類有多個答案(貓/狗/鳥/魚)。
白話理解
健保醫療影像判讀「有無病灶」是二元分類;把商品評論分成正面、中立、負面是多類別分類。金融風控的「會不會違約」、製造業的「良品或瑕疵」,全是分類問題的地盤。
評估指標怎麼選
- 準確率:整體答對比例,類別不平衡時會騙人
- 精確率 = 說是陽性中真的對的比例;召回率 = 真陽性中被抓到的比例
- F1-Score = 精確率與召回率的調和平均,不平衡資料首選
- AUC-ROC 看不同門檻下的整體判別力;Log Loss 評機率品質;混淆矩陣是一切指標的來源
- 進階:隨機森林另有 OOB 誤差與特徵重要性,SVM 看邊界間距,LDA 看類別分離度
🎯 口訣:答案是類別就是分類;資料不平衡,別信準確率,改看 F1。
iPAS 考點
兩類必考:一是回歸與分類的判斷(看輸出型態);二是指標選用情境 — 癌症篩檢怕漏診重召回率,垃圾郵件怕誤殺重精確率。萬年陷阱:「準確率 95% 所以模型很好」— 若 95% 的樣本本來就是負類,全部猜負類也有 95%。