機器學習知識地圖 · 監督式學習
朴素貝氏
機率分類,快速簡單
觀念教學
看到「免費」「中獎」「點擊」同時出現,它立刻心算:這是垃圾郵件的機率有多高 — 朴素貝氏(Naive Bayes)用機率做分類,快得離譜又意外地準。
核心觀念
基於貝氏定理:用「各類別出現這些特徵的機率」反推「出現這些特徵時屬於各類別的機率」,挑機率最大的類別作答。「朴素」在於它天真地假設特徵之間相互獨立 — 每個詞互不影響,機率可以直接相乘,計算因此飛快。
白話理解
垃圾郵件過濾的開山功臣:先統計「免費」在垃圾信與正常信的出現頻率,新信進來把各詞的證據乘起來,哪邊機率高判哪邊。「紐約」和「時報」明明常一起出現、獨立假設根本不成立,但它的分類效果神奇地不錯。
優缺點
- 優點:訓練與預測超快,適合即時系統
- 優點:訓練資料少也能用;對高維度文字資料表現好
- 典型場景:垃圾郵件過濾、文本分類、情感分析、新聞分類
- 缺點:特徵獨立假設在現實幾乎不成立,輸出的機率值本身別太當真
- 評估:準確率、精確率、召回率、F1-Score
🎯 口訣:貝氏定理算機率,天真假設各特徵互不干涉。
iPAS 考點
歷屆考「貝氏分類器依模型特性最適合歸於哪一類」— 答案方向:監督式學習的機率型分類器,以貝氏定理計算後驗機率。判斷關鍵字:貝氏定理、條件機率、特徵獨立假設、文字分類與垃圾郵件過濾;別因為它輸出機率,就誤歸成非監督式或分群方法。
📝 本節掛載 1 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。
應用場景
評估指標
iPAS 歷屆考題詳解(3 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
貝氏分類器(Naive Bayes Classifier)常被應用於文字分類、垃圾郵件過濾等場景。依據模型特性,它最適合歸類於下列哪一類?
- A透過直接學習輸入特徵與目標標籤之間的邊界或關係來進行分類的模型
- B透過建構資料的整體分布,並利用條件關係進行推斷和分類的模型
- C側重探索資料中樣本間的相似性,將資料自動分成不同群組的模型
- D透過試錯學習,根據行動結果的獎勵或懲罰來優化決策策略的模型
看正解與逐選項詳解
正解:B
某電商平台希望預測顧客是否會購買特定商品。系統蒐集顧客的瀏覽紀錄、停留時間、商品類別偏好與過去購買行為,並以此推估「在觀察到這些行為特徵的情況下,該顧客會購買的機率」。若模型採用貝氏定理(Bayes’Theorem)進行推論,下列敘述何者最符合其核心運作機制?
- A根據歷史樣本自動分群,找出行為相似的顧客群
- B以條件機率方式計算顧客屬於「會購買」或「不會購買」的分類機率
- C以最小平方誤差(Mean Squared Error)為損失函數,預測顧客的購買金額
- D依據回饋信號(Feedback Signal)透過強化學習(Reinforcement Learning)動態調整推薦策略
看正解與逐選項詳解
正解:B
某電商平台使用樸素貝氏分類器(Naive Bayes Classifier)建立垃圾郵件過濾模型。訓練集準確率(Accuracy)達 92%,但上線後發現,包含「限時優惠、立即下單享折扣」等關鍵字的正常促銷郵件,常被誤判為垃圾信。經分析發現,這些詞彙在訓練資料中多出現在垃圾郵件中,導致其類別條件機率偏高。請問造成此現象的最主要原因與較適當的改善方式為何?
- A應禁用 Naive Bayes,改用其他更先進演算法
- B模型過擬合於訓練資料,應增加 Epoch數以提升泛化能力
- C類別條件機率受訓練資料分布影響,導致促銷關鍵字被視為垃圾信特徵,應重新平衡資料或調整先驗機率
- D模型未進行特徵標準化(Feature Scaling),導致分類邊界偏移,應先進行正規化處理
看正解與逐選項詳解
正解:C