機器學習知識地圖 · 監督式學習

朴素貝氏

機率分類,快速簡單

在互動地圖中開啟 回機器學習知識地圖

觀念教學

看到「免費」「中獎」「點擊」同時出現,它立刻心算:這是垃圾郵件的機率有多高 — 朴素貝氏(Naive Bayes)用機率做分類,快得離譜又意外地準。

核心觀念

基於貝氏定理:用「各類別出現這些特徵的機率」反推「出現這些特徵時屬於各類別的機率」,挑機率最大的類別作答。「朴素」在於它天真地假設特徵之間相互獨立 — 每個詞互不影響,機率可以直接相乘,計算因此飛快。

白話理解

垃圾郵件過濾的開山功臣:先統計「免費」在垃圾信與正常信的出現頻率,新信進來把各詞的證據乘起來,哪邊機率高判哪邊。「紐約」和「時報」明明常一起出現、獨立假設根本不成立,但它的分類效果神奇地不錯。

優缺點

  • 優點:訓練與預測超快,適合即時系統
  • 優點:訓練資料少也能用;對高維度文字資料表現好
  • 典型場景:垃圾郵件過濾、文本分類、情感分析、新聞分類
  • 缺點:特徵獨立假設在現實幾乎不成立,輸出的機率值本身別太當真
  • 評估:準確率、精確率、召回率、F1-Score
🎯 口訣:貝氏定理算機率,天真假設各特徵互不干涉。

iPAS 考點

歷屆考「貝氏分類器依模型特性最適合歸於哪一類」— 答案方向:監督式學習的機率型分類器,以貝氏定理計算後驗機率。判斷關鍵字:貝氏定理、條件機率、特徵獨立假設、文字分類與垃圾郵件過濾;別因為它輸出機率,就誤歸成非監督式或分群方法。

📝 本節掛載 1 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

應用場景

垃圾郵件過濾文本分類情感分析

評估指標

準確率精確率召回率F1-Score

iPAS 歷屆考題詳解(3 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第7題

貝氏分類器(Naive Bayes Classifier)常被應用於文字分類、垃圾郵件過濾等場景。依據模型特性,它最適合歸類於下列哪一類?

  1. A透過直接學習輸入特徵與目標標籤之間的邊界或關係來進行分類的模型
  2. B透過建構資料的整體分布,並利用條件關係進行推斷和分類的模型
  3. C側重探索資料中樣本間的相似性,將資料自動分成不同群組的模型
  4. D透過試錯學習,根據行動結果的獎勵或懲罰來優化決策策略的模型
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 樸素貝氏分類器(Naive Bayes Classifier)是典型的生成式模型(Generative Model):先估計各類別的先驗機率 P(y) 與類別條件機率 P(x|y),等同於建構各類別之下特徵資料的分布,再以貝氏定理計算後驗機率 P(y|x) 進行分類,正符合選項 (B)「建構資料的整體分布,並利用條件關係進行推斷和分類」的描述。它計算效率高、對高維稀疏特徵(如詞袋模型)適應良好,因此廣泛應用於文字分類與垃圾郵件過濾。 【為何其他選項錯了?】 - (A):直接學習輸入特徵與標籤之間的邊界或對應關係,是判別式模型(Discriminative Model)的定義,如邏輯迴歸、SVM;樸素貝氏並不直接學習決策邊界,而是經由機率分布推導分類結果。 - (C):探索樣本相似性並自動分組是分群(Clustering)等非監督式學習的描述;樸素貝氏是需要標籤的監督式分類模型。 - (D):透過試錯與獎懲優化決策策略是強化學習(Reinforcement Learning)的定義;樸素貝氏以機率計算直接得出分類結果,沒有回饋與策略調整機制。 提示:生成式模型建構 P(x|y) 與 P(y) 再推得後驗;判別式模型直接學 P(y|x) 或決策邊界;貝氏分類器屬於前者。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第22題

某電商平台希望預測顧客是否會購買特定商品。系統蒐集顧客的瀏覽紀錄、停留時間、商品類別偏好與過去購買行為,並以此推估「在觀察到這些行為特徵的情況下,該顧客會購買的機率」。若模型採用貝氏定理(Bayes’Theorem)進行推論,下列敘述何者最符合其核心運作機制?

  1. A根據歷史樣本自動分群,找出行為相似的顧客群
  2. B以條件機率方式計算顧客屬於「會購買」或「不會購買」的分類機率
  3. C以最小平方誤差(Mean Squared Error)為損失函數,預測顧客的購買金額
  4. D依據回饋信號(Feedback Signal)透過強化學習(Reinforcement Learning)動態調整推薦策略
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 貝氏定理的核心是後驗機率的計算:P(類別|特徵) = P(特徵|類別) × P(類別) / P(特徵)。題幹情境「在觀察到瀏覽紀錄、停留時間等行為特徵的情況下,推估顧客會購買的機率」,正是以條件機率計算樣本屬於「會購買」或「不會購買」兩類的後驗機率,再取機率較高者作為分類結果,這即是貝氏分類器(如 Naive Bayes)的核心運作機制。 【為何其他選項錯了?】 - (A):依相似度自動分群是非監督式學習(如 K-means)的行為,不需要標籤,也與貝氏定理的條件機率推論無關。 - (C):以最小平方誤差作為損失函數預測購買「金額」屬於迴歸任務;題幹要求的是購買「機率」的分類推論,任務型態不符。 - (D):依回饋信號動態調整推薦策略是強化學習的運作模式,與貝氏定理的機率推論機制不同。 提示:貝氏定理=先驗 × 似然推得後驗;題幹出現「在觀察到某些條件下的機率」即指向條件機率。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第14題

某電商平台使用樸素貝氏分類器(Naive Bayes Classifier)建立垃圾郵件過濾模型。訓練集準確率(Accuracy)達 92%,但上線後發現,包含「限時優惠、立即下單享折扣」等關鍵字的正常促銷郵件,常被誤判為垃圾信。經分析發現,這些詞彙在訓練資料中多出現在垃圾郵件中,導致其類別條件機率偏高。請問造成此現象的最主要原因與較適當的改善方式為何?

  1. A應禁用 Naive Bayes,改用其他更先進演算法
  2. B模型過擬合於訓練資料,應增加 Epoch數以提升泛化能力
  3. C類別條件機率受訓練資料分布影響,導致促銷關鍵字被視為垃圾信特徵,應重新平衡資料或調整先驗機率
  4. D模型未進行特徵標準化(Feature Scaling),導致分類邊界偏移,應先進行正規化處理
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 樸素貝氏依「類別條件機率 P(詞|類別) × 先驗機率」進行判斷。訓練資料中「限時優惠、立即下單」等詞大多出現在垃圾郵件,使這些詞在垃圾類別的條件機率被推高;此後任何含這些詞的郵件,包括正常促銷信,都容易被判為垃圾郵件。這是訓練資料分布造成的系統性偏移,適當的改善方式是重新平衡資料(補充含促銷詞的正常郵件樣本)、調整先驗機率或平滑設定,使機率估計貼近實際分布。 【為何其他選項錯了?】 - (A):問題根源在訓練資料分布而非演算法本身;若訓練資料中促銷詞仍與垃圾郵件高度綁定,改用其他演算法仍會學到相同的偏差。 - (B):樸素貝氏以計數估計機率、具封閉解,沒有 Epoch 迭代訓練的概念,「增加 Epoch 數」無從實行;且此現象的成因是資料分布偏移,並非過擬合。 - (D):樸素貝氏使用詞頻機率,不涉及距離或尺度運算;特徵標準化與分類邊界偏移是距離型或梯度型模型才有的議題。 提示:貝氏分類器的判斷完全取決於訓練資料的詞頻分布;資料分布偏移,條件機率就跟著偏移。

相關節點