📧 新信件
📩
「恭喜!你獲得免費獎金!」
AI 要判斷:
🚨 垃圾郵件?還是 📬 正常郵件?
貝氏分類器|「先算機率,再猜你是哪一類!」
AI 要判斷:
🚨 垃圾郵件?還是 📬 正常郵件?
觀察「免費、獎金、恭喜」等特徵。
算出:
P(垃圾郵件|這些文字)
如果機率最高 → 判斷為垃圾郵件。
它是監督式的生成式機率分類模型。先從訓練資料估計「每個類別有多常見」與「某特徵在該類別出現的機率」,再用 Bayes 定理反推新資料最可能屬於哪一類。
監督式學習分類生成式模型機率歷史資料告訴我:
這叫先驗機率 P(類別)。
「免費」這個詞:
這是條件機率 P(特徵|類別)。
把資訊合起來:
P(垃圾|特徵)
和其他類別比較,誰最高就選誰。
P(類別|特徵)
看到這些特徵後,屬於這個類別的機率。
P(特徵|類別)
如果本來就是這個類別,看到這些特徵的機率。
P(類別)=先驗機率
P(特徵|類別)=條件機率/似然相關項
P(類別|特徵)=後驗機率
出現:
它做了一個很「天真」的假設:
「在知道類別後,各特徵之間可以近似看成彼此獨立。」
雖然現實中的文字特徵通常不是完全獨立,但這個簡化假設讓計算變得非常容易。
簡單、快速、常常很好用。
| 比較 | 🟢 Generative Model | 🔵 Discriminative Model |
|---|---|---|
| 核心問題 | 「資料是怎麼產生的?」 | 「這筆資料應該分到哪一類?」 |
| 學習方式 | 建構/估計資料的機率分布 | 直接學習類別之間的關係或決策邊界 |
| 代表例子 | Naive Bayes、Gaussian Mixture Model 等 | Logistic Regression、SVM 等 |
| 漫畫記憶 | 🧠「先把世界的機率畫出來」 | ✏️「直接畫一條分界線」 |
| 類型 | 漫畫 | 在做什麼? | 代表 |
|---|---|---|---|
| 生成式模型 | 🎨 | 建構/估計資料分布,再進行推斷 | Naive Bayes |
| 判別式模型 | ✏️ | 直接學分類關係/決策邊界 | Logistic Regression、SVM |
| 分群 | 👥 | 根據相似性自動分組 | K-means |
| 強化學習 | 🎮🏆 | 透過行動與獎勵學習策略 | Q-learning、Policy-based 方法 |
一封郵件可以拆成:
Naive Bayes 可以快速估計這些詞在不同類別下出現的機率。
新郵件進來:
因此常見於垃圾郵件過濾、文字分類、文件分類等場景。
看到「先驗機率、條件機率、後驗機率、Bayes 定理」→ Naive Bayes
⭐ Naive Bayes 是「監督式+分類+生成式+機率模型」。
A. 直接學習輸入特徵與標籤之間的邊界或關係
B. 建構資料的整體分布,並利用條件關係進行推斷和分類
C. 探索樣本相似性,自動分成不同群組
D. 透過試錯與獎懲優化決策策略
| 題目關鍵字 | 立刻想到 |
|---|---|
| Bayes 定理 | 🧮 Naive Bayes |
| 先驗機率 P(C) | 🧠 Naive Bayes |
| 條件機率 P(X|C) | 🔎 Naive Bayes |
| 後驗機率 P(C|X) | 🎯 Naive Bayes |
| 生成式模型 | 🟢 Naive Bayes |
| 決策邊界 | 🔵 判別式模型 |
| 相似性、自動分群 | 👥 K-means |
| 獎勵、懲罰、試錯 | 🎮 強化學習 |
⭐ 最終口訣:
「Bayes 先算機率;Naive 假設條件獨立;最後選機率最高的類別。」