多项式贝叶斯#
术语解释#
多项式朴素贝叶斯(Multinomial Naive Bayes, MNB) 是一种基于朴素贝叶斯思想的分类模型,主要用于处理离散特征,在文本分类(如垃圾邮件识别)任务中表现尤为出色。
多项式朴素贝叶斯假定特征是由一个简单多项式分布生成的。在多项式朴素贝叶斯中,条件概率的分布被参数化为每个类别下特征出现的频次占比。它通过最大似然估计来计算参数,具体公式为:
$$ \hat{\theta}_{c_ki} = \frac{N_{c_ki} + \alpha}{N_{c_k} + \alpha n} $$其中 $N_{c_ki}$ 表示在类别 $c_k$ 下特征 $i$ 出现的总频次,$N_{c_k}$ 是该类别下所有特征的总频次。
同时,为了防止高维文本向量连乘导致的数值下溢,实际计算时通常取对数似然。预测时,模型会选择使对数后验概率最大的类别作为样本的标签。更多与多项式朴素贝叶斯相关的原理讲解可参见「7.4 多项式朴素贝叶斯原理与实现:文本分类常用模型」 内容。
出现动机#
在 Categorical NB 中,特征被视为类别取值。如果直接将词频作为类别,一旦测试集中某个词的频次超过了训练集的范围,模型将无法找到对应的条件概率。
同时,在词袋模型中,词频是衡量词语重要性的关键因素。多项式贝叶斯设计的初衷就是将每个维度的词频占比作为条件概率建模,从而更准确地反映特征在不同类别中的重要程度。
优点缺点#
-
优点:
-
文本处理效果好:在处理基于词袋模型或 TF-IDF 表示的文本数据时,多项式贝叶斯通常能取得非常稳健且优秀的分类效果。
-
具备线性模型的特性:由于使用了对数运算,多项式贝叶斯可以被理解为一个简单的线性模型,其中词频对应的对数条件概率可以看作是该特征在对应类别下的权重。
-
计算效率高:模型拟合过程本质上是特征计数的累加过程,训练和预测速度都非常快。
-
支持平滑处理:通过引入拉普拉斯平滑($\alpha$ 系数),可以有效解决由于某些特征在训练集中未出现而导致的零概率问题。
-
-
缺点:
-
独立性假设限制:同所有朴素贝叶斯算法一样,它假设特征之间是相互独立的。在文本语境中,词与词之间往往存在关联(如“北京”和“大学”),这一假设的违背可能会影响分类精度。
-
数值稳定性依赖对数:在处理长文本时,如果直接进行概率累乘,结果会迅速趋于零(数值下溢),因此必须依赖对数空间进行计算。
-
对特征分布有预设:它假设特征符合多项式分布,如果数据的分布特征与此严重不符,模型的效果可能不如高斯朴素贝叶斯(Gaussian NB)等其他变体。
-
相关术语#
-
朴素贝叶斯
-
高斯朴素贝叶斯