更新于 2026年7月21日

最大似然估计#


术语解释#

最大似然估计(Maximum Likelihood Estimation, MLE),也称作极大似然估计,是概率模型最常用的参数估计方法,核心思想是选择使得观测数据出现概率最大的参数值作为估计量。在逻辑回归、朴素贝叶斯等模型中推导出的损失函数,本质上就是负对数似然。

  • 基本定义:最大似然估计是指在已知样本结果的情况下,推断出最有可能使该结果出现的模型参数的过程。

  • 核心逻辑:给定一组观测样本,最大似然估计的目标是寻找一组参数 $\theta$,使得该样本结果发生的概率(即似然函数 $L(\theta)$)达到最大。

  • 应用体现:在有监督学习中,它被用来求取未知的权重参数(如 $W$ 和 $b$),使得当输入样本时,模型最能够产生已知的类别标签或真实分布。

例如,我们知道在机器学习中是通过给定训练集,即$({{x}^{(i)}},{{y}^{(i)}})$来求得其中的未知参数$W$和$b$。换句话说,对于每个给定的${{x}^{(i)}}$,我们已经知道了其所属的类别${{y}^{(i)}}$,即${{y}^{(i)}}$的这样一个分布结果我们是知道的。那么什么样的参数$W$和$b$能够使已知的${{y}^{(1)}},{{y}^{(2)}},\cdots ,{{y}^{(m)}}$这样一个结果(分布)最容易出现呢?也就是说给定什么样的参数$W$和$b$,使当输入${{x}^{(1)}},{{x}^{(2)}},\cdots ,{{x}^{(m)}}$这$m$个样本时,最能够产生已知类别标签${{y}^{(1)}},{{y}^{(2)}},\cdots ,{{y}^{(m)}}$这一结果呢?

那这个时候就需要用到最大似然估计来求得其中的未知参数。更多相关内容及实际的应用示例可以参见 「3.4 逻辑回归损失函数推导:交叉熵与最大似然解析」 内容。


出现动机#

  • 解决参数求解问题:在建立如线性回归、逻辑回归等模型后,需要一种系统性的数学方法来确定参数的取值,使预测结果尽可能“准确”。

  • 理论论证需求:历史上,高斯(Gauss)为了证明“算术平均值是测量误差的最佳处理方法”这一经验性结论,引入了极大似然思想,从而推导出了正态分布,并为最小二乘法提供了数学解释。

  • 构建目标函数:通过极大似然估计,可以将概率模型转化为可优化的目标函数(损失函数)。例如,线性回归的均方误差损失和逻辑回归的交叉熵损失,本质上都是通过极大似然估计推导而来的


优点缺点#

  • 优点:

    • 具备坚实的数学基础:它将参数估计建立在概率论之上,提供了一种逻辑严密的求解范式。

    • 计算转化方便:通过取对数操作(Log-likelihood),可以将复杂的连乘运算转化为连加运算,极大地方便了梯度的求解和优化。

  • 缺点:

    • 依赖分布假设:使用极大似然估计通常需要预先假设数据服从如正态分布。如果假设的分布与实际数据不符,估计结果会产生偏差。

    • 数值稳定性问题:在处理高维数据(如文本向量)时,概率值的累乘可能导致数值下溢,因此必须依赖对数似然进行计算。

    • 对异常值敏感:如果观测数据中包含严重偏离真实分布的异常点,极大似然估计出的参数可能会受到显著干扰。


术语别名#

  • Maximum Likelihood Estimation

  • 极大似然估计


相关术语#

  • 最小二乘法
阅读 --

3.4 目标函数推导

在本节中,我们首先介绍了逻辑回归中的映射函数(Sigmoid()函数)和样本分类时的概率表示,接着介绍了如何通过极大似然估计来推导并得到逻辑回归模型的目标函数,然后介绍了如何根据得到的目标函数来推导各个参数关于目标函数的梯度,最后,分别从零 …

2.6 正态分布

17、18世纪曾是科学发展的黄金年代,微积分的发展和牛顿万有引力定律的建立,直接推动了天文学和测地学的迅猛发展。这些天文学和测地学的问题,无不涉及数据的多次测量、分析与计算。很多年以前,学者们就已经经验性地认为,对于有误差的测量数据多次测量 …