最大似然估计#
术语解释#
最大似然估计(Maximum Likelihood Estimation, MLE),也称作极大似然估计,是概率模型最常用的参数估计方法,核心思想是选择使得观测数据出现概率最大的参数值作为估计量。在逻辑回归、朴素贝叶斯等模型中推导出的损失函数,本质上就是负对数似然。
-
基本定义:最大似然估计是指在已知样本结果的情况下,推断出最有可能使该结果出现的模型参数的过程。
-
核心逻辑:给定一组观测样本,最大似然估计的目标是寻找一组参数 $\theta$,使得该样本结果发生的概率(即似然函数 $L(\theta)$)达到最大。
-
应用体现:在有监督学习中,它被用来求取未知的权重参数(如 $W$ 和 $b$),使得当输入样本时,模型最能够产生已知的类别标签或真实分布。
例如,我们知道在机器学习中是通过给定训练集,即$({{x}^{(i)}},{{y}^{(i)}})$来求得其中的未知参数$W$和$b$。换句话说,对于每个给定的${{x}^{(i)}}$,我们已经知道了其所属的类别${{y}^{(i)}}$,即${{y}^{(i)}}$的这样一个分布结果我们是知道的。那么什么样的参数$W$和$b$能够使已知的${{y}^{(1)}},{{y}^{(2)}},\cdots ,{{y}^{(m)}}$这样一个结果(分布)最容易出现呢?也就是说给定什么样的参数$W$和$b$,使当输入${{x}^{(1)}},{{x}^{(2)}},\cdots ,{{x}^{(m)}}$这$m$个样本时,最能够产生已知类别标签${{y}^{(1)}},{{y}^{(2)}},\cdots ,{{y}^{(m)}}$这一结果呢?
那这个时候就需要用到最大似然估计来求得其中的未知参数。更多相关内容及实际的应用示例可以参见 「3.4 逻辑回归损失函数推导:交叉熵与最大似然解析」 内容。
出现动机#
-
解决参数求解问题:在建立如线性回归、逻辑回归等模型后,需要一种系统性的数学方法来确定参数的取值,使预测结果尽可能“准确”。
-
理论论证需求:历史上,高斯(Gauss)为了证明“算术平均值是测量误差的最佳处理方法”这一经验性结论,引入了极大似然思想,从而推导出了正态分布,并为最小二乘法提供了数学解释。
-
构建目标函数:通过极大似然估计,可以将概率模型转化为可优化的目标函数(损失函数)。例如,线性回归的均方误差损失和逻辑回归的交叉熵损失,本质上都是通过极大似然估计推导而来的
优点缺点#
-
优点:
-
具备坚实的数学基础:它将参数估计建立在概率论之上,提供了一种逻辑严密的求解范式。
-
计算转化方便:通过取对数操作(Log-likelihood),可以将复杂的连乘运算转化为连加运算,极大地方便了梯度的求解和优化。
-
-
缺点:
-
依赖分布假设:使用极大似然估计通常需要预先假设数据服从如正态分布。如果假设的分布与实际数据不符,估计结果会产生偏差。
-
数值稳定性问题:在处理高维数据(如文本向量)时,概率值的累乘可能导致数值下溢,因此必须依赖对数似然进行计算。
-
对异常值敏感:如果观测数据中包含严重偏离真实分布的异常点,极大似然估计出的参数可能会受到显著干扰。
-
术语别名#
-
Maximum Likelihood Estimation
-
极大似然估计
相关术语#
- 最小二乘法