更新于 2026年7月26日

均方误差#


术语解释#

均方误差(Mean Square Error, MSE) 是回归任务(即对连续值的预测)中应用最广泛、最经典的模型评估指标和损失函数之一。

MSE 用来衡量预测值与真实值之间误差的平方在所有样本上的平均值,其数学表达式:

$$ \text{MSE}=\frac{1}{n}\sum_{i=1}^{n}(y^{(i)}-\hat{y}^{(i)})^2 $$

其中 $n$ 表示样本数量,$y^{(i)}$ 为第 $i$ 个样本的真实值,$\hat{y}^{(i)}$ 为预测值。

同时,MSE 的取值范围为$\text{MSE} \in [0, +\infty)$,其值越小表示预测越准确,模型效果越好。

当 MSE 作为构建模型的目标函数(Objective Function)时,为了方便求导,通常会在 MSE 公式前多乘一个系数 $1/2$,形成类似 $\frac{1}{2n}\sum(y-\hat{y})^2$ 的形式。这样在求导时可以消去平方项,使梯度计算公式更简洁。


出现动机#

从作为目标函数的角度看,为了解决无法直接通过坐标点求解不共线数据回归的问题,需要一种间接方式来定义模型是否“准确”。通过计算误差的平方和来刻画预测值与真实值之间的差距,使得求解模型参数的问题转换成了最小化目标函数的问题。相关内容可参见「2.1.3 求解线性回归模型」

在 1809 年,高斯系统完善了数学理论,证明当测量误差独立同分布于正态分布(均值为 0)时,通过极大似然估计(MLE)推导出的目标函数正是最小化误差平方和。这为 MSE 提供了稳固的统计学理论依据。相关内容可以参见「2.6 正态分布基础:机器学习中的常见分布与概率理解」

从作为回归模型评估指标的角度看,当评估模型的预测结果时犯小错可以容忍但犯大错绝对不行,所以最关键的变化就是这个平方项。例如一个误差是2一个误差是10,分别平方后则变成了4和100,一下就看出了对大误差的敏感度。 相关内容可以参见「2.4.1 常见回归评估指标」


优点缺点#

  • 优点

    • 数学支撑极其稳固:它建立在概率论基础上。高斯证明了在误差服从正态分布的假设下,最小化均方误差能得到最优的参数估计。

    • 利于梯度下降优化:在线性回归等任务中,以 MSE 为核心的目标函数是一个凸函数,这意味着它可以通过梯度下降算法高效地迭代更新,最终找到全局最优解。

    • 求导计算简单:MSE 的导数形式非常简洁,在反向传播过程中能够高效地计算各层权重的梯度。

    • 放大较大误差的权重:由于误差是以平方形式累积的,这意味着它对模型产生的较大偏差比微小偏差更敏感,有助于模型在训练时重点修正那些预测差距过大的样本。

  • 缺点:

    • 对异常值(Outliers)非常敏感:因为误差被平方了,一个偏离真实分布很远的噪声点会产生巨大的误差贡献,从而显著地拉偏拟合的决策面,使模型受到噪声的过度干扰。

    • 依赖误差分布假设:其理论上的完美性建立在“误差服从高斯分布”的前提下。如果数据的实际分布并非正态分布,MSE 的效果可能不如其他针对特定分布设计的损失函数。


相关术语#

  • MSE

  • RMSE

阅读 --

2.4 回归模型评估

在本节中,我们详细地介绍了如何评价一个回归模型的优与劣,以及一些常用的评估指标和实现方法。最后,我们还通过波士顿房价预测示例来展示了评价指标的用法。到此,对于线性回归模型在整个阶段一部分的内容就介绍完了。

2.6 正态分布

17、18世纪曾是科学发展的黄金年代,微积分的发展和牛顿万有引力定律的建立,直接推动了天文学和测地学的迅猛发展。这些天文学和测地学的问题,无不涉及数据的多次测量、分析与计算。很多年以前,学者们就已经经验性地认为,对于有误差的测量数据多次测量 …