均方误差#
术语解释#
均方误差(Mean Square Error, MSE) 是回归任务(即对连续值的预测)中应用最广泛、最经典的模型评估指标和损失函数之一。
MSE 用来衡量预测值与真实值之间误差的平方在所有样本上的平均值,其数学表达式:
$$ \text{MSE}=\frac{1}{n}\sum_{i=1}^{n}(y^{(i)}-\hat{y}^{(i)})^2 $$其中 $n$ 表示样本数量,$y^{(i)}$ 为第 $i$ 个样本的真实值,$\hat{y}^{(i)}$ 为预测值。
同时,MSE 的取值范围为$\text{MSE} \in [0, +\infty)$,其值越小表示预测越准确,模型效果越好。
当 MSE 作为构建模型的目标函数(Objective Function)时,为了方便求导,通常会在 MSE 公式前多乘一个系数 $1/2$,形成类似 $\frac{1}{2n}\sum(y-\hat{y})^2$ 的形式。这样在求导时可以消去平方项,使梯度计算公式更简洁。
出现动机#
从作为目标函数的角度看,为了解决无法直接通过坐标点求解不共线数据回归的问题,需要一种间接方式来定义模型是否“准确”。通过计算误差的平方和来刻画预测值与真实值之间的差距,使得求解模型参数的问题转换成了最小化目标函数的问题。相关内容可参见「2.1.3 求解线性回归模型」。
在 1809 年,高斯系统完善了数学理论,证明当测量误差独立同分布于正态分布(均值为 0)时,通过极大似然估计(MLE)推导出的目标函数正是最小化误差平方和。这为 MSE 提供了稳固的统计学理论依据。相关内容可以参见「2.6 正态分布基础:机器学习中的常见分布与概率理解」 。
从作为回归模型评估指标的角度看,当评估模型的预测结果时犯小错可以容忍但犯大错绝对不行,所以最关键的变化就是这个平方项。例如一个误差是2一个误差是10,分别平方后则变成了4和100,一下就看出了对大误差的敏感度。 相关内容可以参见「2.4.1 常见回归评估指标」。
优点缺点#
-
优点
-
数学支撑极其稳固:它建立在概率论基础上。高斯证明了在误差服从正态分布的假设下,最小化均方误差能得到最优的参数估计。
-
利于梯度下降优化:在线性回归等任务中,以 MSE 为核心的目标函数是一个凸函数,这意味着它可以通过梯度下降算法高效地迭代更新,最终找到全局最优解。
-
求导计算简单:MSE 的导数形式非常简洁,在反向传播过程中能够高效地计算各层权重的梯度。
-
放大较大误差的权重:由于误差是以平方形式累积的,这意味着它对模型产生的较大偏差比微小偏差更敏感,有助于模型在训练时重点修正那些预测差距过大的样本。
-
-
缺点:
-
对异常值(Outliers)非常敏感:因为误差被平方了,一个偏离真实分布很远的噪声点会产生巨大的误差贡献,从而显著地拉偏拟合的决策面,使模型受到噪声的过度干扰。
-
依赖误差分布假设:其理论上的完美性建立在“误差服从高斯分布”的前提下。如果数据的实际分布并非正态分布,MSE 的效果可能不如其他针对特定分布设计的损失函数。
-
相关术语#
-
MSE
-
RMSE