最小二乘法#
术语解释#
最小二乘法(Least Square) 是一种数学优化技术,其核心思想是通过最小化误差的平方和来寻找模型的最优解。在机器学习中,它常被用作线性回归等算法的目标函数,旨在寻找一组参数,使所有样本的预测值与真实值之间的均方误差最小。
出现动机#
在18世纪,天文学和测地学涉及大量多次测量数据。虽然学者们经验性地认为取算术平均值是处理测量误差的最佳方法,但长期缺乏理论支撑。1805年,勒让德(Legendre)提出将测量中的误差累积表示为 $\sum(\hat{y}-y)^2$ 。他发现对该式求导并令其为0,求解出的结果正是算术平均值,从而为这一古老经验提供了数学解释。
1801年,高斯(Gauss)利用这一思想,仅凭少量观测数据就在一小时内算出了消失的谷神星轨道。随后在1809年,高斯通过引入正态分布(高斯分布)假设,证明了最小二乘法是极大似然估计的一种特殊情况,完善了其理论基础。
更多相关内容可以参见 「2.6 正态分布基础:机器学习中的常见分布与概率理解」 内容。
优点缺点#
-
优点:
-
数学支撑极其稳固:它建立在概率论的基础上,高斯证明了当误差服从均值为0的正态分布时,最小二乘法能得到最优的参数估计。
-
结果具有普适性:由于它导出的解往往等价于算术平均值,因此在处理独立重复测量的统计数据时表现出极强的鲁棒性和可解释性。
-
-
缺点:
-
对异常值(Outliers)非常敏感:由于误差是以平方形式累积的,个别偏离真实分布很远的噪声点会产生巨大的误差贡献,从而显著“拉偏”拟合的直线或曲线,导致模型偏移(参考 Kmeans 相似缺点)。
-
依赖误差分布的假设:其理论上的完美性建立在“误差服从高斯分布”这一前提下。如果实际数据的噪声分布并非正态分布,最小二乘法的效果可能不如其他鲁棒回归方法。
-
存在过拟合风险:在多项式回归等场景中,如果为了极力追求最小化平方误差而使用过于复杂的模型,会导致模型拟合到每一个噪声点,从而丧失对新数据的泛化能力。
-
线性假设的局限:基本的最小二乘法主要针对线性参数模型。处理非线性问题时,必须依赖特征映射(如多项式变换)将问题转化为线性形式,否则拟合能力有限。
-
相关术语#
- 最大似然估计