更新于 2026年7月21日

Sigmoid#


术语解释#

Sigmoid 函数(也称 Logistic 函数) 是一种在深度学习和机器学习中广泛使用的非线性激活函数(或映射函数),其数学表达式为 $g(z)=\frac{1}{1+{{e}^{-z}}}$ ,它能将输入值从 $(-\infty ,+\infty )$ 映射到 $(0,1)$ 的开区间内,常用于二分类输出层(表示概率)或门控机制(如 LSTM 中的输入 / 遗忘门)。

 Sigmoid函数图像
Sigmoid()函数图形

出现动机#


优点缺点#

  • 优点:

    • 连续光滑且处处可导:这使得它非常适合使用梯度下降算法进行参数优化。

    • 输出范围受限:将输出压缩在 $(0,1)$ 之间,在需要输出概率分布的任务(如逻辑回归、多标签分类)中非常直观。

    • 求导计算简单:其导数具有非常简洁的形式 $g^{\prime}(z)=g(z)(1−g(z))$ ,这在反向传播计算梯度时能提高效率。

    • 中心对称:Sigmoid 函数关于点 $(0,0.5)$ 中心对称。

  • 缺点:

    • 梯度消失(饱和现象):这是 Sigmoid 最显著的缺点。当输入值非常大(正饱和)或非常小(负饱和)时,函数的导数趋于 0。在深层网络的反向传播中,梯度的连续累乘会导致靠近输入层的梯度变得极其微小,使得模型训练变慢甚至停止。

    • 计算开销较大:相比于 ReLU 等函数,Sigmoid 包含指数运算,在处理大规模数据和深层网络时,计算量相对较大。

    • 收敛速度慢:Sigmoid 导数的最大值仅为 0.25。这意味着即使在激活函数的活跃区,梯度的传递也会被显著减弱,从而减缓参数的更新速度。

    • 非零中心输出:Sigmoid 的输出均大于 0,这可能导致在神经网络后层中,神经元的输入分布发生偏移,影响收敛效率


相关术语#

  • ReLU
阅读 --

3.12 激活函数

在本节内容中,我们首先回顾了在深度学习中为什么我们需要进行非线性变换;然后介分别介绍了4种常见激活函数Sigmoid、Tanh、ReLU和LeakyReLU的原理和计算过程。最后详细介绍了各个激活函数的实现过程和使用示例。

3.4 目标函数推导

在本节中,我们首先介绍了逻辑回归中的映射函数(Sigmoid()函数)和样本分类时的概率表示,接着介绍了如何通过极大似然估计来推导并得到逻辑回归模型的目标函数,然后介绍了如何根据得到的目标函数来推导各个参数关于目标函数的梯度,最后,分别从零 …

3.1 线性回归

在本节内容中,我们首先以房价预测为例引入了单变量线性回归以及如何转换模型的求解思路;然后通过梯形面积预测的实例引入了什么是多项式回归,并进一步引出了抽象特征提取的概念;