RMSNorm#
术语解释#
均方根归一化(Root Mean Square Layer Normalization, RMSNorm) 是一种在 Transformer(如 LLaMA、DeepSeek)等模型中广泛使用的归一化技术,其核心思想是在层归一化(LayerNorm)的基础上移除了去均值(Re-centering)操作。虽然去掉了去均值操作,但是它在几乎所有任务上效果与 LayerNorm 持平,但计算量更小、推理更快。LLaMA、Qwen、Gemma 等主流大模型都使用 RMSNorm。
更多与层归一化(Layer Norm)相关的内容,可以参见 「 6.4 LayerNorm原理:层归一化与 BatchNorm 的区别」 内容,均方根归一化的详细原理可以参见 「 RMSNorm 归一化原理与 PyTorch 实现:详解与 LayerNorm 的区别及在 LLaMA/DeepSeek 中的应用」 讲解文章。
出现动机#
-
解决 LayerNorm 的计算开销:虽然 LayerNorm 能加速模型收敛并提高稳定性,但它引入了额外的计算负担。随着网络加深,尤其在推理场景和大模型中,这种开销变得非常显著。
-
平衡“训练稳定性”与“单步速度”:LayerNorm 虽然能减少训练总步数,但其“每一步”的计算量较大。RMSNorm 的提出是为了在不牺牲模型效果的前提下,通过简化计算逻辑来显著加快训练和推理过程。
-
质疑去均值的必要性:作者通过研究发现,LayerNorm 成功的核心原因在于其重缩放不变性,而去中心化(去均值)操作对降低隐藏状态或梯度的方差并没有实际显著贡献。
优点缺点#
-
优点:
-
运行效率更高:由于少计算了一次均值和去均值的过程,计算开销大大降低。
-
速度提升显著:实验表明,RMSNorm 在不同模型上的运行速度相比 LayerNorm 有 7% 到 64% 的提升。
-
性能表现相当:在机器翻译、图像分类和问答等多种任务评估中,RMSNorm 的效果与 LayerNorm 相当,不会明显牺牲模型精度。
-
计算资源友好:尤其在计算资源紧张或需要极速推理的大模型(如 LLaMA、百川大模型等)中非常有用。
-
-
缺点:
-
缺乏去中心化特性:由于移除了去均值步骤,模型对输入或权重中的偏移噪声(shift noise)的敏感度理论上比 LayerNorm 高。
-
表示能力相对受限(理论上):虽然作者认为缩放是核心,但舍弃去均值意味着在某些极端分布下,模型可能不如 LayerNorm 鲁棒,尽管实验中并未发现明显负面影响。
-
变体利用率低:作者曾探索过更轻量的 partial RMSNorm(只在前 p% 的输入上计算均方根),但该变体在主流框架(如 PyTorch)和实际应用中几乎没有被使用
-
相关术语#
-
层归一化
-
组归一化
-
批归一化