更新于 2026年7月21日

RMSNorm#


术语解释#

均方根归一化(Root Mean Square Layer Normalization, RMSNorm) 是一种在 Transformer(如 LLaMA、DeepSeek)等模型中广泛使用的归一化技术,其核心思想是在层归一化(LayerNorm)的基础上移除了去均值(Re-centering)操作。虽然去掉了去均值操作,但是它在几乎所有任务上效果与 LayerNorm 持平,但计算量更小、推理更快。LLaMA、Qwen、Gemma 等主流大模型都使用 RMSNorm。

更多与层归一化(Layer Norm)相关的内容,可以参见 「 6.4 LayerNorm原理:层归一化与 BatchNorm 的区别」 内容,均方根归一化的详细原理可以参见 「 RMSNorm 归一化原理与 PyTorch 实现:详解与 LayerNorm 的区别及在 LLaMA/DeepSeek 中的应用」 讲解文章。


出现动机#

  • 解决 LayerNorm 的计算开销:虽然 LayerNorm 能加速模型收敛并提高稳定性,但它引入了额外的计算负担。随着网络加深,尤其在推理场景和大模型中,这种开销变得非常显著。

  • 平衡“训练稳定性”与“单步速度”:LayerNorm 虽然能减少训练总步数,但其“每一步”的计算量较大。RMSNorm 的提出是为了在不牺牲模型效果的前提下,通过简化计算逻辑来显著加快训练和推理过程。

  • 质疑去均值的必要性:作者通过研究发现,LayerNorm 成功的核心原因在于其重缩放不变性,而去中心化(去均值)操作对降低隐藏状态或梯度的方差并没有实际显著贡献。


优点缺点#

  • 优点:

    • 运行效率更高:由于少计算了一次均值和去均值的过程,计算开销大大降低。

    • 速度提升显著:实验表明,RMSNorm 在不同模型上的运行速度相比 LayerNorm 有 7% 到 64% 的提升。

    • 性能表现相当:在机器翻译、图像分类和问答等多种任务评估中,RMSNorm 的效果与 LayerNorm 相当,不会明显牺牲模型精度。

    • 计算资源友好:尤其在计算资源紧张或需要极速推理的大模型(如 LLaMA、百川大模型等)中非常有用。

  • 缺点:

    • 缺乏去中心化特性:由于移除了去均值步骤,模型对输入或权重中的偏移噪声(shift noise)的敏感度理论上比 LayerNorm 高。

    • 表示能力相对受限(理论上):虽然作者认为缩放是核心,但舍弃去均值意味着在某些极端分布下,模型可能不如 LayerNorm 鲁棒,尽管实验中并未发现明显负面影响。

    • 变体利用率低:作者曾探索过更轻量的 partial RMSNorm(只在前 p% 的输入上计算均方根),但该变体在主流框架(如 PyTorch)和实际应用中几乎没有被使用


相关术语#

  • 层归一化

  • 组归一化

  • 批归一化

阅读 --

6.4 层归一化

在上一节内容中,我们详细介绍了批归一化的动机原理及实现过程,总体来讲批归一化的核心思想是以一个小批量数据样本为单位在对应维度上进行标准化。但也正是由于这一特性使得批量归一化会受到小批量样本数量的影响,同时,显而易见批归一化也不能直接用于循环 …