更新于 2026年7月21日

Transformer#


术语解释#

Transformer 是一种由 Google 研究人员在 2017 年里程碑式论文《Attention is All You Need》中提出的革命性 AI 架构。它采用了多层堆叠而成的编码器—解码器(Encoder-Decoder)自注意力机制(Self-Attention)多头注意力机制(Multi-Head Attention)。

图 10-18单层Transformer结构图
Transformer 网络结构图

Transformer 完全摒弃了传统深度学习中常用的循环结构(如 RNN 和 LSTM),重塑了自然语言文本的处理方式

更多 Transformer 原理讲解的内容可以参见「图解 Transformer 入门指南教程」 系列文章。


出现动机#

出现动机

  • 解决串行计算的瓶颈:传统的循环神经网络(RNN)和长短期记忆网络(LSTM)在建模过程中,下一个时刻的计算必须依赖上一个时刻的输出,这种固有的属性限制了模型无法实现并行化计算,导致训练效率低下。

     循环神经网络编码图
    循环神经网络编码图
  • 克服长期依赖和信息瓶颈问题:RNN 模型在处理长序列数据时,容易出现“遗忘”问题或梯度消失/爆炸,使得模型难以记住和区分序列中远距离的编码信息。

  • 提升计算资源利用率:研究者希望设计一种能充分利用 GPU 高并行处理能力的架构,以应对参数量从数百万到数十亿规模的巨型模型训练需求


优点缺点#

  • 优点:

    • 高效的并行处理能力:由于摈弃了循环结构,Transformer 可以同时处理序列中的所有元素,极大提升了长序列处理和模型训练的效率。

    • 强大的全局建模能力:自注意力机制能直接捕捉文本中任意两个词之间的关联,不受距离限制,有效解决了长期依赖问题。

    • 丰富的特征表达:通过多头注意力机制,模型可以在同一层中从不同的子空间(即不同的注意力头)并行学习多种注意力分配方式,增强了模型的表达能力。

    • 泛化与适配能力强:Transformer 架构可以通过预训练和微调两阶段范式,灵活适配文本分类、机器翻译、问题回答等多种下游任务。

  • 缺点:

    • 计算开销巨大:自注意力机制在计算注意力权重矩阵时,时间复杂度为 $O(n^2d)$( $n$ 为序列长度,$d$ 为维度),这意味着随着输入序列长度的增加,计算量和显存占用会呈平方级增长。

    • 缺乏位置感知能力:自注意力机制本身是无序的(打乱顺序后计算结果本质相同),因此必须人为引入 位置编码(Positional Encoding) 来弥补其无法捕捉时序信息的缺陷。

    • 训练需求极高:这类模型通常规模庞大,参数数量动辄数亿甚至数千亿,需要极其强大的算力和海量的高质量语料才能完成有效的训练。


术语别名#

  • 变形器

相关术语#

  • 自注意力机制

  • 多头注意力机制

阅读 --

第1节 多头注意力机制原理

本文是《Attention Is All You Need》精读系列第1讲,从 RNN 串行瓶颈出发讲清 Transformer 为什么必须引入自注意力,再用图解与公式拆解 Scaled Dot-Product …

第2节 位置编码与编码解码过程

本文是 Transformer 精读系列第2讲,用图解与对比示例讲清 Transformer 为什么必须加入位置编码,并拆解正弦 Positional Encoding 公式与高低频维度直觉。随后通过可视化方式演示 …

第3节 网络结构与自注意力实现

本文是 Transformer 精读系列第3讲,详细讲解如何用 PyTorch 一步步实现 MultiHeadAttention 模块。先回顾多层 Transformer 与单层 Encoder-Decoder 结构,再系统拆解自注意力实现 …

第4节 Transformer 的实现过程

本文是 Transformer 精读系列第4讲,全程使用 PyTorch 一步步实现完整的 Transformer 模型,覆盖 Token Embedding、正弦 Positional …