Transformer#
术语解释#
Transformer 是一种由 Google 研究人员在 2017 年里程碑式论文《Attention is All You Need》中提出的革命性 AI 架构。它采用了多层堆叠而成的编码器—解码器(Encoder-Decoder)自注意力机制(Self-Attention)多头注意力机制(Multi-Head Attention)。
Transformer 完全摒弃了传统深度学习中常用的循环结构(如 RNN 和 LSTM),重塑了自然语言文本的处理方式
更多 Transformer 原理讲解的内容可以参见「图解 Transformer 入门指南教程」 系列文章。
出现动机#
出现动机
-
解决串行计算的瓶颈:传统的循环神经网络(RNN)和长短期记忆网络(LSTM)在建模过程中,下一个时刻的计算必须依赖上一个时刻的输出,这种固有的属性限制了模型无法实现并行化计算,导致训练效率低下。
循环神经网络编码图 -
克服长期依赖和信息瓶颈问题:RNN 模型在处理长序列数据时,容易出现“遗忘”问题或梯度消失/爆炸,使得模型难以记住和区分序列中远距离的编码信息。
-
提升计算资源利用率:研究者希望设计一种能充分利用 GPU 高并行处理能力的架构,以应对参数量从数百万到数十亿规模的巨型模型训练需求
优点缺点#
-
优点:
-
高效的并行处理能力:由于摈弃了循环结构,Transformer 可以同时处理序列中的所有元素,极大提升了长序列处理和模型训练的效率。
-
强大的全局建模能力:自注意力机制能直接捕捉文本中任意两个词之间的关联,不受距离限制,有效解决了长期依赖问题。
-
丰富的特征表达:通过多头注意力机制,模型可以在同一层中从不同的子空间(即不同的注意力头)并行学习多种注意力分配方式,增强了模型的表达能力。
-
泛化与适配能力强:Transformer 架构可以通过预训练和微调两阶段范式,灵活适配文本分类、机器翻译、问题回答等多种下游任务。
-
-
缺点:
-
计算开销巨大:自注意力机制在计算注意力权重矩阵时,时间复杂度为 $O(n^2d)$( $n$ 为序列长度,$d$ 为维度),这意味着随着输入序列长度的增加,计算量和显存占用会呈平方级增长。
-
缺乏位置感知能力:自注意力机制本身是无序的(打乱顺序后计算结果本质相同),因此必须人为引入 位置编码(Positional Encoding) 来弥补其无法捕捉时序信息的缺陷。
-
训练需求极高:这类模型通常规模庞大,参数数量动辄数亿甚至数千亿,需要极其强大的算力和海量的高质量语料才能完成有效的训练。
-
术语别名#
- 变形器
相关术语#
-
自注意力机制
-
多头注意力机制