摘录自公众号「@跟我学机器学习」
第1节 多头注意力机制原理
本文是《Attention Is All You Need》精读系列第1讲,从 RNN 串行瓶颈出发讲清 Transformer 为什么必须引入自注意力,再用图解与公式拆解 Scaled Dot-Product Attention、Q/K/V 含义与 Multi-Head 多头分割动机,帮助初学者一次搞懂多头注意力机制的原理。包含完整可视化示意图与中文变量解 …
第2节 位置编码与编码解码过程
本文是 Transformer 精读系列第2讲,用图解与对比示例讲清 Transformer 为什么必须加入位置编码,并拆解正弦 Positional Encoding 公式与高低频维度直觉。随后通过可视化方式演示 Encoder-Decoder 编解码全过程,包括 Masked Attention 与 Padding Mask 的作用,帮助读者理解 …
第3节 网络结构与自注意力实现
本文是 Transformer 精读系列第3讲,详细讲解如何用 PyTorch 一步步实现 MultiHeadAttention 模块。先回顾多层 Transformer 与单层 Encoder-Decoder 结构,再系统拆解自注意力实现中三处关键 Mask:Attention Mask、Padding Mask 与 Subsequence Mask,并给 …
第4节 Transformer 的实现过程
本文是 Transformer 精读系列第4讲,全程使用 PyTorch 一步步实现完整的 Transformer 模型,覆盖 Token Embedding、正弦 Positional Embedding、EncoderLayer、DecoderLayer 与最终 Transformer 的前向计算流程。所有模块与变量命名沿用 …
第5节 基于Transformer 的翻译模型
本文是 Transformer 精读系列第5讲,从零开始搭建一个英语到德语的机器翻译模型。以 Multi30K 平行语料为对象,详细讲清 6 步数据预处理流程(tokenize、词表、序列化、padding、`/` 与 tgt_input/tgt_output 切分、padding mask),并用 PyTorch 完成 Transformer 翻译模型的训 …
第6节 基于Transformer的分类模型
本文是 Transformer 精读系列第6讲,从零用 Transformer Encoder 搭建 AG_News 新闻文本分类模型。系统讲清分类任务只需 Encoder 不需要 Decoder 的原因、Encoder 输出张量的池化策略、标签与文本的清洗规则与 Vocab 构建,并配套 torchtext AG_NEWS 数据加载与训练代码——本质上等同 …
第7节 基于Transformer的对联生成模型
本文是 Transformer 精读系列第7讲,使用 GitHub 上 70 万条公开对联数据集(couplet-dataset)训练一个中文对联生成模型。系统讲解对联生成与机器翻译在模型结构上的异同(共用中文词表、上下联对应 src/tgt),并以 PyTorch 完整实现从分字、词表、DataLoader、Transformer Seq2Seq 到推理生 …