摘录自公众号「@跟我学机器学习」
第8节 Transformer中的全连接层
本文是 Transformer 精读系列第8讲,从两个被普遍忽略的角度复盘 Transformer 结构。其一是 Feed-Forward Network FFN 中的逐元素非线性:从表达能力、层间信息动态处理、与传统 MLP/LSTM 中激活函数的对比三方面,论证为何没有非线性 Transformer 仅靠线性堆叠是不够的;其二是自注意力的线性本质:证明堆 …
第9节 Decoder 不需要 Padding Mask
本文是 Transformer 精读系列第9讲,从一位读者的留言出发,逐图拆解 Transformer 训练时 Encoder 多头注意力、Masked Multi-Head Attention 与交叉多头注意力三处 Q/K/V 计算流程,并通过代码验证最终给出反直觉结论:Decoder 中的 tgt key padding mask 真的可以省。系统梳理 …