摘要本文围绕 Transformer 架构的核心设计展开逐步拆解自注意力机制、位置编码、多头注意力、前馈网络、残差连接与层归一化等关键组件并深入分析 Encoder-Decoder 结构、Masked Self-Attention、Cross-Attention 与自回归生成机制帮助读者理解 Transformer 为何能取代 RNN 成为现代序列建模的基础架构。关于正则化正则化是用在损失函数里面用来防止模型追着噪声点学习把模型搞得特别复杂惩罚因子越大模型正则化水平越高越不容易过拟合但是过大的正则化也会导致模型捕捉细节能力不强关于对模型的思考这个问题的数据结构是什么模型认为信息应该怎样传播为什么这种传播机制适合这个问题?神经网络演化Transformer:自注意力位置编码位置编码从何而来如果 Self-Attention 天生不知道顺序那我要人为给每个位置发一张什么样的“位置身份证”绝对信息位置vs相对信息位置编码要求连续有规律任意编码------偶sin,奇cos----多频率位置编码:p_i[sin(i),sin(i/100),....]i当前位置编号j第几个频率d维度优点1相对位移好表达 优点2内积出现位置差transformer的来源seq2seq输入--输出我保留里面的RNN我能不能用Attention把encoder和decoder重新造一遍面临的一系列问题没有RNN了↓顺序信息没了→ Positional Encoding一层Attention表达关系太单一→ Multi-Head AttentionAttention主要负责“从别人那里拿什么”但拿回来之后还要加工→ FFN堆很多层以后网络不好训练→ Residual Connection LayerNorm我要做翻译输入英文输出中文→ Encoder DecoderDecoder训练时能看到完整中文答案那岂不是偷看未来→ Mask预测时又不可能一次知道整句答案→ Autoregressive解决问题的模块及其作用注多头注意力多个head学习不同特征彼此独立关于得分函数transformer中一般采用放缩点积注意力。attention得到了什么 layernorm解决的FFN全称position-wise feed-forward network 逐位置前馈网络 小mlp 先升维后降维为啥先masked self-attention后cross-attention?以翻译模型为例要想知道我要去英文里面查什么取决于我中文现在已经写到哪里了。masked self-attention当前位置只允许利用已经生成的过去不允许利用未来答案。cross attention以我当前生成状态来看原文哪个位置对我有用。Bahdanau attention)Q1Bahdanau Attention 已经有 Attention 了Transformer 为什么还值得出现Bahdanau Attention 虽然允许 Decoder 动态关注 Encoder 的不同位置但 Encoder 和 Decoder 主体仍然是 RNN存在串行计算和长距离依赖的问题。Transformer 进一步使用 Self-Attention 替代 RNN 的主要递归结构使序列内部任意位置可以直接交互并能够并行计算。Q2Decoder 为什么有 Masked Self-Attention 和 Cross-AttentionQ3如果把 Mask 拿掉训练翻译模型时会发生什么mask防止训练时偷看答案使训练符合自回归生成规则。transformer架构