1. Transformer 的整体结构(Encoder/Decoder、多头自注意力、前馈网络、位置编码)是如何组织的?
Transformer 的整体结构(Encoder/Decoder、多头自注意力、前馈网络、位置编码)是如何组织的?
- Encoder-Decoder 的整体架构
- 多头自注意力、前馈网络、残差与归一化
- 位置编码的作用
Transformer 由 Encoder 和 Decoder 两部分组成。Encoder 由多个相同的层堆叠,每层包含多头自注意力(Multi-Head Self-Attention)与前馈网络(FFN),并都配合残差连接与层归一化(LayerNorm);每层都做"自注意力 → 加残差 → LayerNorm → FFN → 加残差 → LayerNorm"。Decoder 类似,但每层包含掩码自注意力(防止看到未来位置)、交叉注意力(与 Encoder 输出交互)和 FFN。多头自注意力让模型在不同表示子空间同时关注不同位置;FFN 对每个位置做非线性变换,一般是两层全连接加 ReLU。由于注意力本身不含位置信息,需要在输入嵌入上叠加位置编码(Positional Encoding,如正弦函数或可学习位置嵌入)来注入位置顺序信息。整体结构即"位置编码 + 多层 Encoder/Decoder + 注意力与前馈的堆叠"。
Transformer 的核心是把序列建模完全建立在注意力机制上,替代 RNN 的循环结构。多头注意力、残差、LayerNorm、FFN、位置编码五大组件缺一不可,多头提供多种关系、残差稳定深层训练、位置编码补充顺序信息。