Transformer 架构详解
2017 年一篇《Attention Is All You Need》开启了整个大模型时代。GPT、BERT、Llama 的内核都是 Transformer。
一、从 RNN 到注意力
RNN 必须逐个单词处理,无法并行且长距离信息易丢失。注意力机制让每个 token 直接“看”全部上下文,并行且全局。
二、自注意力怎么算
每个词生成 Query / Key / Value 三个向量,用点积衡量相关性:
Attention(Q,K,V) = softmax(QK^T / sqrt(d_k)) V
除以 sqrt(d_k) 是为了防止点积过大把 softmax 推到饱和区。
三、多头注意力
“头”是多次并行计算注意力并拼接,让模型同时关注语法、语义、位置等不同维度的关系。
四、位置编码
注意力本身不感知顺序,需要注入位置信息。正弦编码与 RoPE 都是常见方案。
五、大模型的“生词表”
- 预训练:在海量文本上预测下一个词,学“通用知识”
- 上下文窗口:一次能“记住”的 token 数量
- 自回归生成:每步把新 token 拼回输入再预测下一个
理解了 Transformer,你就读懂了后面所有大模型论文的开头。