Transformer 架构详解:从 Attention 到大模型

Transformer 架构详解

2017 年一篇《Attention Is All You Need》开启了整个大模型时代。GPT、BERT、Llama 的内核都是 Transformer。

一、从 RNN 到注意力

RNN 必须逐个单词处理,无法并行且长距离信息易丢失。注意力机制让每个 token 直接“看”全部上下文,并行且全局。

二、自注意力怎么算

每个词生成 Query / Key / Value 三个向量,用点积衡量相关性:

Attention(Q,K,V) = softmax(QK^T / sqrt(d_k)) V

除以 sqrt(d_k) 是为了防止点积过大把 softmax 推到饱和区。

三、多头注意力

“头”是多次并行计算注意力并拼接,让模型同时关注语法、语义、位置等不同维度的关系。

四、位置编码

注意力本身不感知顺序,需要注入位置信息。正弦编码与 RoPE 都是常见方案。

五、大模型的“生词表”

  • 预训练:在海量文本上预测下一个词,学“通用知识”
  • 上下文窗口:一次能“记住”的 token 数量
  • 自回归生成:每步把新 token 拼回输入再预测下一个

理解了 Transformer,你就读懂了后面所有大模型论文的开头。

评论(31)