Transformer)
3.1 从RNN/LSTM到Transformer注意力机制诞生的底层刚需要真正理解Transformer为什么能统治大模型必须先精准搞懂传统序列模型的两大致命硬伤这也是所有LLM架构、推理优化的起点。早期序列建模依赖 RNN、LSTM、GRU核心逻辑是串行时序迭代第 t 时刻的计算必须依赖第 t-1 时刻的隐状态输出无法跳过、无法并行。这带来两个无法根治的缺陷完全无法时序并行极度浪费GPU算力CNN可以一次性处理整张图像所有像素并行计算但RNN系列必须逐Token串行计算。无论GPU算力多强序列处理速度被时序锁死无法利用大规模并行算力无法支撑超大参数量、超长文本训练。致命的长程依赖衰减问题远距离Token的信息需要层层传递迭代经过上百次矩阵乘法与激活变换后梯度与语义信息会指数级衰减。哪怕LSTM/GRU通过输入门、遗忘门、输出门缓解了短期衰减超长序列的长距离依赖依然无法解决。模型只能记住文本局部信息无法理解全文逻辑。2017年《Attention Is All You Need》彻底颠覆序列建模范式彻底抛弃循环结构全程依靠自注意力机制建模全局依赖。Transformer核心革命性优势全局直接交互序列中任意两个Token可以直接计算相关性无需层层传递彻底消除长距离信息衰减全量并行计算Prefill阶段整段序列一次性并行计算完美适配GPU大规模并行架构可无限堆叠深度配合残差归一化结构可搭建几十至上百层超深网络支撑万亿级参数模型。现在所有主流大模型GPT、LLaMA、Mistral、GLM、DeepSeek全部是Transformer解码器架构的衍生变种没有例外。3.2 自注意力机制Self-AttentionQ/K/V 本质与完整计算流程Q、K、V是新手最容易玄学化的概念。核心Q、K、V 不是三个不同的输入是同一输入张量经过三组独立可学习权重矩阵做线性投影后的三份特征无任何特殊数学魔术只是特征变换。给定输入特征 XX∈RB×L×DX\in\mathbb{R}^{B\times L\times D}X∈RB×L×D( B )Batch Size批次大小横向并发数。即同时处理的独立序列用户请求数量。在 vLLM 的 Continuous Batching 中这个数会动态变化。( L )Sequence Length序列长度纵向时间轴。即当前序列中 Token 的总数量。在Prefill预填充阶段它是固定的Prompt 长度在Decode解码阶段它每步增加 1。( D )Hidden Dimension隐藏维度特征深度。即每个 Token 的向量表示长度。对于 LLaMA-7B( D 4096 )对于 LLaMA-70B( D 8192 )。这个值在模型的整个前向传播过程中从不改变除了 FFN 内部升维降维的中间态。QueryQQXWq Q XW_qQXWq代表「当前Token要检索什么上下文信息我想查什么」KeyKKXWkK XW_kKXWk代表「所有Token自身携带的特征信息索引我有什么可以给你查」ValueV:VXWvV XW_vVXWv代表「所有Token真实的语义内容特征我实际的内容是什么」计算过程是这样的每个Query去跟所有Key做点积得到一个分数表示这个词跟当前词的相关程度。然后所有分数过Softmax变成权重。最后用这些权重去加权求和所有Value得到当前词的新表示。直白说就是你问一个问题Q每个人K告诉你他们懂什么你根据匹配程度决定听谁的权重然后把他们说的内容V按权重混在一起形成你的理解。这个过程对每个词同时做所有词互相看一遍所以叫自注意力——自己在看自己。计算复杂度是O(n²)n是序列长度。这意味着序列越长注意力越贵。这也是为啥长上下文推理那么费劲——你让模型处理100万token的上下文注意力矩阵就是100万×100万。标准缩放点积注意力完整公式Attention(Q,K,V)Softmax(QK⊤dk)V\text{Attention}(Q,K,V) \text{Softmax}\left(\frac{QK^\top}{\sqrt{d_k}}\right)VAttention(Q,K,V)Softmax(dkQK⊤)V这里纠正一个核心新手误区dk\sqrt{d_k}dk必须除以。如果不做缩放向量维度越高点积结果数值越大Softmax输入会极端极化、梯度消失、训练崩坏。缩放是为了稳定数值分布。流程每个Token生成专属检索向量QQ与全局所有Token的K做相似度点积得到原始注意力分数缩放、掩码解码器、Softmax归一化为概率权重用全局权重加权求和所有V特征得到融合全局上下文的新Token表征。复杂度核心结论推理优化根基自注意力时间复杂度为O(n²)n为序列长度。这是长文本推理昂贵的唯一核心原因序列长度翻倍注意力计算量直接翻4倍、KV缓存显存占用翻倍。后续所有长文本优化滑动窗口注意力、稀疏注意力、PagedAttention、KV缓存量化全部为了解决 O(n²) 瓶颈。3.3 多头注意力MHA 现代GQA/MQA优化推理重点单头自注意力存在严重表达缺陷单个注意力头只能学习单一相关性模式无法同时捕捉语法结构、语义相似度、长距离依赖、局部搭配等多维度特征。比如苹果这个词在吃苹果和苹果公司里它关注的东西完全不一样。单头注意力没法兼顾。所以Transformer搞了多头注意力MHAMulti-Head Attention核心原理将隐藏维度均匀切分为 head_num 个头每个头拥有独立的Q、K、V变换矩阵各自独立执行自注意力计算学习不同维度的上下文关联最后拼接所有头输出通过输出投影层融合特征。就像8个专家分头观察文本有的学语法、有的学语义、有的学长距离关联最后汇总综合判断远优于单一路径特征学习。推理硬核开销标准MHA中每一个注意力头都有独立KV头数越多KV缓存体积越大、显存占用越高。例如LLaMA-7B 32头KV缓存体积巨大是推理显存占用的主要元凶。现代模型优化MQA / GQA原生MHA显存爆炸、吞吐低现代模型全部升级MQA单查询注意力多个头共享同一组KV仅Q多头极致压缩KV缓存提速最高但精度略有损失GQA分组查询注意力折中方案将多头分为若干组组内共享KV几乎无损精度显存大幅降低。Mistral、LLaMA3、Qwen全部默认GQA是当前工业界主流。做推理优化的核心价值之一GQA/MQA直接减半甚至减75% KV显存占用大幅提升长文本吞吐。3.4 位置编码从绝对位置到RoPE推理外推核心——顺序信息怎么塞进去自注意力机制本身完全不感知时序顺序是纯词袋模型“我打你和你打我的Token集合一致注意力计算结果完全相同这显然不行。所以Transformer给每个位置加了一个位置编码”让模型知道这个词在第几位。原始正弦位置编码通过正余弦函数生成固定位置向量优点是可泛化、无需训练缺点是绝对位置建模长序列外推能力极差现代LLM已基本淘汰。可学习位置编码GPT2、BERT为每个位置分配独立可训练参数优点是拟合强致命缺陷无法外推。训练最大长度2048推理超过2048位置无编码可用直接报废不适合超长上下文场景。RoPE旋转位置编码当前LLM绝对主流LLaMA、Mistral、Qwen、DeepSeek全系标配。核心原理不直接相加位置向量而是通过旋转矩阵对Q、K向量做角度旋转将位置信息隐式融入向量内积。两大核心优势推理必懂天然建模相对位置Token距离越远旋转角度差越大相关性自然衰减贴合语言规律支持长度外推可通过NTK、YaRN、动态缩放等技术让模型推理长度远超训练长度。工程关联后续超长上下文推理、位置编码缩放、精度微调全部围绕RoPE展开是长文本推理优化的核心底层。3.5 FFN前馈网络 归一化 残差Transformer存在 Post-LN 和 Pre-LN现代LLM标配 两种结构二者层顺序完全不同直接影响推理数值稳定性。1. 归一化结构差异原Transformer Post-LN子层计算 → 残差相加 → 归一化现代LLM Pre-LNLLaMA/GPT/Mistral归一化 → 子层计算 → 残差相加Pre-LN梯度更稳定、深层可堆叠是当前所有大模型的标准结构。额外补充LLaMA系列使用RMSNorm舍弃LayerNorm的均值中心化只做方差缩放计算量更小、推理速度更快、开销更低是轻量化推理的经典优化。2. FFN前馈网络进化FFN的唯一作用注意力负责Token与Token之间的全局交互FFN负责单个Token的深度非线性特征提炼二者互补。原始Transformer两层线性ReLU结构简单、表达弱现代LLMSwiGLU/GELU变体LLaMA全系使用SwiGLU将单路FFN升级为三路权重门控结构参数更多、非线性更强、语义表达更优。FFN隐藏层维度通常为隐藏维度的4倍是大模型参数与计算量的主要组成部分推理中FFN占用大量算力与显存。3. 残差连接的推理意义残差公式xℓ1xℓFℓ(xℓ)x_{\ell1} x_{\ell} \mathcal{F}_{\ell}(x_{\ell})xℓ1xℓFℓ(xℓ)xℓx_{\ell}xℓ第 ℓ 层的输入Fℓ(⋅) \mathcal{F}_{\ell}(·)Fℓ(⋅)第 ℓ 层需要学习的残差映射Residual Mapping在Transformer里通常是一个自注意力子层或FFN子层xℓ1x_{\ell1}xℓ1该残差块的最终输出。核心价值打通直连梯度通路避免深层网络梯度消失让上百层大模型可训练、可收敛是超深LLM的结构基石。3.6 编码器/解码器架构区分推理场景终极定位三种Transformer架构对应三类任务大模型推理99.9%场景仅用纯解码器。编码器架构BERT系双向全注意力能同时看见上下文前后Token适合理解类任务分类、匹配、抽取。无法做生成任务无自回归能力和LLM推理无关。编码器-解码器架构T5、BART编码器读输入、解码器自回归生成适合翻译、摘要、改写。工业界对话生成极少使用结构冗余、推理低效。纯解码器架构GPT/LLaMA/Mistral/GLM——推理核心单向自回归生成带掩码多头注意力Masked MHA。掩码机制精准解释在注意力分数矩阵中将「未来位置Token」的分数填充为-inf经过Softmax后权重归零。确保当前Token只能依赖历史上下文无法偷看未来未生成Token严格符合自回归生成逻辑。就是当前位置只能看到自己和前面的词看不到后面的。因为自回归生成的时候后面的词还没生成呢你不能让它偷看答案。所有KV Cache、解码迭代、采样策略全部基于纯解码器掩码注意力机制实现。3.7 主流开源LLM架构横向对比推理工程师视角从推理优化、显存占用、速度、长文本能力四个维度精准对比主流模型差异。GPT系列GPT2/3纯解码器、Post-LN、绝对位置编码、标准ReLU/GELU FFN、原生MHA。结构老旧、无显存优化、长文本外推差社区基本不再基于GPT做部署优化仅作为理论基线。LLaMA1/2/3系列工业界标杆Pre-LN RMSNorm、RoPE旋转位置编码、SwiGLU FFN、新版LLaMA3启用GQA。结构极简、稳定、可扩展性极强社区优化最全量化、分页注意力、投机解码全覆盖是目前学习推理部署的首选模型。Mistral/Mixtral系列速度标杆核心亮点滑动窗口注意力SWA每个Token仅关注局部4096上下文大幅降低 O(n²) 计算量原生GQA、稀疏MoE架构吞吐极高、推理速度最快适合高并发线上业务。GLM系列ChatGLM混合编码-解码架构双向上下文建模自回归解码适配中文场景。结构相对特殊部分开源推理框架适配度略低于LLaMA系自定义部署需要适配专属注意力逻辑。DeepSeek系列显存优化标杆自研MLA隐式多头注意力极致压缩KV Cache大幅降低长文本推理显存占用是当前前沿推理优化的代表架构。3.8 架构差异直接决定优化方案你不需要精通模型训练但必须通过架构差异判断优化侧重点KV Cache体积MHA GQA MQA直接决定显存水位长文本能力RoPE可外推绝对位置编码不可外推推理速度滑动窗口稀疏注意力 全量注意力数值稳定性RMSNorm/Pre-LN 推理更稳、更少溢出吞吐上限MoE稀疏模型 稠密模型并发能力更强。本章核心总结推理优化底层基石1. Transformer干掉串行循环用全局注意力实现全并行长程依赖是大模型诞生的前提2. Q/K/V是线性投影特征缩放点积注意力是LLM最核心的算力开销来源3. MHA → GQA/MQA的迭代本质是用极小精度代价换取极大显存/速度收益4. RoPE是现代LLM长文本外推、超长上下文推理的核心基础5. Pre-LN RMSNorm SwiGLU是工业稳定推理的标配结构6. 99%商用推理基于纯解码器掩码自回归架构7. 不同模型架构的差异本质是显存、速度、精度、长文本能力的取舍所有推理优化都围绕这些取舍展开。