LLM 推理的 PD 分离:Prefill-Decode 解耦的生产工程权衡
Prefill-Decode 分离通过将 LLM 推理的两个计算不对称阶段解耦到不同 GPU 池,让计算密集型 Prefill 和访存密集型 Decode 各司其职,是大规模 LLM 推理架构最重要的工程范式之一。
- #AI 原生架构
Archive
96 篇文章
切换标签
Prefill-Decode 分离通过将 LLM 推理的两个计算不对称阶段解耦到不同 GPU 池,让计算密集型 Prefill 和访存密集型 Decode 各司其职,是大规模 LLM 推理架构最重要的工程范式之一。
Speculative Decoding 在 2026 年已经从论文玩具变成生产标配,但工程化部署远比装上就用复杂。本文基于 14 个推理集群的 6 个月跟踪数据,从草稿模型分布对齐、EAGLE-2 推测树构建、KV cache 复用冲突、continuous batching 步调不一致四个维度拆解生产真相,给出工程清单与未公开验证的猜想。
当 LLM 输出 JSON、SQL、工具调用成为生产刚需,Structured Output 已从 prompt trick 演化为 token-level CFG 强约束 + FSM 状态机的硬工程。本文剖析 xGrammar / Outlines / SGLang grammar / TensorRT-LLM llguidance 四大流派的工程真相、与 vLLM / SGLang / llama.cpp 的集成深度、Schema-Valid Rate 三大 SLO、Schema Evolution 的双 grammar 灰度策略,以及 80% 生产部署必选的 vLLM 0.7 + xGrammar 范式。
当 LLM 的 token-by-token 自回归生成撞上反向代理的隐式缓冲、客户端的不可见断连以及服务端的取消协议时,协议栈的选择不再是“哪个最潮”,而是“哪个最能扛住生产长连接”。本文拆解 SSE/WebSocket/gRPC streaming 三条路径的工程坑、取消传播链、backpressure 设计,以及三个生产环境 war story。
LLM 服务的突发流量是「QPS × token 密度」双轴负载,传统 autoscaling 完全失效。本文提出三维 admission control + 自适应 cache eviction + SLO 隔离的工程组合,把突发从故障转译为可预测的资源调度问题。
把 LLM 在线推理的失败模式从 OOM、Preemption、Timeout、KV cache 碎片化、热点实例、数值异常六类拆解,对应到 admission control、graceful degradation、circuit breaker、KV pool resharding、hot pool warm-up、batch-fence 一套生产级容错栈,给出一份可在 vLLM/SGLang/TensorRT-LLM 三个引擎上落地的防御清单。
当一家中型 SaaS 公司每天承载 2 亿次 LLM 调用、横跨 GPT-5、Claude 4.7、Gemini 2.5 Pro 与自托管 Llama-4 Maverick 时,AI Gateway 不再是可选项——本文拆解 token 计量、prefix cache 路由、限流熔断、多模型负载均衡四大工程的真相与踩坑。
MoE 推理的瓶颈已从算力转移到 All-to-All 通信与专家容量治理。本文从 TP×EP 二维并行、capacity factor 调优、Prefill-Decode 分离架构的 MoE 适配、SLO 三维治理四个层面,给出 2026 H1 主流工程团队的实战取舍与生产事故复盘模式。
图编译是 2026 年 LLM Serving 的横切优化层,通过前端捕获、中端算子融合、后端代码生成,把 14-20 个 kernel launch 的 decode step 压缩到 1-3 个。在 Llama-3-70B 上实测可获 1.5-2 倍加速,超过换一代 GPU 的边际收益。本文给生产推荐 Inductor + CUDA Graph 作为默认方案
vLLM 0.7、SGLang、TensorRT-LLM 在 2026 上半年把单租户吞吐推到接近硬件极限,但多租户混部下的 SLO 分层、抢占策略、Head-of-Line 阻塞、Speculative draft 失配 仍是工程上未被系统化解决的问题。本文以调度策略的可证明公平性为主线,拆解四类生产事故的根因,给出端到端决策树。
当上下文窗口从 128K 迈向 1M tokens,推理引擎面临的是显存、计算、通信三重叠加的「不可能三角」。本文从 2026 年真实工程视角系统拆解 PagedAttention、Ring Attention 与 KV cache 卸载的决策路径,给出从 8 卡 H100 单节点到 32 卡跨机部署的可落地选型清单。
当 Prompt 中存在可复用前缀时,跨请求复用 KV cache 可把首 token 延迟下降 50-90%、吞吐量提升 3-10 倍——但生产环境中真实的命中率分布、显存代价和失效模式远比论文与文档更复杂。
从 vLLM 0.4 到 0.7,KV cache 的 PagedAttention 已经把 decode 阶段的显存利用率从 30% 拉到 70%;但 2026 H2 的实战表明,瓶颈正在迁移。本文从生产环境事故切入,给出分配器选型、prefix cache 治理、GPU 内存池监控的完整工程清单。
从单卡 H100 到万卡集群,大模型训练基础设施的真正瓶颈不是显存,而是 TP+PP+DP+ZeRO+EP 组合策略的帕累托前沿。本文从内存数学出发,拆解 FSDP/DeepSpeed/Megatron 在 2026 年生产级训练中的角色定位与组合范式。
S-LoRA 的 Paged-Adapter、Punica 的多租户 kernel、SGLang 的 RadixAttention-LoRA 演进,把“adapter 即服务”从理论推到生产,但每条路径都有 5-7 个真实工程陷阱——本文逐条拆解。
当 8 卡 H100 跑 Llama-3-70B 的单请求端到端 TTFT 已经被压到 80ms 时,2026 年生产级 LLM 推理几乎集体掉头——把 Prefill 和 Decode 拆到不同 GPU 池。这是从 vLLM 0.4 统一调度范式推倒重来的工程革命,收益是 P99 尾延迟降 15-30×,代价是 KV cache 跨卡传输与动态调度的工程复杂度。
2026 年 LLM 推理栈中,量化从“可选项”升级为“一等公民”。本文从工程视角系统梳理 GPTQ、AWQ、SmoothQuant、FP8、GGUF 五条主流路径,给出精度-性能-工程化三角的可落地决策树与 16 条部署 checklist。
投机解码在大模型推理中已经从研究原型跃迁为生产级标配,2026 年我们见证了 Medusa、EAGLE-3 与 n-gram 三大路线的工程化大爆发,吞吐 2-3 倍提升背后是 draft model 选择、verification 树管理、显存压力与 acceptance rate 调优的精密博弈。
vLLM 0.4 → 0.7 的调度器演进揭示了一个反直觉的事实:LLM 推理的瓶颈早已不在模型本身,而在调度器怎么把不同长度、不同生命周期的请求塞进同一个 GPU kernel。本文拆解 continuous batching 与 chunked prefill 两次决定性重构,以及 2026 年 disaggregation 的下一步。
2026 年的 LLM 推理工程已经从堆 GPU 走向重写每一层显存访问。本文沿 PagedAttention / FlashAttention / FlashDecoding / Speculative Decoding 顺序,剖析生产级推理内核如何把单卡 decode 吞吐从 200 tok/s 推到 2000+ tok/s 的工程路径。