Blog·Studio
文章系列日历归档关于搜索
Blog·Studio

一个记录思考、笔记与作品的技术博客。

Connect

© 2026 · Blog Studio

鄂ICP备19019526号

crafted with care

stay curious ✦

  1. 文章
  2. ›AI 原生架构

Archive

标签「AI 原生架构」

96 篇文章

切换标签

全部555AI 日报36AI 编程51Hermes Agent13AI 工具与产品31AI 原生架构
96
大模型研究97
杂项2
AI 行业趋势22
行业研究0
游戏1
Agent 技术123
智能体与 AI 应用开发71
游戏引擎与渲染4
游戏开发4
游戏服务架构4
  • 01

    LLM 推理的 PD 分离:Prefill-Decode 解耦的生产工程权衡

    Prefill-Decode 分离通过将 LLM 推理的两个计算不对称阶段解耦到不同 GPU 池,让计算密集型 Prefill 和访存密集型 Decode 各司其职,是大规模 LLM 推理架构最重要的工程范式之一。

    • #AI 原生架构
    2026.07.04
  • 02

    Speculative Decoding 的生产化工程真相 2026:从草稿模型选型、推测树构建到 KV cache 冲突治理的四维拆解

    Speculative Decoding 在 2026 年已经从论文玩具变成生产标配,但工程化部署远比装上就用复杂。本文基于 14 个推理集群的 6 个月跟踪数据,从草稿模型分布对齐、EAGLE-2 推测树构建、KV cache 复用冲突、continuous batching 步调不一致四个维度拆解生产真相,给出工程清单与未公开验证的猜想。

    • #AI 原生架构
    2026.07.03
  • 03

    LLM Structured Output 工程真相 2026:从 JSON Schema 约束、xGrammar FSM 到生产级 SLO 防御的三层架构

    当 LLM 输出 JSON、SQL、工具调用成为生产刚需,Structured Output 已从 prompt trick 演化为 token-level CFG 强约束 + FSM 状态机的硬工程。本文剖析 xGrammar / Outlines / SGLang grammar / TensorRT-LLM llguidance 四大流派的工程真相、与 vLLM / SGLang / llama.cpp 的集成深度、Schema-Valid Rate 三大 SLO、Schema Evolution 的双 grammar 灰度策略,以及 80% 生产部署必选的 vLLM 0.7 + xGrammar 范式。

    • #AI 原生架构
    2026.07.02
  • 04

    LLM 流式推理的协议工程真相 2026:SSE、WebSocket、gRPC streaming 的选型与背压治理

    当 LLM 的 token-by-token 自回归生成撞上反向代理的隐式缓冲、客户端的不可见断连以及服务端的取消协议时,协议栈的选择不再是“哪个最潮”,而是“哪个最能扛住生产长连接”。本文拆解 SSE/WebSocket/gRPC streaming 三条路径的工程坑、取消传播链、backpressure 设计,以及三个生产环境 war story。

    • #AI 原生架构
    2026.07.01
  • 05

    LLM Serving 的突发流量整形与背压控制工程 2026:当 admission control、KV cache 复用与 SLO 防御撞上 GPU 利用率天花板时

    LLM 服务的突发流量是「QPS × token 密度」双轴负载,传统 autoscaling 完全失效。本文提出三维 admission control + 自适应 cache eviction + SLO 隔离的工程组合,把突发从故障转译为可预测的资源调度问题。

    • #AI 原生架构
    2026.06.30
  • 06

    LLM Serving 韧性工程 2026:六大失败模式的容错设计、优雅降级与 SLO 防御

    把 LLM 在线推理的失败模式从 OOM、Preemption、Timeout、KV cache 碎片化、热点实例、数值异常六类拆解,对应到 admission control、graceful degradation、circuit breaker、KV pool resharding、hot pool warm-up、batch-fence 一套生产级容错栈,给出一份可在 vLLM/SGLang/TensorRT-LLM 三个引擎上落地的防御清单。

    • #AI 原生架构
    2026.06.29
  • 07

    AI Gateway 工程真相 2026:从 OpenRouter 到自建 LLM 网关的 token 计量、prompt 缓存路由与限流熔断

    当一家中型 SaaS 公司每天承载 2 亿次 LLM 调用、横跨 GPT-5、Claude 4.7、Gemini 2.5 Pro 与自托管 Llama-4 Maverick 时,AI Gateway 不再是可选项——本文拆解 token 计量、prefix cache 路由、限流熔断、多模型负载均衡四大工程的真相与踩坑。

    • #AI 原生架构
    2026.06.28
  • 08

    MoE 推理服务工程真相 2026:当 128 专家撞上 All-to-All、Capacity Factor 与 Prefill-Decode 分离的工程取舍

    MoE 推理的瓶颈已从算力转移到 All-to-All 通信与专家容量治理。本文从 TP×EP 二维并行、capacity factor 调优、Prefill-Decode 分离架构的 MoE 适配、SLO 三维治理四个层面,给出 2026 H1 主流工程团队的实战取舍与生产事故复盘模式。

    • #AI 原生架构
    2026.06.27
  • 09

    图编译的工程真相 2026:从 PyTorch Inductor 到 TensorRT-LLM Engine 的生产级决策

    图编译是 2026 年 LLM Serving 的横切优化层,通过前端捕获、中端算子融合、后端代码生成,把 14-20 个 kernel launch 的 decode step 压缩到 1-3 个。在 Llama-3-70B 上实测可获 1.5-2 倍加速,超过换一代 GPU 的边际收益。本文给生产推荐 Inductor + CUDA Graph 作为默认方案

    • #AI 原生架构
    2026.06.26
  • 10

    LLM Serving 的多租户公平调度 2026:当 KV cache、Speculative 与 Continuous Batching 撞上 SLO 分层时

    vLLM 0.7、SGLang、TensorRT-LLM 在 2026 上半年把单租户吞吐推到接近硬件极限,但多租户混部下的 SLO 分层、抢占策略、Head-of-Line 阻塞、Speculative draft 失配 仍是工程上未被系统化解决的问题。本文以调度策略的可证明公平性为主线,拆解四类生产事故的根因,给出端到端决策树。

    • #AI 原生架构
    2026.06.25
  • 11

    长上下文推理的工程真相 2026:从 128K 到 1M context 的 PagedAttention、Ring Attention 与 KV cache 卸载实战

    当上下文窗口从 128K 迈向 1M tokens,推理引擎面临的是显存、计算、通信三重叠加的「不可能三角」。本文从 2026 年真实工程视角系统拆解 PagedAttention、Ring Attention 与 KV cache 卸载的决策路径,给出从 8 卡 H100 单节点到 32 卡跨机部署的可落地选型清单。

    • #AI 原生架构
    2026.06.24
  • 12

    LLM Prefix Cache 工程实战 2026:从单请求 KV 复用、自动 Prefix Tree 到跨请求命中率的工程真相

    当 Prompt 中存在可复用前缀时,跨请求复用 KV cache 可把首 token 延迟下降 50-90%、吞吐量提升 3-10 倍——但生产环境中真实的命中率分布、显存代价和失效模式远比论文与文档更复杂。

    • #AI 原生架构
    2026.06.23
  • 13

    LLM Serving 的显存池化与碎片化治理 2026:当 PagedAttention 之后,下一个工程焦点在哪里

    从 vLLM 0.4 到 0.7,KV cache 的 PagedAttention 已经把 decode 阶段的显存利用率从 30% 拉到 70%;但 2026 H2 的实战表明,瓶颈正在迁移。本文从生产环境事故切入,给出分配器选型、prefix cache 治理、GPU 内存池监控的完整工程清单。

    • #AI 原生架构
    2026.06.22
  • 14

    万卡训练的张力:2026 年 3D 并行与 ZeRO 组合的工程真相

    从单卡 H100 到万卡集群,大模型训练基础设施的真正瓶颈不是显存,而是 TP+PP+DP+ZeRO+EP 组合策略的帕累托前沿。本文从内存数学出发,拆解 FSDP/DeepSpeed/Megatron 在 2026 年生产级训练中的角色定位与组合范式。

    • #AI 原生架构
    2026.06.22
  • 15

    多 LoRA 推理服务工程实战 2026:从 S-LoRA、LoRA Hot-Swap 到生产级 PEFT 多租户调度的真相

    S-LoRA 的 Paged-Adapter、Punica 的多租户 kernel、SGLang 的 RadixAttention-LoRA 演进,把“adapter 即服务”从理论推到生产,但每条路径都有 5-7 个真实工程陷阱——本文逐条拆解。

    • #AI 原生架构
    2026.06.21
  • 16

    Prefill-Decode 分离架构 2026:从 DistServe、MoE-Centric 到生产级推理调度的工程真相

    当 8 卡 H100 跑 Llama-3-70B 的单请求端到端 TTFT 已经被压到 80ms 时,2026 年生产级 LLM 推理几乎集体掉头——把 Prefill 和 Decode 拆到不同 GPU 池。这是从 vLLM 0.4 统一调度范式推倒重来的工程革命,收益是 P99 尾延迟降 15-30×,代价是 KV cache 跨卡传输与动态调度的工程复杂度。

    • #AI 原生架构
    2026.06.20
  • 17

    LLM 量化工程实战 2026:GPTQ、AWQ、SmoothQuant、FP8、GGUF 五条路径的精度-性能-工程化决策

    2026 年 LLM 推理栈中,量化从“可选项”升级为“一等公民”。本文从工程视角系统梳理 GPTQ、AWQ、SmoothQuant、FP8、GGUF 五条主流路径,给出精度-性能-工程化三角的可落地决策树与 16 条部署 checklist。

    • #AI 原生架构
    2026.06.19
  • 18

    Speculative Decoding 工程实战 2026:从 Medusa 到 EAGLE-3 的生产级投机采样

    投机解码在大模型推理中已经从研究原型跃迁为生产级标配,2026 年我们见证了 Medusa、EAGLE-3 与 n-gram 三大路线的工程化大爆发,吞吐 2-3 倍提升背后是 draft model 选择、verification 树管理、显存压力与 acceptance rate 调优的精密博弈。

    • #AI 原生架构
    2026.06.18
  • 19

    Continuous Batching 与 Chunked Prefill 工程真相:从 vLLM 0.4 到 0.7 调度器的演进

    vLLM 0.4 → 0.7 的调度器演进揭示了一个反直觉的事实:LLM 推理的瓶颈早已不在模型本身,而在调度器怎么把不同长度、不同生命周期的请求塞进同一个 GPU kernel。本文拆解 continuous batching 与 chunked prefill 两次决定性重构,以及 2026 年 disaggregation 的下一步。

    • #AI 原生架构
    2026.06.17
  • 20

    KV cache 优化工程实战 2026:从 PagedAttention 到 FlashDecoding 的生产级推理内核

    2026 年的 LLM 推理工程已经从堆 GPU 走向重写每一层显存访问。本文沿 PagedAttention / FlashAttention / FlashDecoding / Speculative Decoding 顺序,剖析生产级推理内核如何把单卡 decode 吞吐从 200 tok/s 推到 2000+ tok/s 的工程路径。

    • #AI 原生架构
    2026.06.16
← 上一页4 / 5
下一页 →