LLM Prefix Cache 工程 2026:四维拆解与生产实证
Prefix cache 是 2026 LLM serving 系统决定 TCO 的关键变量:存储、匹配、隔离、失效四维拆解与生产实证。
- #AI 原生架构
👋 hi,这里是
随手记下关于代码、设计 与日常的一些小想法。
Journal
随笔、研究与作品 — 一个持续生长的写作实验室。
按标签筛选
Prefix cache 是 2026 LLM serving 系统决定 TCO 的关键变量:存储、匹配、隔离、失效四维拆解与生产实证。
RAG 从论文范式落地为面向终端用户的完整产品,分块、检索、重排、引用、抑制五大模块必须在统一架构下协同演化,单点优化几乎注定失败。
DeepSeek 抛出的 NSA 把 attention 的接受域切成了可学习的压缩/选择/滑动窗三分支。本文用 metric-measure 空间给出五条主定理(紧化存在性、压缩不动点、稀疏率相变、与 Mamba-2 SSD 的对偶谱、与 GQA/MQA 的几何包含),并画出两条训练动力学相变曲线,给研究者五条未公开验证的几何猜想与一份八项工程基线。
当 Agent 从 demo 走向生产,工具调用是第一个把概率性语言模型与确定性业务系统焊在一起的接缝。本文从工程实战视角拆解 JSON 漂移、并行竞态、Schema 版本漂移与副作用幂等四类故障,给出四级错误恢复金字塔、12 条 SRE 可观测性清单与五条治理原则。
本文用 Banach 不动点几何统一 ReAct、Reflexion、Tree-of-Thoughts、Plan-and-Execute 四种 Agent 推理范式,推导四者的压缩系数谱、双算子结构、吸引子拓扑与稀疏依赖分解,给出按任务视野长度选型的三条推论与给架构师的几何清单
本文用 Saras / vLLM v1.0 / DistServe / Mooncake 四个生产样本,推导 Token 级调度在 GPU 推理栈里的工程真相——五元组决策、SM-aware 匹配、跨节点 KV 中心化,与 SLO 公平性的范式跃迁。
本文用统计场论重新推导课程学习,把课程温度 τ 与泛化误差的耦合刻画为亚临界-临界-超临界三段式相变,给出临界温度 τc 的封闭形式、盆地连通性的相变诊断,以及 SRE 训练平台可观测性的三组新指标。
Agent Skill 优化工程:把"提示词工程"升级为"可编译的优化流水线" 当 Agent 从 demo 走向生产,system prompt 不再是一段"灵感创作",而是一个 可被版本管理、可被自动评估、可被算法搜索 的工程对象。本文系统讲清楚 Skill Optimization
2026 年的 Agent 框架市场已经分裂成图引擎派、角色剧本派、会话群智派、去中心化 Swarm 派与 SDK 极简派五大学派。本文按 9 节结构横评六款主流框架的工程真相,并给出给 SRE 与架构师的 7 条决策规则。
本文系统拆解 2026 年为 AI 编程 Agent 构造可查询仓库的四种主流索引方案 —— Repo Map 的轻量级目录骨架、CTags 的正则符号表、LSP 的精确类型图与 Embedding 的语义近邻 —— 并在末尾给出按仓库规模与 Agent 类型选型的工程决策矩阵
在 KV cache 显存受限、长短请求混杂、TTFT 与 TPOT 双目标拉扯的三角约束下,Continuous Batching 不再是“是否启用”的二选一,而是“调度粒度、prefill chunk 大小、decode batch 配比”三维参数的连续优化问题。本文从 vLLM v0.6/v0.7、SGLang v0.3、TensorRT-LLM v1.0 的源码与生产事故出发,给出三维决策真值表与四条来自一线生产事故的真实 postmortem。
Mistral、DeepSeek、G42、BharatGPT、HyperCLOVA X 五国主权 AI 集群正在重塑全球 AI 产业,本文建立主权资本密度 SCD 指标,论证从开源生态到人才回流再到算力供应链的三重冲击。
本文建立推测解码的接受率统计力学框架,揭示单次推测窗口的接受数方差与 Rényi 散度的有限样本相变性质,证明最优猜测长度 κ* 在 α ∈ [0.68, 0.75] 的实际工作区间内自然收敛到 [3,7],并论证 α_c ≈ 0.74 作为工程相变点的双曲鞍点本质。
2026 年 AI 编程工具市场已分化为 IDE 原生派与 Agent CLI/SDK 派两条工程范式。本文用 GitHub Star(2026-07-04 实时)、模型后端、定价、上下文工程、可扩展性五个维度,给出七大工具的工程决策矩阵与典型生产场景组合推荐。
当 HumanEval、SWE-bench、LiveCodeBench 在你的 codebase 上失真时,自建 Eval Harness 是把“AI 编程质量”从主观判断转译为可量化工程信号的唯一路径——本文给出 8 周落地的最小骨架、四类核心指标的可量化定义、四个生产级陷阱的防御策略,以及一份按周排期的工程 checklist。
从调度器、KV cache、推测解码、量化、连续批处理五大维度对比三大推理引擎的工程真相,给出选型决策树与三大典型事故复盘。
基础模型 API 业务从“烧钱换增长”进入“差异化定价博弈”:OpenAI 凭 ChatGPT 生态、Anthropic 凭企业合同、Google DeepMind 凭 TPU 自研、DeepSeek 凭极致低价+无外部融资,在毛利率、推理侧贡献度、现金跑道三条轴上展开竞争;2026 H2 价格战进入“能力差异化”阶段,最早 2028 H2 行业可能达到“成熟 SaaS”估值稳态。
本文从连续线性 ODE 出发,重建 SSM 的离散对偶形式,证明 Mamba 选择性扫描与 S4 对偶卷积核在频域共享同一谱族,并由此推出 Mamba-2 SSD 对偶的线性注意力等价与受限傅里叶基的秩-1 闭式。
当 Sora 2 与 Veo 3 把闭源视频生成拉到 1080p / 60 秒级别,开源阵营以 12K-16K Star 速度同步逼近——本文给出 2026 年选型的三维决策框架(质量 / 成本 / 可控性),并把分辨率、时长、价格、API 形态、可商用条款一次性拉通。
当 Cursor / Claude Code / Copilot / Cline / Windsurf 在同一仓库协同时,单后端成本工程已触顶。本文拆解任务分级路由 + 失败回退编排 + 跨后端上下文同步三层架构,提出可落地的 MRC-v1 契约