LLM 推理流式响应的断点续传、取消与请求恢复工程 2026
把 LLM 流式响应从脆弱长连接重塑为可恢复可取消的有状态会话:以服务端 cancellation propagation、客户端 resumption token、HTTP/2 RST_STREAM 三件套为主轴,给出从协议层到监控层的完整工程范式。
- #AI 原生架构
👋 hi,这里是
随手记下关于代码、设计 与日常的一些小想法。
Journal
随笔、研究与作品 — 一个持续生长的写作实验室。
按标签筛选
把 LLM 流式响应从脆弱长连接重塑为可恢复可取消的有状态会话:以服务端 cancellation propagation、客户端 resumption token、HTTP/2 RST_STREAM 三件套为主轴,给出从协议层到监控层的完整工程范式。
把 PDF/PPT/Excel 解析作为 RAG 应用的前置工程、把布局感知 chunking 作为召回质量的天花板,通过 PyMuPDF+pdfplumber+Docling+Marker 的工具组合与 late chunking+ColPali 的多模态嵌入,把 RAG 文档链路从 demo 推向生产。
从单特征稀疏激活到特征电路的二阶统计与高阶累积量——把 LLM 可解释性从一阶语义推进到算法子结构,给出 SAE 训练的 Pareto 改进、电路冗余度猜想与拓扑骨架幂律。
把熔断、降级、Saga 补偿三类机制放进 agent 工具调用链路:circuit breaker 主动断路避免雪崩,fallback 链按 staleness budget 收窄能力,Saga 反向操作账本处理已部分成功的副作用。结合 OpenTelemetry trace 与反事实日志,给出六条可执行工程推论与 SRE 30 秒响应手册。
把经典 Vickrey-Clarke-Groves 机制设计的占优策略诚实保证作为多 Agent 协作的激励层,通过可计算社会成本近似 + 同态加密的偏好上报,把 prompt 拼接式的多 Agent 系统升级为激励相容的工程基础设施。
把 FP8 落地拆成 GEMM kernel 选型、权重激活 KV cache 三路独立 scale 决策、在线 calibration、灰度发布四个工程环节,通过精度-吞吐-显存三角的统一视角,推演出推理服务的可执行清单与已知踩坑。
本文把多轮 LLM 应用的会话状态形式化为四元组 S=(M,C,K,T),系统讨论弹性压缩、分支回滚、跨会话协同、状态机一致性四大设计模式,核心主张是对话状态不是 feature 而是基础设施,应在产品第 1 天就以基础设施的工程标准来设计。
从自然梯度、TRPO、PPO 到 Wasserstein 梯度流,把 RLHF/RLVR 时代的策略优化统一为策略分布空间上的黎曼优化,并给出六个基于几何意义的训练稳定性推论。
把 Agent 的工具调用当作可授权、可追踪、可补偿的资源操作,而不是一次性函数请求,才能在模型不确定、外部系统半成功和权限变化并存的生产环境中安全地执行与恢复。
把变分自由能与期望自由能作为 Agent 的统一标量目标,把 ReAct、Reflexion、HTN 与 POMDP 重新工程化为同一变分目标的精确校准;并以精度、free-energy 漂移与闭环吸引子给出可观测、可调、可证伪的运行时接口。
把异构硬件调度建模成局部实时决策加全局慢速反馈的在线凸优化问题,用拓扑感知路由器、KV 跨设备分配、动态批处理 split、全局纠偏四件套把调度延迟压进 50ms 预算,让 2026 年的推理平台在 H100、L40S 与国产 NPU 混部场景下拿到稳定 SLA。
把 fine-tuning 从研究实验转变为 LLM 应用生产环境的标准工程能力,围绕数据准备、PEFT 训练、评估回归、服务化部署四个环节构建闭环。
把 SSM / linear attention / Mamba / RetNet / RWKV 全部纳入 (A,B,C,D) 对偶线性算子的统一骨架,用 State Space Duality 给出与 softmax attention 的等价类,在 input-dependent 选择性遗忘机制下推到 LTV 系统,并论证 2026 年主流 LLM 架构收敛到 SSM + sparse attention 混合范式的工程必然性。
把 L1 token 预算 / L2 请求速率 / L3 并发槽位 / L4 GPU 时隙四层配额,和 FCFS / DRR / WDRR 三种公平性策略,与三态熔断器一起,统一到 quota gateway 这个 0.3ms 瓶颈的 stateless 运行时的工程实战。
在工具调用已膨胀到数百到数千个的现实里,Agent 不可能为每个新工具都靠 prompt 描述达成零样本可用。本文以 MAML/Reptile/HyperNetwork 三条路径为主线,把工具快速适应还原为参数初始化加一步梯度加任务条件生成的形式化问题,并给出可证伪的样本复杂度下界与对工程实践的具体推论。
把 Prefill 的算力密集型与 Decode 的访存密集型特征拆到不同 worker,经 KV cache over RDMA 跨节点传输,把 P99 TTFT 与 TPOT 同时压到单引擎极限之上——这是 2026 年 LLM serving 的核心架构升级,DistServe/Splitwise/Mooncake/vLLM/SGLang 各家路径详评。
当 LLM 应用的发布对象从二进制制品变成 prompt 版本 + 检索管线 + 模型路由 + 缓存策略这四元组,传统灰度框架的可哈希性、确定性、观测一致性三根基同时失守。本文把四元组压回工程闭环,给出 2026 年 AI 应用在生产环境做渐进式发布与受控实验的工程范式:流量分层 → 版本语义 → 因果归因 → 自动护栏。
以 statistical decision theory 为统一框架,把 2024-2025 年兴起的 test-time compute scaling 四大主流范式 (CoT / ToT / PRM / verifier-search) 放进同一张 compute-optimal allocation frontier 图,论证「用算力换推理」是大模型继 pretraining scaling 之后的第二条扩展曲线,其增长边界由 verifier 质量决定而非 base model 容量。
把 trace 录制、deterministic replay、LLM/tool mock 与 CI 门禁四件套压回可控回归;结构、语义、性能契约三层分开断言,让 Agent 系统从 demo 走到生产。
把电路发现、激活补丁与因果中介三种机制可解释性范式,统一嫁接到 Agent 多步决策链路上,形成功能子图 → 失败切片 → 行为干预的可信审计框架,并指出当前工具调用 ReAct 链路在该框架下的三类开放问题。