LLM 应用评估工程 2026:从离线 Golden Set 到在线反馈闭环的统一范式
把离线 golden set 构造、LLM-as-judge 偏差控制、prompt 与检索回归测试、用户反馈 bandit、CI/CD 五道门禁做成一座工程化的评估工厂,是 LLM 应用从 demo 走向 SLA 的承重墙。
- #智能体与 AI 应用开发
👋 hi,这里是
随手记下关于代码、设计 与日常的一些小想法。
Journal
随笔、研究与作品 — 一个持续生长的写作实验室。
按标签筛选
把离线 golden set 构造、LLM-as-judge 偏差控制、prompt 与检索回归测试、用户反馈 bandit、CI/CD 五道门禁做成一座工程化的评估工厂,是 LLM 应用从 demo 走向 SLA 的承重墙。
本文从自由能量原理(FEP)和信息几何的统一视角出发,为智能 Agent 的设计提供了一个从变分推断、Markov 毯架构到工具调用规划和持续学习的完整理论框架,并给出了五条可直接落地的工程设计原则。
把流式输出作为延迟的视觉补偿、把结构化数据作为 UI 的事实层、把人机协作作为生成可靠性的最后兜底、把撤销回滚作为用户对 AI 错误的对抗机制——AI 原生 UX 是这四件事在工程层的统一协议。
把多 LoRA 推理从基座外挂重构为租户级显存编排:四层运行时契约 + 一致性 hash 路由 + 兼容矩阵式 KV cache 复用 + 12 项 SRE 实战清单。
混合检索融合稀疏关键词与稠密语义向量的互补优势,通过 RRF 或加权归一化融合多路召回,并引入 Cross-Encoder 重排序精细化候选集排序,结合 span 级引用溯源与幻觉抑制工程,是当前 AI 应用实现生产级检索质量的核心技术路径。
从 Fisher 信息矩阵的退化轨迹出发,把 model collapse 重新理解为生成模型与真实分布之间 KL 散度沿 Fisher-Rao 测地线的相变;给出合成数据 scaling 的临界点公式、三阶段相变判据与工程上的早停、抗 collapse 设计清单。
当 Agent 工具从写在 prompt 里的函数清单演进到平台化注册中心,版本契约、灰度染色、降级回滚就从工程实践变成了必须在第一行代码之前设计好的运行时契约。本文用四元组 schema、semver 兼容矩阵、tool-version 维度的灰度发布、center-side 协调降级这四条主线,把工具注册中心从一个 JSON 文件重做成一条可观测的版本化流水线。
从 Austin Searle 的言语行为理论到 FIPA ACL 的形式语义,给出 Agent 通信协议的表达力-可判定性-可验证性三维完备性定理,并提出基于范畴论的协议复合算子作为下一代多智能体协作的理论基底。
把 LangSmith / Langfuse / Helicone / Phoenix 四家平台的差异化定位、技术架构、商业化模式、产品边界做横评,并基于 OpenTelemetry GenAI Semantic Conventions 给出可落地的统一栈选型决策框架与 30/90/180 天迁移清单。
把稀疏自编码器与电路发现统一为残差流激活的稀疏因果分解,几何-信息论-因果三件套训练目标使 SAE 特征成为可干预、可审计、可蒸馏的电路原子,在 7B-13B 模型上已具备工程化训练与红队探针的落地条件。
把工具输出校验从附加检查升级为四元组 (Tool, Schema, Validator, RetryPolicy) 的一等公民:Pydantic v2 + Zod + JSON Schema Draft 2020-12 三层校验漏斗(语法→语义→业务),按失败模式分级 retry,能把工具调用下游事故降低 70% 以上。
把多智能体协作从工程拼接重构为带有收敛性保证的拓扑动力学问题,把涌现行为从不可预测的副作用重构为可形式化分析的动力学吸引子,把通信开销从工程权衡重构为信息瓶颈下的均衡点偏离 —— 这一组重构,正在把 Agent 技术从「多进程脚本」推向「可证明的多主体动力学系统」。
把投机解码当作接受率为核心的端到端加速工程,在树注意力 + 动态 K + 量化耦合三层之上重新推导加速比上界,给出 9 节工程实战与 Pareto 前沿实测。
从 STRIDE-AI 威胁模型出发,逐层构建输入净化、上下文隔离、工具沙箱、输出校验与引用溯源的多层护栏体系;用 8 条可落地建议 + 14 篇 2025–2026 年最新文献,给 AI 应用开发者一份从 demo 到生产的护栏工程决策框架。
把知识蒸馏的传输通道从概率单纯形升级为 Grassmann 流形,把暗知识从 Hinton 软标签的标量统计扩展到特征子空间的正交基,把学生模仿教师重构为流形间的测地线对齐——为下一代多模态/异构蒸馏提供理论底座。
把上下文当作 Agent 的第一资源来管理——四元组预算+分层压缩+KV cache 复用+多目标帕累托是 2026 年统一工程实战范式。
把 Agent 内部 belief state 当成高维向量会丢失关键的几何不变量;本文从代数拓扑视角给出 Betti 数、持续同调、流形曲率等工具在 Agent 状态空间的应用,建立从拓扑指纹到调试、可观测性、可靠性工程的统一分析框架。
把 preemption/copy-on-write/SLO 分层抽象为统一的请求运行时,在 GPU显存、KV cache 复用与公平性之间建立可形式化验证的调度内核,降低尾延迟并最大化吞吐。
把 LLM 应用的缓存从单点工具升级为覆盖 L0 prompt fingerprint、L1 语义向量、L2 跨模态、L3 分布复用的四级层叠架构,配合成本感知路由与脏读防御,把每千次请求成本压到原本的 35%-60%。
把对齐训练中保留预训练知识与习得新偏好的张力,形式化为策略流形上的保留-习得比;证明 GRPO 的 KL 锚点是这条张力 Pareto 前沿的几何稳定锚点。