博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

标签

  • 全部
  • AI 日报(36)
  • AI 编程(51)
  • Hermes Agent(13)
  • AI 工具与产品(31)
  • AI 原生架构(58)
  • 大模型研究(55)
  • 杂项(2)
  • AI 行业趋势(22)
  • 行业研究(0)
  • 游戏(1)
  • Agent 技术(39)
  • 智能体与 AI 应用开发(21)
  1. 文章
  • Agent 流式响应与中断恢复工程 2026:从 HLC 时钟到 Cost-Aware 早停的生产闭环

    Agent 流式响应与中断恢复工程 2026:从 HLC 时钟到 Cost-Aware 早停的生产闭环

    Agent 流式响应的工程本质是在不确定延迟、不稳定网络和有限预算三重约束下,通过 HLC 时钟保障全序、通过幂等令牌保障恢复、通过 Cost-Aware 早停保障资源效率——三者的协同设计构成生产级流式 Agent 系统的可靠性基座。

    2026年7月27日·
    Agent 技术
  • Agent 决策机制的可解释性理论 2026:从电路发现、激活补丁到行为干预的统一框架

    Agent 决策机制的可解释性理论 2026:从电路发现、激活补丁到行为干预的统一框架

    把 Agent 决策链当作可微程序,在电路发现、激活补丁、行为干预三个互补视角下,沿决策流形的路径积分统一形式化,得到一张对生产可观测性与训练数据多样性都直接可操作的电路拓扑图,但必须正视假阴性陷阱与电路漂移,否则可解释性会从洞察变成错觉。

    2026年7月27日·
    Agent 技术
  • 多 LoRA 推理工程 2026:分桶、KV 隔离与 SRE 闭环

    多 LoRA 推理工程 2026:分桶、KV 隔离与 SRE 闭环

    把多 LoRA 推理服务视为受张量存储、KV 隔离、多 SLO 三重约束下的在线调度问题,通过 PEFT 微架构分层、L_max 容量公式、adapter-aware KV scheduler 与租户级成本归因,构建 2026 年生产可用的多租户 LLM 推理工程闭环。

    2026年7月26日·
    AI 原生架构
  • RAG 应用的离线评估工程 2026:从合成查询、参考答案到三件套回归门禁的闭环架构

    RAG 应用的离线评估工程 2026:从合成查询、参考答案到三件套回归门禁的闭环架构

    把改 RAG 的不确定性从上线后前置到 PR 之前——靠合成 query + 参考答案 + context precision/recall/faithfulness 三层指标 + 多 LLM 双盲 + 回归门禁矩阵构筑改 A 不打坏 B 的工程闭环。

    2026年7月26日·
    智能体与 AI 应用开发
  • 大模型涌现能力的相变标度律 2026:从有限尺寸标度到临界指数普适性的统一形式化

    大模型涌现能力的相变标度律 2026:从有限尺寸标度到临界指数普适性的统一形式化

    把大模型的能力涌现视为统计力学的有限尺寸相变,用 Fisher 标度假设与临界指数给出可证伪的统一框架,把 emergent abilities 现象统一到 Wilson-Fisher 不动点的 RG flow 语言里。

    2026年7月26日·
    大模型研究
  • Agent 工具调用最小权限与执行授权工程 2026

    Agent 工具调用最小权限与执行授权工程 2026

    把 Agent 的工具调用从超级用户还原为最小权限,关键不是加密、不是签名,而是把 OAuth scope、OPA/Cerbos 策略点评估、runtime PEP 拦截、三态决策(allow / deny / approval_required)、hash-chained audit trail 串成一条工程闭环;这些范式来自传统软件工程但必须在 Agent loop 的每个工具调用点重新落地一次。

    2026年7月26日·
    Agent 技术
  • Agent 工具调用的决策论框架 2026:从不确定性到元决策的几何统一

    Agent 工具调用的决策论框架 2026:从不确定性到元决策的几何统一

    把工具调用从语言行为升级为决策论行为:用 POMDP 形式化信念状态与工具合适度后验,把不确定性分解为认知、偶然、任务三层,在黎曼流形上构造 policy 测地线并用自由能最小化判据决定早停,把 2026 年工具调用从工程稳定推向认知合理。

    2026年7月26日·
    Agent 技术
  • LLM 推理服务的 SRE 治理与延迟分位工程 2026

    LLM 推理服务的 SRE 治理与延迟分位工程 2026

    把 P99 从系统测度提升为可治理对象,围绕调度噪声 / 计算路径 / 多租户干扰三类机制展开,统一为分位-预算耦合框架,给出 7 条带量化指标的工程推论,为推理服务的 SRE 治理提供可量化的反馈闭环。

    2026年7月25日·
    AI 原生架构
  • 代码助手的仓库级上下文装配:从索引、检索、编辑到可验证补丁

    代码助手的仓库级上下文装配:从索引、检索、编辑到可验证补丁

    仓库级代码助手正从单文件补全走向全仓库智能体,上下文装配(语义地图+混合检索+验证闭环)是核心工程瓶颈,多轮协作 UX 与渐进落地策略决定生产可用性。

    2026年7月25日·
    智能体与 AI 应用开发
  • Grokking 的相变理论 2026:从训练阶段跃迁到代数拓扑的统一视角

    Grokking 的相变理论 2026:从训练阶段跃迁到代数拓扑的统一视角

    把训练—泛化双序参量纳入 Landau 势刻画几何相变、用持久同调的 Betti 数离散合并刻画拓扑相变,两层耦合后 grokking 被理解为损失空间的二级相变与解空间的一阶拓扑相变在临界权重衰减下的同步事件——既能解释跃迁的延迟性与阶跃性,又能为长 epoch 训练提供可工程化的监控指标。

    2026年7月25日·
    大模型研究
  • Agent 优先级调度与资源配额工程 2026:从公平性理论、多级队列到生产限流的闭环架构

    Agent 优先级调度与资源配额工程 2026:从公平性理论、多级队列到生产限流的闭环架构

    本文系统化梳理了 Agent 优先级调度与资源配额工程的四大核心维度——公平性理论(DRR/WFQ)、多级队列架构、自适应限流(令牌桶+背压)以及成本感知调度——为生产级 Agent 平台的资源治理提供了从理论到工程的完整闭环框架。

    2026年7月25日·
    Agent 技术
  • 主动推断视角下的 Agent 世界模型与工具选择:自由能最小化的统一框架

    主动推断视角下的 Agent 世界模型与工具选择:自由能最小化的统一框架

    本文从自由能原理和主动推断出发,提出 Agent 的世界模型是环境生成过程的变分近似,工具调用是信息增益行动,记忆更新遵循变分推断规律,三者在自由能最小化目标下实现统一。

    2026年7月25日·
    Agent 技术
  • LLM 推理混合精度路由工程 2026: 从 FP8 权重到 INT4 KV 的生产真相

    LLM 推理混合精度路由工程 2026: 从 FP8 权重到 INT4 KV 的生产真相

    在线推理的显存墙不再是单一精度的命题: 本文拆解 FP8 权重 + INT4 KV + FP16 attention 这套生产级混合精度栈如何在 LLM 推理中实现 35% 显存节省 + 7% p99 时延回缩, 同时保证 KV cache 跨会话复用的命中率不塌方。

    2026年7月24日·
    AI 原生架构
  • Prompt 工程化与回归测试 2026:从版本化、A/B 平台到 prompt-CI 的闭环

    Prompt 工程化与回归测试 2026:从版本化、A/B 平台到 prompt-CI 的闭环

    把 prompt 从魔法字符串升级为一等软件资产:git 化 + 分层契约 + 三道 CI 闸门 + 稳定哈希分桶 A/B + trace 回流闭环,每一次 prompt 改动都接入版本控制、回归测试、灰度发布与一键回滚。

    2026年7月24日·
    智能体与 AI 应用开发
  • 大模型损失景观的 Morse 拓扑与模式连通性 2026

    大模型损失景观的 Morse 拓扑与模式连通性 2026

    把大模型损失景观视为高维 Morse 函数,把训练、LoRA 微调、模型合并与对称性破缺统一为同一套临界点分类与障碍谱理论,可推导 LoRA 线性模式连通性的成立条件,并给出合并何时安全可用的工程判据。

    2026年7月24日·
    大模型研究
  • Agent 的 Prompt Injection 防御工程 2026:纵深防御的真相

    Agent 的 Prompt Injection 防御工程 2026:纵深防御的真相

    Agent 的 Prompt Injection 防御不是单点技术而是纵深工程,本文从输入侧 trust tier、检测层对抗模式库、运行时防火墙结构化指令栈、输出侧 deterministic guard、持续红队评估五层,给出 2026 年生产 Agent 真正可落地的纵深防御闭环与八个必走动作清单。

    2026年7月24日·
    Agent 技术
  • Agent 主动信息获取的理论统一视角 2026

    Agent 主动信息获取的理论统一视角 2026

    把“问什么”和“做哪个动作”放在同一个期望-信息联合流形上统一决策,从 POMDP、bandit、information theory 到 active inference 的统一线索,本文给出 2026 年最新的理论骨架与五条工程推论。

    2026年7月24日·
    Agent 技术
  • MoE 推理 All-to-All 与 NVLink 拓扑感知调度工程 2026

    MoE 推理 All-to-All 与 NVLink 拓扑感知调度工程 2026

    把 MoE 推理的跨卡专家路由变成可调参的工程对象:grouped-top-K 让通信局部化、DeepEP 把 dispatch 融合到 kernel、NUMA-aware + nvlink-topo-file 暴露物理拓扑、EAGLE-2/3 + 共享 routing cache 把单 token decode 摊到多 token,再用四层 OTel 指标守住专家热点与带宽长尾。

    2026年7月23日·
    AI 原生架构
  • 多步任务代理应用的生产执行工程 2026:从任务分解、状态机到错误恢复的闭环架构

    多步任务代理应用的生产执行工程 2026:从任务分解、状态机到错误恢复的闭环架构

    从任务分解的边界模糊性到长程上下文的窗口耗尽,从中途失败的断点缺失到执行结果验证的级联风险——多步任务代理应用的核心工程挑战在于建立可靠的状态机抽象与多层恢复策略。

    2026年7月23日·
    智能体与 AI 应用开发
  • 稀疏激活 MoE 的统计力学理论 2026:从配分函数到专家专科化涌现的统一视角

    稀疏激活 MoE 的统计力学理论 2026:从配分函数到专家专科化涌现的统一视角

    把 MoE 路由函数映射到 Gibbs 分布、把专家温度映射到能量函数、把负载均衡约束映射到化学势约束——通过配分函数层级、自由能极小化、对称性破缺三个统计力学工具,把路由工程中的工程经验(温度、Top-K、辅助损失)收编为同一配分函数族的可微推论。

    2026年7月23日·
    大模型研究
上一页1 / 17
下一页