Blog·Studio
文章系列日历归档关于搜索
Blog·Studio

一个记录思考、笔记与作品的技术博客。

Connect

© 2026 · Blog Studio

鄂ICP备19019526号

crafted with care

stay curious ✦

📅 9月16日星期三— No.557 —

👋 hi,这里是

my notebook

随手记下关于代码、设计 与日常的一些小想法。

📌 最新

推理时计算分配的变分下界理论 2026:五范式的统一几何

点击翻看 →

📚 累计

556

已发表

☕ 今日

慢慢写

9月16日

↓ 翻到下一页to be continued...
  1. 文章

Journal

Editorial

随笔、研究与作品 — 一个持续生长的写作实验室。

按标签筛选

全部555AI 日报36AI 编程51Hermes Agent13AI 工具与产品31AI 原生架构96大模型研究97杂项
2
AI 行业趋势22
行业研究0
游戏1
Agent 技术123
智能体与 AI 应用开发71
游戏引擎与渲染4
游戏开发4
游戏服务架构4
  • 01

    推理时计算分配的变分下界理论 2026:五范式的统一几何

    把推理时五种主流算力分配范式统一为对真实后验的 KL 散度逼近问题,给出每种范式的衰减阶、覆盖半径与 Pareto 决策边界。

    • #大模型研究
    2026.07.20
  • 02

    Agent 调试与可观测性工程 2026:从 token 级归因到生产复盘的四层架构

    把 Agent trace 拆成数据模型、运行时三轴采集、replay/bisect 调试协议、postmortem+fix-forward 复盘四层架构,从 token 级归因到三轴 SLO 告警,建立数据驱动的 Agent 工程质量闭环。

    • #Agent 技术
    2026.07.20
  • 03

    Agent 推理的因果推断视角 2026:do-calculus 与反事实决策框架

    把因果推断的 SCM + do-calculus + 反事实三件套作为 Agent 决策的形式化骨架:通过把工具调用显式建模为 do(X)、把 self-critique 锚定到已观察事实、并建立因果监控指标体系,让 Agent 在长任务失败归因、工具链级联错误、个性化策略调整等当前最稀缺场景下获得质的提升。

    • #Agent 技术
    2026.07.20
  • 04

    LLM 推理服务的能耗与碳感知调度工程 2026:从 PUE 到碳感知路由的生产闭环

    把单次推理能耗分解为 FLOPs × 内存 × IO 三轴度量,通过 DVFS 下限配置、SM 占用率调优、carbon-aware 时空路由、prefix cache 与 Carbon Span 可观测性,在不牺牲延迟 SLO 的前提下实现 30-50% 的总能耗下降;本文给出 GPU 级、调度级、可观测性级三层工程闭环的 Pareto 前沿与 7 条可落地的 SRE 清单。

    • #AI 原生架构
    2026.07.19
  • 05

    AI 应用的数据飞轮与冷启动工程 2026:从用户反馈闭环到模型自迭代的四层架构

    把 LLM 应用的反馈闭环拆成信号采集、反馈归因、数据回流、模型自迭代四层工程基础设施,把冷启动的零用户与小样本两个阶段分别形式化,并给出三轴约束与七条工程纪律,让应用越用越好用。

    • #智能体与 AI 应用开发
    2026.07.19
  • 06

    Test-Time Scaling 的计算最优分配理论 2026

    把 test-time compute 视作可分配预算的形式化框架,把 compute-optimal scaling law、自适应推理预算分配、test-time RL 整合到同一张统计力学相图上,并给出 5 条工程可执行项。

    • #大模型研究
    2026.07.19
  • 07

    Agent 人机协作(HITL)工程 2026:从审批流到反馈闭环的生产落地

    当 Agent 从 demo 走到生产,什么时候让人介入、介入之后状态如何恢复、人的反馈如何回流为模型偏好,这三个问题把一个会说话的玩具变成会协作的同事;本文把 HITL 拆成审批流、可恢复执行、反馈闭环、权限边界四块工程,给出可直接落地的实现骨架与失败模式清单。

    • #Agent 技术
    2026.07.19
  • 08

    Agent 通信协议的形式化语义 2026:承诺机与契约流形同伦

    把多智能体通信从自然语言搬运升级为承诺机代数 + 契约流形同伦,基于 Speech Act 三层结构与 Frobenius 可积性给出协议完备度的几何度量。

    • #Agent 技术
    2026.07.19
  • 09

    Reasoning LLM 推理服务化工程 2026:从思考链 token 通胀到 KV 复用与早停的几何真相

    Reasoning LLM 让单请求 token 量乘 10 到 100,传统 vLLM/SGLang serving 的 batch 聚合假设系统性失效——用 prefix-shared prefill + FP8 KV + 不对称 thinking-KV 回收 + cost-aware early stop 的四件套重构推理调度,把 HBM 利用率推到 90% 才能撑住生产。本篇从三轴成本模型(token · KV · 时间)出发盘点 2026 H2 主流引擎在 reasoning workload 上的几何取舍。

    • #AI 原生架构
    2026.07.18
  • 10

    端侧 AI 应用的浏览器内推理工程 2026:从 WebGPU 到生产落地的全栈真相

    把 LLM 推理从数据中心搬到浏览器不是简单的部署位置迁移,而是工程责任在客户端的重新分配——M/R/S/C 四元组的协同设计、模型按 64 MB 切片的 CDN 分发、PagedAttention 降级的 KV cache 内存预算、Puppeteer + CDP 断言的隐私技术证据、订阅/硬件捆绑/隐私溢价三条商业模式路径,共同构成 2026 年端侧 AI 应用从 demo 到生产落地的全栈真相。

    • #智能体与 AI 应用开发
    2026.07.18
  • 11

    μP与超参数迁移理论2026:从Tensor Programs到大模型超参笳安全的几何统一

    最大更新参数化(μP)通过标度变换的几何不变性,使小模型的最佳超参数能够零样本迁移到大模型,为trillion级参数LLM的调参提供了一条理论与实践仿备的可行路径。

    • #大模型研究
    2026.07.18
  • 12

    Agent 工具注册中心工程 2026:Schema 演进、灰度发布与版本兼容

    把 Schema 演进、代数判定、Registry/Resolver/Router 三层架构、版本约束与消费方契约、灰度发布三路径、可观测性指标、CI 兼容性拦截、12 条工程军规组装成一套可直接复用的工具注册中心工程范式。

    • #Agent 技术
    2026.07.18
  • 13

    Context Engineering 信息论 2026:从注意力熵塌缩到动态压缩率

    把上下文窗口从无脑 storage 重新定义为带宽受限的信息论通道,用 Online Information Bottleneck Lagrangian 统一刻画 attention 熵塌缩、动态压缩率、检索互信息上界三大机制,证明 β(t) 调度律本身是 Lagrangian 乘子,为长上下文工程提供从原则到调度的可执行框架。

    • #Agent 技术
    2026.07.18
  • 14

    LLM 推理的可观测性工程 2026:OTel GenAI 到三轴关联的生产闭环

    当 LLM 服务从 PoC 推到日均亿级 token 时,看不见会成为第一性瓶颈。本文给出 OTel GenAI 字段选型、Token 级 trace 与 KV cache 状态关联、GPU-Token-Quality 三轴闭环告警、P99 漂移自动 rollback 的完整生产范式与故障复盘。

    • #AI 原生架构
    2026.07.17
  • 15

    PromptOps 工程 2026:从版本化、A/B 测试、评审到回归测试的四维协作闭环

    PromptOps 将提示词工程从「调参艺术」升维为「工程学科」——本文拆解版本化、A/B 实验、协作评审与回归测试四大维度的生产级闭环架构,为 AI 应用团队提供可落地的 PromptOps 工程指南。

    • #智能体与 AI 应用开发
    2026.07.17
  • 16

    RL训练范式的演化拓扑 2026:从策略梯度到相对优势估计的统一几何

    RL训练范式的演化揭示了从显式价值估计(PPO)到隐式对比优化(DPO)再到去 Critic 的群组优势拓扑(GRPO)的统一几何内核——这一演化本质上是将奖励标量场重构为偏好流形上的最优传输问题,从而绕过了高维文本空间中价值函数逼近的固有困难。

    • #大模型研究
    2026.07.17
  • 17

    大模型能力评测完全指南 2026:指标含义、评测方法与权威平台推荐

    系统拆解大模型评测的核心指标体系、主流方法学路径与最具影响力的公开评测平台与开源项目;从 PPL、MMLU-Pro、SWE-bench 到 Chatbot Arena,帮助研究者和工程师建立可落地的评测认知框架。

    • #大模型研究
    2026.07.17
  • 18

    Agent 的 MCP 协议工程 2026:上下文协议、工具注册中心与多源联邦的工程落地

    把 MCP 从一份 JSON-RPC 规范升级为可观测、可灰度、可回滚的工具供应链,给出协议握手、Schema 版本治理、联邦发现、能力协商与生产告警五条工程主线的可落地实现,涵盖 65% 的 schema 漂移事故、20% 的联邦信任事故、10% 的可观测性盲区事故的修复路径。

    • #Agent 技术
    2026.07.17
  • 19

    Agent 经验回放与灾难性遗忘理论 2026:稳定性-可塑性悖论的多盆地拓扑

    把 replay 样本级保护、EWC Fisher 方向保护、渐进网络与 MoE 子空间隔离统一为损失景观多盆地拓扑的对偶视角,给出稳定性-可塑性悖论在 Transformer 上的工程化推论与可验证猜想。

    • #Agent 技术
    2026.07.17
  • 20

    训练数据合成工程 2026:质量-多样性-成本三角的权衡、验证与规模化

    GPT-5、Claude 3.7 Sonnet 等前沿模型已推动合成数据占比突破 50%,但质量-多样性-成本三角的权衡仍是未解工程难题。本文从生成、过滤、配比三阶段拆解合成数据的最佳实践,并提出能力覆盖度作为评估核心指标。

    • #AI 原生架构
    2026.07.16
← 上一页14 / 28
下一页 →