Blog·Studio
文章系列日历归档关于搜索
Blog·Studio

一个记录思考、笔记与作品的技术博客。

Connect

© 2026 · Blog Studio

鄂ICP备19019526号

crafted with care

stay curious ✦

📅 9月16日星期三— No.557 —

👋 hi,这里是

my notebook

随手记下关于代码、设计 与日常的一些小想法。

📌 最新

AI 应用的多租户架构与配额计量工程 2026

点击翻看 →

📚 累计

556

已发表

☕ 今日

慢慢写

9月16日

↓ 翻到下一页to be continued...
  1. 文章

Journal

Editorial

随笔、研究与作品 — 一个持续生长的写作实验室。

按标签筛选

全部555AI 日报36AI 编程51Hermes Agent13AI 工具与产品31AI 原生架构96大模型研究97杂项
2
AI 行业趋势22
行业研究0
游戏1
Agent 技术123
智能体与 AI 应用开发71
游戏引擎与渲染4
游戏开发4
游戏服务架构4
  • 01

    AI 应用的多租户架构与配额计量工程 2026

    把隔离、配额、计量、成本分摊四件套拆成可观测的工程指标,GPU 秒归约是 2026 年 SaaS AI 多租户的事实标准,本文给出 90 天落地路线图。

    • #智能体与 AI 应用开发
    2026.07.16
  • 02

    偏好对齐的公理化重建 2026:从 DPO 对偶到 GRPO 群组优势的统一视角

    当 DPO 把 RLHF 折成对偶损失、GRPO 把 PPO 的 critic 折成群组基线、RLVR 把奖励折成规则验证器时,三条路径殊途同归地落在奖励几何、偏好采样、验证反馈的统一三轴上;本文从公理化与不动点的角度重建这条谱系,澄清当前工程实践里被混淆的若干概念。

    • #大模型研究
    2026.07.16
  • 03

    Agent 测试工程 2026:录制回放与四层 Sandbox 的工程范式

    把 Agent 测试拆为四元组形式化、Deterministic Replay 录制-回放架构、LLM/Tool 双层 Mock 隔离、Docker/firecracker/WASM 四层 Sandbox 与 CI 金字塔五件套,通过 trace 锁定行为、mock 隔离副作用、sandbox 切断执行、CI 门禁保证回归,把 LLM 的非确定性转化为可重放的工程工件。

    • #Agent 技术
    2026.07.16
  • 04

    Agent 多智能体协作博弈论 2026:均衡协商与涌现的统一框架

    多智能体 LLM Agent 的协作能力已广泛部署,但均衡存在性、信息瓶颈与涌现动力学三大理论困境长期悬而未决。本文建立博弈—协议—动力学三层框架,量化纳什均衡近邻存在条件与协商容量约束方程,为从工程直觉走向理论严谨提供系统性路线图。

    • #Agent 技术
    2026.07.16
  • 05

    LLM 推理弹性扩缩容工程 2026:从冷启动预热到多区域故障切换的生产闭环

    把冷启动预算、流量预测、多区域故障切换拆成可度量、可演练、可验证的三轴闭环,让推理平台在 90 秒 Ramp 与 30 秒 Failover 中都稳在 SLO 内。

    • #AI 原生架构
    2026.07.15
  • 06

    AI 原生 UX 的四层交互范式 2026:流式生成、结构化输出、人机协作与状态管理

    流式生成让等待变成体验,结构化输出让 AI 的不确定性变成可计算的确定性,多轮记忆让对话有了时间维度,Human-in-the-Loop 让 AI 的能力与人的判断力形成互补而非替代。

    • #智能体与 AI 应用开发
    2026.07.15
  • 07

    扩散语言模型的吸收-发射对偶 2026:从 SDE 到离散 token 的几何统一

    把自回归语言模型的离散 token 生成重新解释为吸收马尔可夫链在嵌入空间的几何投影,把连续时间扩散模型重新解释为发射马尔可夫链在数据流形的布朗游走;当嵌入维度 d 与序列长度 T 同时趋于无穷,二者在数据流形上坍缩为同一族对偶半群——这一对偶性是 LLaDA、MERCY、Diffusion-LM 等离散扩散语言模型统一在连续扩散 SDE 框架下的理论根因。

    • #大模型研究
    2026.07.15
  • 08

    端侧 LLM 推理的工程真相 2026:从内存预算、量化路径到生产闭环的四维拆解

    把端侧 LLM 推理的工程约束拆成内存预算、量化路径、运行时调度、生产闭环四个维度, 给出 2026 年手机、PC、嵌入式三类设备的 LLM 部署实测数据, 并对比 Apple Foundation Models、Android AICore、Windows ML 三大平台的工程差异, 最终沉淀一份“先内存规划、再量化选择、最后调度策略”的工程落地清单。

    • #智能体与 AI 应用开发
    2026.07.15
  • 09

    预测编码与 LLM 推理的不对称深度 2026:当生成式模型撞上自由能最小化原理

    把 LLM 的自回归推理抽象为“逐 token 预测误差的级联最小化”过程, 把预测编码 (Predictive Coding) 的自由能原理直接搬到 Transformer 的层间残差上, 给出“哪些层该深、哪些层该浅”的非对称深度架构判据, 配套训练时的层间误差传播与推理时的早停条件。

    • #Agent 技术
    2026.07.15
  • 10

    Agent 工具调用工程的容错、并发与 Schema 治理 2026

    把 tool call 拆成 schema 治理 + 调度 + 容错 + 预算四层, 通过 tool registry 版本号、retry budget、result 截断三件套, 让 Agent 在长链路、错误工具、不稳定 schema 环境下仍能稳定完成多步任务。

    • #Agent 技术
    2026.07.15
  • 11

    分布式训练工程真相 2026:3D 并行与 ZeRO-3 的生产闭环

    把 3D 并行(TP+PP+DP)的几何切分与通信开销、ZeRO-3 的状态分区与 all-gather 摊销、NCCL 拓扑感知与故障恢复统一为可决策的生产基线,让 70B+ 模型训练从论文可跑走向 7×24 生产可跑。

    • #AI 原生架构
    2026.07.14
  • 12

    GraphRAG 与多模态检索 2026:从知识图谱到跨模态融合的统一架构

    把知识图谱作为可解释的检索结构、把多模态嵌入作为证据补全通道、RRF 融合作为质量放大器,通过图遍历 + 跨模态相似度 + 重排序的三阶段融合,把 RAG 召回质量推上一个台阶。

    • #智能体与 AI 应用开发
    2026.07.14
  • 13

    扩散语言模型的去噪几何学 2026

    当 LLaDA、Mercury、Seed Diffusion 把逐 token 自回归换成整句去噪时,文本生成的几何形状从单向链式路径塌缩成双向流形上的扩散轨迹——本文用 score matching、并行接受率统计与去噪曲率三件套,给出这一范式转移的严格理论脚手架。

    • #大模型研究
    2026.07.14
  • 14

    Agent 长任务租约与防重工程 2026

    面向生产级 Agent 长任务,系统讲解条件领取、租约续期、防栅栏令牌、端到端幂等、事务型发件箱与补偿协议,给出故障注入指标和分阶段上线清单。

    • #Agent 技术
    2026.07.14
  • 15

    Agent 层次规划的偏序语义 2026:从 HTN 形式化到 LLM 提议-验证协同架构

    Agent 的层次规划不是“先列清单再执行”——它是一个偏序约束下的任务网络,在偏序语义中精化、在接口契约中抽象、在 AND/OR 超图中统一;LLM 负责生成候选分解,符号验证器负责不变量检查,两者形成提议-验证-修复的三阶段闭环。

    • #Agent 技术
    2026.07.14
  • 16

    LLM 推理的 KV Cache 分层卸载工程 2026:带宽预算与准入控制

    在 LLM 推理的连续批处理框架下,GPU 显存容量逐渐成为并发上限。本文聚焦 KV Cache 的三层卸载策略:HBM 作为 L0 热点缓存、CPU DRAM 作为 L1 温缓存、NVMe SSD 作为 L2 冷缓存,通过热度感知准入控制、异步 DMA 传输与 WAL 持久化,将并发上限提升 3-5 倍,同时将 P99 延迟控制在 SLO 允许范围内。

    • #AI 原生架构
    2026.07.13
  • 17

    AI 应用在线评估工程 2026:从隐式信号到数据飞轮的可观测闭环

    当 LLM 应用的 MVP 顺利上线,第一次出现的不是新功能需求,而是没人能回答的那个问题:它到底好不好?本篇系统拆解 AI 应用在线评估的工程闭环——从隐式信号采集、显式反馈通道、A/B 实验与护栏,到数据飞轮与再训练的可观测链路。

    • #智能体与 AI 应用开发
    2026.07.13
  • 18

    大模型知识编辑工程 2026:从 ROME、MEMIT 到追踪-干扰统一理论

    大模型知识编辑通过因果追踪定位知识神经元,结合 ROME、MEMIT 等超平面编辑算法实现精准修正,核心挑战在于批量编辑时的追踪-干扰平衡——知识方向正交化是当前最有效的干扰控制手段。

    • #大模型研究
    2026.07.13
  • 19

    Agent 流式响应与中断恢复工程 2026:从 HLC 到 cost-aware 早停

    聚焦 Agent 流式工程落地:HLC 单调时钟、协议分层(SSE/WS/gRPC)、idempotent tool_call + partial store、cost-aware 早停决策与 SRE 可观测闭环,与早间/晚间的理论角度错开。

    • #Agent 技术
    2026.07.13
  • 20

    Agent 反思机制的信息几何 2026:从 Reflexion 到自校正流形的不动点

    当 Agent 把反思当成 prompt 模板时注定失败,反思算子在经验流形上的不动点存在性,是 2026 反思机制收敛的几何判据。本文给出 Banach 不动点 + Pfaffian 流的双重视角。

    • #Agent 技术
    2026.07.13
← 上一页15 / 28
下一页 →