Blog·Studio
文章系列日历归档关于搜索
Blog·Studio

一个记录思考、笔记与作品的技术博客。

Connect

© 2026 · Blog Studio

鄂ICP备19019526号

crafted with care

stay curious ✦

📅 9月16日星期三— No.557 —

👋 hi,这里是

my notebook

随手记下关于代码、设计 与日常的一些小想法。

📌 最新

LLM 推理流式响应的断点续传、取消与请求恢复工程 2026

点击翻看 →

📚 累计

556

已发表

☕ 今日

慢慢写

9月16日

↓ 翻到下一页to be continued...
  1. 文章

Journal

Editorial

随笔、研究与作品 — 一个持续生长的写作实验室。

按标签筛选

全部555AI 日报36AI 编程51Hermes Agent13AI 工具与产品31AI 原生架构96大模型研究97杂项
2
AI 行业趋势22
行业研究0
游戏1
Agent 技术123
智能体与 AI 应用开发71
游戏引擎与渲染4
游戏开发4
游戏服务架构4
  • 01

    LLM 推理流式响应的断点续传、取消与请求恢复工程 2026

    把 LLM 流式响应从脆弱长连接重塑为可恢复可取消的有状态会话:以服务端 cancellation propagation、客户端 resumption token、HTTP/2 RST_STREAM 三件套为主轴,给出从协议层到监控层的完整工程范式。

    • #AI 原生架构
    2026.08.29
  • 02

    AI 应用的文档解析与多模态 chunking 工程 2026

    把 PDF/PPT/Excel 解析作为 RAG 应用的前置工程、把布局感知 chunking 作为召回质量的天花板,通过 PyMuPDF+pdfplumber+Docling+Marker 的工具组合与 late chunking+ColPali 的多模态嵌入,把 RAG 文档链路从 demo 推向生产。

    • #智能体与 AI 应用开发
    2026.08.29
  • 03

    稀疏自编码器机制可解释性的高阶相关理论 2026

    从单特征稀疏激活到特征电路的二阶统计与高阶累积量——把 LLM 可解释性从一阶语义推进到算法子结构,给出 SAE 训练的 Pareto 改进、电路冗余度猜想与拓扑骨架幂律。

    • #大模型研究
    2026.08.29
  • 04

    Agent 工具调用熔断降级与 Saga 补偿工程 2026

    把熔断、降级、Saga 补偿三类机制放进 agent 工具调用链路:circuit breaker 主动断路避免雪崩,fallback 链按 staleness budget 收窄能力,Saga 反向操作账本处理已部分成功的副作用。结合 OpenTelemetry trace 与反事实日志,给出六条可执行工程推论与 SRE 30 秒响应手册。

    • #Agent 技术
    2026.08.29
  • 05

    Agent 多智能体协作的机制设计与 VCG 可计算性理论 2026

    把经典 Vickrey-Clarke-Groves 机制设计的占优策略诚实保证作为多 Agent 协作的激励层,通过可计算社会成本近似 + 同态加密的偏好上报,把 prompt 拼接式的多 Agent 系统升级为激励相容的工程基础设施。

    • #Agent 技术
    2026.08.29
  • 06

    LLM 推理 FP8 工程 2026:从 GEMM 到 scaling 校准

    把 FP8 落地拆成 GEMM kernel 选型、权重激活 KV cache 三路独立 scale 决策、在线 calibration、灰度发布四个工程环节,通过精度-吞吐-显存三角的统一视角,推演出推理服务的可执行清单与已知踩坑。

    • #AI 原生架构
    2026.08.28
  • 07

    LLM 应用的多轮对话状态工程 2026

    本文把多轮 LLM 应用的会话状态形式化为四元组 S=(M,C,K,T),系统讨论弹性压缩、分支回滚、跨会话协同、状态机一致性四大设计模式,核心主张是对话状态不是 feature 而是基础设施,应在产品第 1 天就以基础设施的工程标准来设计。

    • #智能体与 AI 应用开发
    2026.08.28
  • 08

    RL 训练梯度流的 Wasserstein 几何与策略熵-奖励耦合动力学 2026

    从自然梯度、TRPO、PPO 到 Wasserstein 梯度流,把 RLHF/RLVR 时代的策略优化统一为策略分布空间上的黎曼优化,并给出六个基于几何意义的训练稳定性推论。

    • #大模型研究
    2026.08.28
  • 09

    Agent 副作用的可撤销执行

    把 Agent 的工具调用当作可授权、可追踪、可补偿的资源操作,而不是一次性函数请求,才能在模型不确定、外部系统半成功和权限变化并存的生产环境中安全地执行与恢复。

    • #Agent 技术
    2026.08.28
  • 10

    主动推理与自由能原理 2026:Agent 决策的预测编码统一框架

    把变分自由能与期望自由能作为 Agent 的统一标量目标,把 ReAct、Reflexion、HTN 与 POMDP 重新工程化为同一变分目标的精确校准;并以精度、free-energy 漂移与闭环吸引子给出可观测、可调、可证伪的运行时接口。

    • #Agent 技术
    2026.08.28
  • 11

    LLM 推理异构硬件调度工程 2026:从拓扑路由到在线凸优化的统一框架

    把异构硬件调度建模成局部实时决策加全局慢速反馈的在线凸优化问题,用拓扑感知路由器、KV 跨设备分配、动态批处理 split、全局纠偏四件套把调度延迟压进 50ms 预算,让 2026 年的推理平台在 H100、L40S 与国产 NPU 混部场景下拿到稳定 SLA。

    • #AI 原生架构
    2026.08.27
  • 12

    LLM 应用 Fine-tuning 工程 2026

    把 fine-tuning 从研究实验转变为 LLM 应用生产环境的标准工程能力,围绕数据准备、PEFT 训练、评估回归、服务化部署四个环节构建闭环。

    • #智能体与 AI 应用开发
    2026.08.27
  • 13

    Mamba 与线性注意力的状态空间统一理论 2026:从对偶递推到选择性遗忘

    把 SSM / linear attention / Mamba / RetNet / RWKV 全部纳入 (A,B,C,D) 对偶线性算子的统一骨架,用 State Space Duality 给出与 softmax attention 的等价类,在 input-dependent 选择性遗忘机制下推到 LTV 系统,并论证 2026 年主流 LLM 架构收敛到 SSM + sparse attention 混合范式的工程必然性。

    • #大模型研究
    2026.08.27
  • 14

    Agent 多租户隔离与配额工程 2026:从 token 预算到并发熔断的统一运行时

    把 L1 token 预算 / L2 请求速率 / L3 并发槽位 / L4 GPU 时隙四层配额,和 FCFS / DRR / WDRR 三种公平性策略,与三态熔断器一起,统一到 quota gateway 这个 0.3ms 瓶颈的 stateless 运行时的工程实战。

    • #Agent 技术
    2026.08.27
  • 15

    Agent 元学习的工具快速适应:从 MAML 到任务条件策略的形式化 2026

    在工具调用已膨胀到数百到数千个的现实里,Agent 不可能为每个新工具都靠 prompt 描述达成零样本可用。本文以 MAML/Reptile/HyperNetwork 三条路径为主线,把工具快速适应还原为参数初始化加一步梯度加任务条件生成的形式化问题,并给出可证伪的样本复杂度下界与对工程实践的具体推论。

    • #Agent 技术
    2026.08.27
  • 16

    LLM Prefill/Decode 分离架构工程 2026

    把 Prefill 的算力密集型与 Decode 的访存密集型特征拆到不同 worker,经 KV cache over RDMA 跨节点传输,把 P99 TTFT 与 TPOT 同时压到单引擎极限之上——这是 2026 年 LLM serving 的核心架构升级,DistServe/Splitwise/Mooncake/vLLM/SGLang 各家路径详评。

    • #AI 原生架构
    2026.08.26
  • 17

    AI 应用灰度发布 2026:四元组指纹与因果归因

    当 LLM 应用的发布对象从二进制制品变成 prompt 版本 + 检索管线 + 模型路由 + 缓存策略这四元组,传统灰度框架的可哈希性、确定性、观测一致性三根基同时失守。本文把四元组压回工程闭环,给出 2026 年 AI 应用在生产环境做渐进式发布与受控实验的工程范式:流量分层 → 版本语义 → 因果归因 → 自动护栏。

    • #智能体与 AI 应用开发
    2026.08.26
  • 18

    用算力换推理:Test-time Compute 的统计理论

    以 statistical decision theory 为统一框架,把 2024-2025 年兴起的 test-time compute scaling 四大主流范式 (CoT / ToT / PRM / verifier-search) 放进同一张 compute-optimal allocation frontier 图,论证「用算力换推理」是大模型继 pretraining scaling 之后的第二条扩展曲线,其增长边界由 verifier 质量决定而非 base model 容量。

    • #大模型研究
    2026.08.26
  • 19

    Agent 测试工程 2026:trace replay 与 LLM mock

    把 trace 录制、deterministic replay、LLM/tool mock 与 CI 门禁四件套压回可控回归;结构、语义、性能契约三层分开断言,让 Agent 系统从 demo 走到生产。

    • #Agent 技术
    2026.08.26
  • 20

    Agent 决策链的电路发现与行为干预形式化 2026

    把电路发现、激活补丁与因果中介三种机制可解释性范式,统一嫁接到 Agent 多步决策链路上,形成功能子图 → 失败切片 → 行为干预的可信审计框架,并指出当前工具调用 ReAct 链路在该框架下的三类开放问题。

    • #Agent 技术
    2026.08.26
← 上一页4 / 28
下一页 →