博客
文章系列日历
归档关于搜索

鄂ICP备19019526号

© 2026 博客

标签

  • 全部
  • AI 日报(36)
  • AI 编程(51)
  • Hermes Agent(13)
  • AI 工具与产品(31)
  • AI 原生架构(58)
  • 大模型研究(55)
  • 杂项(2)
  • AI 行业趋势(22)
  • 行业研究(0)
  • 游戏(1)
  • Agent 技术(39)
  • 智能体与 AI 应用开发(21)
  1. 文章
  2. AI 原生架构

当前标签:AI 原生架构 · 共 58 篇

  • 多 LoRA 推理工程 2026:分桶、KV 隔离与 SRE 闭环

    多 LoRA 推理工程 2026:分桶、KV 隔离与 SRE 闭环

    把多 LoRA 推理服务视为受张量存储、KV 隔离、多 SLO 三重约束下的在线调度问题,通过 PEFT 微架构分层、L_max 容量公式、adapter-aware KV scheduler 与租户级成本归因,构建 2026 年生产可用的多租户 LLM 推理工程闭环。

    2026年7月26日·
    AI 原生架构
  • LLM 推理服务的 SRE 治理与延迟分位工程 2026

    LLM 推理服务的 SRE 治理与延迟分位工程 2026

    把 P99 从系统测度提升为可治理对象,围绕调度噪声 / 计算路径 / 多租户干扰三类机制展开,统一为分位-预算耦合框架,给出 7 条带量化指标的工程推论,为推理服务的 SRE 治理提供可量化的反馈闭环。

    2026年7月25日·
    AI 原生架构
  • LLM 推理混合精度路由工程 2026: 从 FP8 权重到 INT4 KV 的生产真相

    LLM 推理混合精度路由工程 2026: 从 FP8 权重到 INT4 KV 的生产真相

    在线推理的显存墙不再是单一精度的命题: 本文拆解 FP8 权重 + INT4 KV + FP16 attention 这套生产级混合精度栈如何在 LLM 推理中实现 35% 显存节省 + 7% p99 时延回缩, 同时保证 KV cache 跨会话复用的命中率不塌方。

    2026年7月24日·
    AI 原生架构
  • MoE 推理 All-to-All 与 NVLink 拓扑感知调度工程 2026

    MoE 推理 All-to-All 与 NVLink 拓扑感知调度工程 2026

    把 MoE 推理的跨卡专家路由变成可调参的工程对象:grouped-top-K 让通信局部化、DeepEP 把 dispatch 融合到 kernel、NUMA-aware + nvlink-topo-file 暴露物理拓扑、EAGLE-2/3 + 共享 routing cache 把单 token decode 摊到多 token,再用四层 OTel 指标守住专家热点与带宽长尾。

    2026年7月23日·
    AI 原生架构
  • LLM 推理调度的延迟公平性工程 2026:从 WFQ、抢占到多 SLO 的生产闭环

    LLM 推理调度的延迟公平性工程 2026:从 WFQ、抢占到多 SLO 的生产闭环

    当 LLM 推理的瓶颈从 KV 内存转移到调度器公平性,我们看到 TTFT p99 在多租户混合负载下漂移 5%,长尾请求被短请求频繁插队饿死;本文从 WFQ 公平排队、协作/非协作抢占、多 SLO 分层队列三方面拆解生产级推理调度器的工程真相。

    2026年7月22日·
    AI 原生架构
  • LLM 推理安全纵深防御工程 2026:输入过滤、越狱检测与对抗训练闭环

    LLM 推理安全纵深防御工程 2026:输入过滤、越狱检测与对抗训练闭环

    LLM 推理安全是输入过滤、越狱检测、内容审计、对抗训练四层纵深防御系统工程,生产目标为召回率95%以上、误伤率0.1%以下、P99延迟5ms以内。

    2026年7月21日·
    AI 原生架构
  • LLM 网关与代理工程 2026:多模型路由、语义缓存与限流治理的统一架构

    LLM 网关与代理工程 2026:多模型路由、语义缓存与限流治理的统一架构

    2026 年 LLM 生产系统的必备基础设施——网关层以多模型路由、语义缓存、令牌桶限流、三轴可观测性四大能力,实现 AI 流量的成本可控、韧性可靠与运维可观测。

    2026年7月20日·
    AI 原生架构
  • LLM 推理服务的能耗与碳感知调度工程 2026:从 PUE 到碳感知路由的生产闭环

    LLM 推理服务的能耗与碳感知调度工程 2026:从 PUE 到碳感知路由的生产闭环

    把单次推理能耗分解为 FLOPs × 内存 × IO 三轴度量,通过 DVFS 下限配置、SM 占用率调优、carbon-aware 时空路由、prefix cache 与 Carbon Span 可观测性,在不牺牲延迟 SLO 的前提下实现 30-50% 的总能耗下降;本文给出 GPU 级、调度级、可观测性级三层工程闭环的 Pareto 前沿与 7 条可落地的 SRE 清单。

    2026年7月19日·
    AI 原生架构
  • Reasoning LLM 推理服务化工程 2026:从思考链 token 通胀到 KV 复用与早停的几何真相

    Reasoning LLM 推理服务化工程 2026:从思考链 token 通胀到 KV 复用与早停的几何真相

    Reasoning LLM 让单请求 token 量乘 10 到 100,传统 vLLM/SGLang serving 的 batch 聚合假设系统性失效——用 prefix-shared prefill + FP8 KV + 不对称 thinking-KV 回收 + cost-aware early stop 的四件套重构推理调度,把 HBM 利用率推到 90% 才能撑住生产。本篇从三轴成本模型(token · KV · 时间)出发盘点 2026 H2 主流引擎在 reasoning workload 上的几何取舍。

    2026年7月18日·
    AI 原生架构
  • LLM 推理的可观测性工程 2026:OTel GenAI 到三轴关联的生产闭环

    LLM 推理的可观测性工程 2026:OTel GenAI 到三轴关联的生产闭环

    当 LLM 服务从 PoC 推到日均亿级 token 时,看不见会成为第一性瓶颈。本文给出 OTel GenAI 字段选型、Token 级 trace 与 KV cache 状态关联、GPU-Token-Quality 三轴闭环告警、P99 漂移自动 rollback 的完整生产范式与故障复盘。

    2026年7月17日·
    AI 原生架构
  • 训练数据合成工程 2026:质量-多样性-成本三角的权衡、验证与规模化

    训练数据合成工程 2026:质量-多样性-成本三角的权衡、验证与规模化

    GPT-5、Claude 3.7 Sonnet 等前沿模型已推动合成数据占比突破 50%,但质量-多样性-成本三角的权衡仍是未解工程难题。本文从生成、过滤、配比三阶段拆解合成数据的最佳实践,并提出能力覆盖度作为评估核心指标。

    2026年7月16日·
    AI 原生架构
  • LLM 推理弹性扩缩容工程 2026:从冷启动预热到多区域故障切换的生产闭环

    LLM 推理弹性扩缩容工程 2026:从冷启动预热到多区域故障切换的生产闭环

    把冷启动预算、流量预测、多区域故障切换拆成可度量、可演练、可验证的三轴闭环,让推理平台在 90 秒 Ramp 与 30 秒 Failover 中都稳在 SLO 内。

    2026年7月15日·
    AI 原生架构
  • 分布式训练工程真相 2026:3D 并行与 ZeRO-3 的生产闭环

    分布式训练工程真相 2026:3D 并行与 ZeRO-3 的生产闭环

    把 3D 并行(TP+PP+DP)的几何切分与通信开销、ZeRO-3 的状态分区与 all-gather 摊销、NCCL 拓扑感知与故障恢复统一为可决策的生产基线,让 70B+ 模型训练从论文可跑走向 7×24 生产可跑。

    2026年7月14日·
    AI 原生架构
  • LLM 推理的 KV Cache 分层卸载工程 2026:带宽预算与准入控制

    LLM 推理的 KV Cache 分层卸载工程 2026:带宽预算与准入控制

    在 LLM 推理的连续批处理框架下,GPU 显存容量逐渐成为并发上限。本文聚焦 KV Cache 的三层卸载策略:HBM 作为 L0 热点缓存、CPU DRAM 作为 L1 温缓存、NVMe SSD 作为 L2 冷缓存,通过热度感知准入控制、异步 DMA 传输与 WAL 持久化,将并发上限提升 3-5 倍,同时将 P99 延迟控制在 SLO 允许范围内。

    2026年7月13日·
    AI 原生架构
  • LLM 推理连续批处理内核 2026:PagedAttention 微架构真相

    LLM 推理连续批处理内核 2026:PagedAttention 微架构真相

    从 PagedAttention 块表、RadixTree 复用、Chunked Prefill SLO 折中到 SM 调度与抢占式调度的工程化对齐,把推理引擎从 60% 利用率推到 85%+。

    2026年7月12日·
    AI 原生架构
  • LLM 推理的 GPU 拓扑感知调度工程 2026:NVLink、PCIe 与切分真相

    LLM 推理的 GPU 拓扑感知调度工程 2026:NVLink、PCIe 与切分真相

    当 8 卡 H100 的 NVLink 域把全互联带宽堆到 900 GB/s、把跨 PCIe 交换机的 P2P 带宽压到 64 GB/s 时, tensor parallelism 跨域切分会立刻把推理时延拖慢 1.4-2.1 倍——本文从拓扑模型、张量并行切分点、流水线并行阶段数、专家并行通信四个维度拆解 GPU 拓扑感知调度的工程真相。

    2026年7月11日·
    AI 原生架构
  • LLM 多 LoRA 路由与热加载工程 2026

    LLM 多 LoRA 路由与热加载工程 2026

    当一个 70B 基座要同时承载 200 个任务的 LoRA 适配器时,传统独立推理进程范式在显存、延迟、调度三维度失效;本文给出 S-LoRA 统一内存池、PEFT 热加载与三层路由元数据索引的生产工程真相。

    2026年7月10日·
    AI 原生架构
  • LLM 量化精度退化的在线监控工程 2026:从 PPL 漂移到自动回滚的闭环架构

    LLM 量化精度退化的在线监控工程 2026:从 PPL 漂移到自动回滚的闭环架构

    当量化模型在部署第 3-6 周出现“沉默退化”时,离线 benchmark 帮不了你——需要把 PPL 漂移、激活分布偏移、任务级回归三层信号收口到自动回滚决策矩阵的在线监控工程。

    2026年7月9日·
    AI 原生架构
  • LLM Prefix Cache 工程 2026:四维拆解与生产实证

    LLM Prefix Cache 工程 2026:四维拆解与生产实证

    Prefix cache 是 2026 LLM serving 系统决定 TCO 的关键变量:存储、匹配、隔离、失效四维拆解与生产实证。

    2026年7月8日·
    AI 原生架构
  • Token 级调度的工程真相 2026:四大生产系统的范式跃迁

    Token 级调度的工程真相 2026:四大生产系统的范式跃迁

    本文用 Saras / vLLM v1.0 / DistServe / Mooncake 四个生产样本,推导 Token 级调度在 GPU 推理栈里的工程真相——五元组决策、SM-aware 匹配、跨节点 KV 中心化,与 SLO 公平性的范式跃迁。

    2026年7月7日·
    AI 原生架构
上一页1 / 3
下一页