Blog·Studio
文章系列日历归档关于搜索
Blog·Studio

一个记录思考、笔记与作品的技术博客。

Connect

© 2026 · Blog Studio

鄂ICP备19019526号

crafted with care

stay curious ✦

  1. 文章
  2. ›AI 原生架构

Archive

标签「AI 原生架构」

96 篇文章

切换标签

全部555AI 日报36AI 编程51Hermes Agent13AI 工具与产品31AI 原生架构96大模型研究97杂项2AI 行业趋势22行业研究0游戏1Agent 技术123智能体与 AI 应用开发71游戏引擎与渲染4游戏开发4游戏服务架构4
  • 01

    LLM 网关多模型路由与负载均衡工程 2026

    以路由策略 × 负载均衡 × 成本感知 × 可观测性四元组为骨架,系统性地拆解语义路由的嵌入空间设计、加权最小连接的 LLM 适配、LLM-as-judge 软降级与 trace × cost × quality × SLO 四面体可观测性,并给出平台架构师的四阶段演进路线图与未来 12-18 个月趋势预测。

    • #AI 原生架构
    2026.09.11
  • 02

    LLM 多 LoRA 推理服务工程 2026:从热插拔到租户编排

    把多 LoRA 推理从基座外挂重构为租户级显存编排:四层运行时契约 + 一致性 hash 路由 + 兼容矩阵式 KV cache 复用 + 12 项 SRE 实战清单。

    • #AI 原生架构
    2026.09.10
  • 03

LLM 投机解码工程 2026:从草稿模型到树注意力的统一架构

把投机解码当作接受率为核心的端到端加速工程,在树注意力 + 动态 K + 量化耦合三层之上重新推导加速比上界,给出 9 节工程实战与 Pareto 前沿实测。

  • #AI 原生架构
2026.09.04
  • 04

    LLM 推理的请求优先级与公平调度工程 2026

    把 preemption/copy-on-write/SLO 分层抽象为统一的请求运行时,在 GPU显存、KV cache 复用与公平性之间建立可形式化验证的调度内核,降低尾延迟并最大化吞吐。

    • #AI 原生架构
    2026.09.03
  • 05

    LLM 推理的能耗感知调度工程 2026:从 PUE 到碳感知路由与绿色推理的统一框架

    把 PUE 感知地理路由、DVFS/动态 batch 的能效曲线、碳感知 defer 窗口三条工程主线沿碳-时-算三维 Pareto 边界滑动,给出可观测性指标、ROI 公式、SLA 反向约束与十项 SRE 可执行清单。

    • #AI 原生架构
    2026.09.02
  • 06

    LLM 推理的混合精度调度工程 2026:端到端精度与吞吐的联合优化

    把 LLM 推理的精度选择从选一个全局精度升级为为每个推理路径单独选精度——prefill 走 FP8 linear + BF16 attention,decode 走 FP8 权重 + BF16/FP8 KV cache,logits 强制 FP32;再把这些路径放进一个可观测、可调度、可回滚的端到端优化循环——这是 2026 年生产推理服务的及格线。

    • #AI 原生架构
    2026.09.01
  • 07

    MoE 推理的专家并行工程 2026:通信、放置与动态批处理的统一框架

    从 All-to-All 通信的拓扑感知优化、专家负载偏斜的自适应控制、capacity factor 的动态调节、显存分层管理到量化精度的精细平衡,系统拆解 MoE 推理的四大工程支柱与生产级落地路径。

    • #AI 原生架构
    2026.08.30
  • 08

    LLM 推理流式响应的断点续传、取消与请求恢复工程 2026

    把 LLM 流式响应从脆弱长连接重塑为可恢复可取消的有状态会话:以服务端 cancellation propagation、客户端 resumption token、HTTP/2 RST_STREAM 三件套为主轴,给出从协议层到监控层的完整工程范式。

    • #AI 原生架构
    2026.08.29
  • 09

    LLM 推理 FP8 工程 2026:从 GEMM 到 scaling 校准

    把 FP8 落地拆成 GEMM kernel 选型、权重激活 KV cache 三路独立 scale 决策、在线 calibration、灰度发布四个工程环节,通过精度-吞吐-显存三角的统一视角,推演出推理服务的可执行清单与已知踩坑。

    • #AI 原生架构
    2026.08.28
  • 10

    LLM 推理异构硬件调度工程 2026:从拓扑路由到在线凸优化的统一框架

    把异构硬件调度建模成局部实时决策加全局慢速反馈的在线凸优化问题,用拓扑感知路由器、KV 跨设备分配、动态批处理 split、全局纠偏四件套把调度延迟压进 50ms 预算,让 2026 年的推理平台在 H100、L40S 与国产 NPU 混部场景下拿到稳定 SLA。

    • #AI 原生架构
    2026.08.27
  • 11

    LLM Prefill/Decode 分离架构工程 2026

    把 Prefill 的算力密集型与 Decode 的访存密集型特征拆到不同 worker,经 KV cache over RDMA 跨节点传输,把 P99 TTFT 与 TPOT 同时压到单引擎极限之上——这是 2026 年 LLM serving 的核心架构升级,DistServe/Splitwise/Mooncake/vLLM/SGLang 各家路径详评。

    • #AI 原生架构
    2026.08.26
  • 12

    LLM 推理的 GPU 健康度管理与故障预测工程 2026

    把 ECC 错误率、XID 事件、NVLink 链路质量、SM 频率漂移、HBM 温度、功耗曲线六类硬件遥测统一进可观测性平台,用 SPC + BOCPD + Weibull AFT + 因果反演四层模型把 GPU 从被动替换转向主动退役,并与 K8s Device Plugin、Topology Manager、Inference Gateway 闭环,让单卡亚健康对线上延迟与吞吐的影响可量化、可预测、可缓解。

    • #AI 原生架构
    2026.08.24
  • 13

    LLM 网关与多模型路由的工程化 2026:从语义缓存到成本感知的统一架构

    把 LLM 网关视为接入、路由、缓存、审计四类决策面的统一协调器,把多模型路由抽象为成本/质量/延迟三维 Pareto 前沿上的在线选择,把语义缓存、prompt 模板版本化、跨供应商 schema 翻译、降级熔断、可观测性回放一并装进一个可横向扩展的代理层,2026 年生产级 AI 应用的稳定性与单位经济学都取决于这条网关是否足够厚实。

    • #AI 原生架构
    2026.08.23
  • 14

    LLM 推理的显存碎片化与 OOM 预测工程 2026:从被动驱逐到主动重分配

    把 KV Cache 显存压力分解为外部碎片率、内部碎片率、占用率三个独立维度,通过 LSTM 时序预测与 block 级主动驱逐,把 OOM 事故的预测窗口从 1.8 分钟提升到 4.2 分钟,把平均响应时间从 15 分钟压缩到 2 分钟以内——LLM 推理的 OOM 不是显存分配问题而是碎片化问题。

    • #AI 原生架构
    2026.08.21
  • 15

    GPU Kernel 调度:大模型推理的拐点 2026

    把 FlashAttention-3 的 warp specialization、Flash Decoding 的并行规约、CUDA Graph 的图捕获与 Persistent Kernel 的指令持久化串成一条主线,讲清 2026 年 LLM 推理服务从 batching 优化升级到 kernel 调度的工程拐点。

    • #AI 原生架构
    2026.08.20
  • 16

    LLM 推测解码的工程化 2026:从 Draft 到生产加速

    把 Draft 模型选型、Tree-Attention 并行验证、接受率动态校准、Prefix Cache 耦合、生产可观测性闭环与推理引擎生态集成串成一条流水线,让推测解码从论文加速比走向生产稳定加速比。

    • #AI 原生架构
    2026.08.19
  • 17

    LLM 推理的请求亲和性与 Prefix Cache 局部性调度工程 2026

    把 prefix cache 从单机内部缓存提升为分布式系统的 locality 张量——以会话键设计、worker 拓扑锚定、cold miss 成本模型三件套协同,把 LLM 推理服务从算得快推向算得起、可观测、可治理的生产闭环。

    • #AI 原生架构
    2026.08.18
  • 18

    LLM 推理的拓扑感知调度工程 2026

    在 H100/H200/Blackwell 这一代硬件上,把拓扑三元组(机内拓扑、网络拓扑、显存拓扑)作为调度的一等公民,通过 NVLink/NVSwitch 拓扑对齐、PCIe 边界回避、HBM3e 容量带宽拓扑三角协同,把被拓扑失配吞掉的 30% 算力释放出来。

    • #AI 原生架构
    2026.08.17
  • 19

    LLM 推理的碳感知调度工程 2026

    把电网碳强度作为可调度信号,把 token 级能耗作为成本分子,把延迟容忍度作为弹性信号,在时空二维网格上做联合优化,让每千 token 的 gCO₂ 降到 15-25% 的可执行闭环。

    • #AI 原生架构
    2026.08.16
  • 20

    LLM 推理服务的灾备与故障转移工程 2026

    把模型权重、KV cache、生成配置三类状态的可恢复性作为独立工程目标,通过四层切流架构与三类健康检查端点,把故障转移链路拆解到毫秒级可控粒度。

    • #AI 原生架构
    2026.08.15
  • ← 上一页1 / 5
    下一页 →