2026-09-07 · 推理原语:GPU 到 Token 路由的架构转移

来源:Primitives.ai Substack
URL:https://primitivesai.substack.com/p/inference-primitives-the-architecture
作者:Seth Hobson
发布时间:2026-03-28
标签:#推理架构 #disaggregated-serving #KV-cache #Dynamo #llm-d #NIXL

核心观点

disaggregated prefill/decode 架构已从论文进入生产。NVIDIA Dynamo 1.0 和 llm-d (CNCF Sandbox) 形成两条竞争路径,NIXL 作为共同传输层实现互通。KV cache 正成为一等公民,需跨 GPU HBM / CPU DRAM / SSD / 对象存储分层管理。

工程信号(高质量)

信号类型 是否有 详情
生产 trace 基准 23,000 请求,Qwen3-32B,8×H100,微软 AKS benchmark
量化性能提升 2-7× 吞吐,20× TTFT 改善
开源库采纳证据 NIXL 同时被 Dynamo + llm-d + vLLM + SGLang + LMCache 采纳
四级 KV 缓存分层 KVBM:GPU HBM / CPU DRAM / 本地 SSD / 对象存储
CNCF Sandbox 时间戳 llm-d 2026-03-24 入 Sandbox
真实 SLO 数据 TTFT SLO 约束下 request capacity 提升 2.25×

技术细节摘要

NVIDIA Dynamo 1.0 (Apache 2.0) - 定位:推理操作系统(inference OS) - 核心组件:KV-aware smart router、radix tree 全局块注册表、弹性扩缩容 - 语言:Rust + Python

llm-d (CNCF Sandbox) - 定位:Kubernetes 原生推理编排 - 核心:Gateway API Inference Extension (GAIE)· Endpoint Picker (EPP) sidecar · Workload Variant Autoscaler (WVA) - 生态:Red Hat / IBM / Google Cloud / CoreWeave / NVIDIA 联合背书

NIXL (NVIDIA Inference Transfer Library) - 设计目标:推理场景的动态扩展、实时负载均衡、自适应内存管理 - 传输支持:RDMA、GPU-Direct、zero-copy networking - 地位:事实上的推理数据传输标准

Tensormesh($4.5M seed) - 定位:分布式 KV cache 中间件,跨请求 tensor 复用 - 理念:KV cache 应成为"S3"一样的独立基础设施层

后续行动

  • [ ] 精读 llm-d GAIE 规范,评估 K8s 推理编排标准化趋势
  • [ ] 跟进 Tensormesh 开源进度(KV 缓存作为独立服务层)
  • [ ] 验证 Microsoft AKS benchmark 完整数据

Jay 工程实践筛选 · 2026-09-07 下午批次 · 不执行 GitHub 写入