2026-09-07 · 推理原语:GPU 到 Token 路由的架构转移
来源:Primitives.ai Substack
URL:https://primitivesai.substack.com/p/inference-primitives-the-architecture
作者:Seth Hobson
发布时间:2026-03-28
标签:#推理架构#disaggregated-serving#KV-cache#Dynamo#llm-d#NIXL
核心观点
disaggregated prefill/decode 架构已从论文进入生产。NVIDIA Dynamo 1.0 和 llm-d (CNCF Sandbox) 形成两条竞争路径,NIXL 作为共同传输层实现互通。KV cache 正成为一等公民,需跨 GPU HBM / CPU DRAM / SSD / 对象存储分层管理。
工程信号(高质量)
| 信号类型 | 是否有 | 详情 |
|---|---|---|
| 生产 trace 基准 | ✅ | 23,000 请求,Qwen3-32B,8×H100,微软 AKS benchmark |
| 量化性能提升 | ✅ | 2-7× 吞吐,20× TTFT 改善 |
| 开源库采纳证据 | ✅ | NIXL 同时被 Dynamo + llm-d + vLLM + SGLang + LMCache 采纳 |
| 四级 KV 缓存分层 | ✅ | KVBM:GPU HBM / CPU DRAM / 本地 SSD / 对象存储 |
| CNCF Sandbox 时间戳 | ✅ | llm-d 2026-03-24 入 Sandbox |
| 真实 SLO 数据 | ✅ | TTFT SLO 约束下 request capacity 提升 2.25× |
技术细节摘要
NVIDIA Dynamo 1.0 (Apache 2.0) - 定位:推理操作系统(inference OS) - 核心组件:KV-aware smart router、radix tree 全局块注册表、弹性扩缩容 - 语言:Rust + Python
llm-d (CNCF Sandbox) - 定位:Kubernetes 原生推理编排 - 核心:Gateway API Inference Extension (GAIE)· Endpoint Picker (EPP) sidecar · Workload Variant Autoscaler (WVA) - 生态:Red Hat / IBM / Google Cloud / CoreWeave / NVIDIA 联合背书
NIXL (NVIDIA Inference Transfer Library) - 设计目标:推理场景的动态扩展、实时负载均衡、自适应内存管理 - 传输支持:RDMA、GPU-Direct、zero-copy networking - 地位:事实上的推理数据传输标准
Tensormesh($4.5M seed) - 定位:分布式 KV cache 中间件,跨请求 tensor 复用 - 理念:KV cache 应成为"S3"一样的独立基础设施层
后续行动
- [ ] 精读 llm-d GAIE 规范,评估 K8s 推理编排标准化趋势
- [ ] 跟进 Tensormesh 开源进度(KV 缓存作为独立服务层)
- [ ] 验证 Microsoft AKS benchmark 完整数据
Jay 工程实践筛选 · 2026-09-07 下午批次 · 不执行 GitHub 写入