Jay 下午简报 · 2026-09-12 · Inference Engine 深度更新

主题

推理引擎·Agentic 推理·分布式推理·Inference Engineering — 第 3 次/天(下午场)

背景说明

本场聚焦上午/午后简报未覆盖的推理引擎增量信息: - vLLM 生产部署成熟度(v0.20.2 / Kubernetes 生产栈) - SGLang v0.5.19 Sep 更新(10+ 新模型、Beam Search 上线) - NVIDIA Dynamo 1.0 正式发布(取代 Triton,成为 Agentic 推理标配) - SGLang × TPU / GB300 / DeepSeek 生产集成新记录 - Breakable CUDA Graph 成为默认(v0.5.15),GPU 开销进一步压缩


🔴 高价值条目

1. NVIDIA Dynamo 1.0 — 推理操作系统正式进入生产

来源: NVIDIA 新闻稿 + 技术博客 | 2026 年 GTC

核心观点: - Dynamo 1.0 是 NVIDIA 开源推理框架的正式生产版本,定位为 Triton Inference Server 的继任者 - 核心设计目标:分布式推理、多节点扩展、KV-Cache 感知的请求路由与智能调度 - 支持 SGLang、TensorRT-LLM、vLLM 作为后端引擎,Dynamo 作为编排层 - KV-aware Router + KV Cache Manager:实现 up to 4× lower TTFT(Time to First Token)和 1.5× higher throughput - ModelExpress:大 MoE 模型(如 DeepSeek V3) checkpoint 恢复和权重流式加载加速 up to (结合 NVIDIA NIXL 和 NVLink) - 与 NVIDIA NeMo Agent Toolkit 深度集成,形成 Agentic 推理完整工具链 - 已在全球云服务商、AI 创新企业和大型企业广泛采用

关键时间线: - 2025-05:NVIDIA 首次发布 Dynamo(低延迟分布式推理框架) - 2026-03:Dynamo 1.0 发布,多节点扩展进入生产 - 2026-09:正式取代 Triton 成为 NVIDIA 推荐的推理编排层

评价: Dynamo 1.0 的意义在于将 SGLang/vLLM/TensorRT-LLM 等引擎统一在同一个分布式调度框架下,解决了 Agentic 推理多轮对话、跨节点 KV-Cache 复用、长链路延迟优化等工程难题。对于需要大规模部署 Agent 的团队,Dynamo + SGLang/vLLM 是 2026Q4 的标准参考架构。

链接: - https://developer.nvidia.com/blog/nvidia-dynamo-1-production-ready - https://developer.nvidia.com/dynamo - https://forums.developer.nvidia.gov/t/full-stack-optimizations-for-agentic-inference-with-nvidia-dynamo/366930

后续行动: 建议关注 Dynamo 的 Kubernetes 集成文档和 AWS/GCP/阿里云上的参考部署模板;对已在用 Triton 的团队,Dynamo 是明确的迁移方向。


来源: SGLang GitHub + X (@sgl_project) | 2026-09-08

核心更新: - 新增模型支持:Qwen3.8 和 Qwen3.8-27B、Granite 4.2、Spark2.5、LongCat-Image-Edit(SGLang-Diffusion)、Ling-3.0-flash / Ling-3.0-tiny、dots3.note 等 - Beam Search 正式上线(里程碑功能) - 总计 786 个 PR,来自 214 位 contributors,51 位新贡献者 - SGLang 生态持续高速增长

v0.5.15(2026-07-02 合并,July 2026)历史背景: - Breakable CUDA Graph(BCG)成为默认 prefill 计算后端 - BCG 构建速度比 torch.compile piecewise backend 快 3.8–5.2× - BCG 重放速度比 piecewise backend 快 17% - 对 GPU 利用率和延迟有直接可测量的收益

v0.4 版本参考(SGLang 重大升级): - Zero-Overhead Batch Scheduler:吞吐量 +1.1× - Cache-Aware Load Balancer:吞吐量 +1.9×,缓存命中率 +3.8× - Data Parallelism for DeepSeek:解码吞吐量 +1.9× - xgrammar 加速 JSON Decoding:速度提升 10×

评价: SGLang 的更新节奏非常快(每月都有显著功能),v0.5.19 的 Beam Search 是生成质量工程的关键里程碑。RadixAttention + BCG + Cache-Aware Load Balancer 的组合是其相比 vLLM 在 Agentic 场景保持优势的核心技术护城河。

链接: - https://github.com/sgl-project/sglang/releases - https://x.com/sgl_project/status/1962497847393280000(SGLang v0.5.19 公告)


3. vLLM v0.20.2(May 2026)— 生产部署成熟度确认

来源: SitePoint / VRLA Tech / Lyceum / Spheron | 2026年4-7月

核心观点(综合多个来源): - v0.20.2(截至 2026-05)为当前稳定版本,生产默认配置逐渐标准化 - paged attention + continuous batching 仍是 vLLM 的核心架构优势 - 生产推荐硬件:NVIDIA RTX PRO 6000 Blackwell(96GB ECC GDDR7,带宽 1.8 TB/s) - 多 GPU 推荐配置:4× RTX PRO 6000 → 384GB 联合显存,聚合带宽 7.2 TB/s - 生产默认参数参考(Spheron 指南): bash --dtype auto \ --gpu-memory-utilization 0.90 \ --enable-prefix-caching \ --port 8000 - Prefill-Decode Disaggregation(预填充与解码分离):vLLM 韩国 Meetup 2026 重点议题,用 AMD MORI-IO 在 8-GPU MI300X 节点上实现 Prefill/Decode 分离传输 KV cache,稳定 ITL 并提升 goodput - vLLM V1 重架构:新调度器(process-split V1 loop)、近零开销 prefix caching、更清晰的 tensor parallelism、多进程 API server - vLLM Production Stack:官方 Kubernetes Helm Chart(helm install vllm vllm/vllm-stack),生产就绪

评价: vLLM 的优势在于广泛的硬件支持和成熟的 Kubernetes 生态。对于需要多云部署、AMD GPU、或需要 Triton 兼容性的团队,vLLM 仍是生产首选。其与 Dynamo 的集成支持意味着两者不是替代关系而是互补。

链接: - https://vllm.ai/blog(vLLM 官方博客,涵盖 V1 重架构和 Meetup 2026 总结) - https://www.spheron.network/blog/vllm-production-deployment-2026 - https://docs.vllm.ai/en/latest/deployment/integrations/production-stack


4. SGLang × TPU — RadixArk and Google 合作

来源: SGLang GitHub | 2026-07

核心观点: - RadixArk 和 Google 合作,将 SGLang 完整功能移植到 TPU 上 - 这是 SGLang 首次官方支持非 NVIDIA 硬件生态 - 对 Google Cloud TPU 用户有直接影响,SGLang 的 RadixAttention 和前端 API 在 TPU 上可用

链接: - https://github.com/sgl-project/sglang(2026/07 博客记录)


5. Miles — SGLang 原生后训练框架

来源: SGLang GitHub + RadixArk | 2026-09

核心观点: - Miles 是基于 SGLang 构建的生产级后训练框架 - SGLang 是其原生 rollout engine,直接将高吞吐生成接入 post-training 循环 - 完整技术报告已发布,涵盖生产级后训练的系统设计、稳定性和灵活性 - SGLang Day 2026(Sep 9)重点推广

链接: - https://github.com/sgl-project/sglang(Miles 技术报告链接)


6. SGLang DeepSeek 集成新高 — GLM5.2 NVFP4 达到 500 TPS

来源: SGLang GitHub | 2026-07

核心观点: - SGLang + GLM5.2 NVFP4 生产级部署,两周内达到 500 TPS - NVFP4(4-bit NV原生格式)是 2026 年重要的量化格式方向 - 速度收益来自 SGLang 的 DeepSeek 特定优化(MLA 加速后端)

链接: - https://github.com/sgl-project/sglang(2026/07 博客)


7. SGLang + NVIDIA GB300 — 25× 推理加速

来源: SGLang GitHub | 2026-02

核心观点: - 在 NVIDIA GB300 NVL72 机架级系统上,SGLang 实现 25× 推理加速(对比基线) - 这是 SGLang 在超大规模 GPU 集群上的性能证明

链接: - https://github.com/sgl-project/sglang(2026/02 博客)


🟡 中等价值条目

8. vLLM vs SGLang vs LMDeploy 2026 基准对照

来源: PremAI / Atomic.Chat / JarvisLabs | 2026年4-8月

关键数据(SGLang vs vLLM on H100): | 指标 | SGLang | vLLM | 差异 | |------|--------|------|------| | 吞吐量(H100)| ~16,200 tokens/s | ~12,500 tokens/s | +29% | | TTFT(单请求)| ~42 ms | ~45 ms | 接近 | | TTFT(100并发)| ~710 ms | ~740 ms | 接近 | | DeepSeek V3 | 3.1× faster | 基线 | SGLang 显著优势 |

选型建议(综合多个来源): - 选 SGLang:共享前缀多的 Agent 场景(多轮对话、工具调用、RAG 管道)、需要 xgrammar 强制结构化输出、AMD GPU、DeepSeek 模型 - 选 vLLM:硬件多样性需求、多云部署、需要广泛的 Triton 生态兼容、bursty 流量模式 - 选 TensorRT-LLM:超低延迟关键场景(实时交易、语音)、HGX H100 超算环境、FP8 编译优化

来源: - https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 - https://atomic.chat/blog/llm-updates/sglang-vs-vllm - https://jarvislabs.ai/blog/vllm-sglang-trtllm-comparison


9. Dynamo Day 2026 — 16 场 Inference 深度技术 Sessions

来源: LinkedIn(NVIDIA Dynamo Day)| 2026年9月

核心内容: - NVIDIA Dynamo Day 2026 发布 16 场 Session,涵盖推理优化全栈 - 关键主题:Thinking Model 硬件-软件协同设计、Dynamo 架构详解、KV Cache 优化、多模态推理扩展 - 核心议题:AI 工作负载在 2026 年变得更长(longer-running)、更多 Agentic(迭代式)、更多工具调用,对底层基础设施的结构性影响 - GPU 短缺是表面现象,真正问题是碎片化:不同型号 GPU、不同框架、不同部署位置造成的资源利用率低下

链接: - https://www.linkedin.com/posts/vsadhwani_nvidia-just-dropped-16-sessions-focused-entirely-activity-7423199234746707968-eLcI


🟢 CSDN 增量(下午场)

本次下午场未执行独立 CSDN 爬取,建议参考 2026-09-12-T0820 和 2026-09-12-csdn-rag-agent-mlops.md 中的 CSDN 筛选结果。


📌 分类标签

Inference-Engineering SGLang vLLM TensorRT-LLM NVIDIA-Dynamo Distributed-Inference KV-Cache Prefill-Decode-Disaggregation TPU GB300 DeepSeek Quantization NVFP4 Beam-Search Breakable-CUDA-Graph Agentic-Inference Production-Stack


📁 建议写入路径

/shared/research-kb/inbox/jay/2026-09-12T1505-jay-afternoon-briefing-inference-dynamo-sglang-vllm.md


✅ 是否需要精读/审稿/主题页更新

  • 精读:NVIDIA Dynamo 1.0 官方技术博客(含 KV-aware Router 实测数据);SGLang v0.5.19 Release Notes
  • 主题页更新
  • Inference Engineering 页面:更新 Dynamo 1.0 状态(正式生产,取代 Triton)、SGLang v0.5.19 新功能(Beam Search 上线、10+ 新模型)
  • Agentic Inference 页面:Dynamo + NeMo Agent Toolkit 整合、KV-aware routing 4× TTFT 改善
  • 对比页更新vLLM vs SGLang vs TensorRT-LLM 选型决策树(加入 Dynamo 作为编排层选项)

Jay · 2026-09-12T15:05 CST · 下午场 · 共 9 条候选条目 · 未执行 GitHub 写入