知识库草稿:Jay 工程筛选报告 · 2026-09-10 晚间(第3轮)
实例: Jay | 时间: 2026-09-10 19:50 (Asia/Shanghai) | 检索频次: 第3次/日
本次主题
工程筛选第2轮:推理引擎近期更新(vLLM Q3 Roadmap / v0.24 / DSpark) · SGLang Breakable CUDA Graph · Nexus Intra-GPU Disaggregation · PyTorch Conference vLLM Sessions · TGI 维护确认与迁移 · Agentic RAG 评估基准
一、vLLM Q3 2026 Roadmap 重点解析(GitHub Issue #48168)
来源: github.com/vllm-project/vllm/issues/48168
发布时间: 2026年8月(路线图发布)
链接: https://github.com/vllm-project/vllm/issues/48168
可信度: 极高 · vLLM 官方 Roadmap,核心维护者发布
分类标签: vLLM 推理引擎 Roadmap 生产部署 Model Runner V2
核心工程里程碑(Q3 2026)
SIG Core — 生产稳定性重点: - Model Runner V2(MRV2)迁移完成: 新 day-0 模型全部基于 MRV2,MRV1 废弃。MRV2 是 vLLM 内部执行引擎重构,对并发吞吐和调度稳定性有直接影响 - KV Cache Manager 重新设计: 当前生产环境 KV Cache 碎片化和 preemption 问题将得到系统性解决 - Rust Frontend 标记 production ready: tool-calling 体验从实验进入生产 - 冷启动时间优化: 对 serverless 场景和 burst traffic 直接利好 - Flat Model 迁移完成 top 20 架构: Flat Model 是 vLLM 内部对 attention 计算的统一抽象,迁移完成后新模型支持速度加快
SIG Agentic Workload(Q3 主攻方向): - Q2 已达到 TensorRT 级别 speed-of-light performance(top 模型) - Q3 聚焦:disaggregated serving 成熟、KV offloading 生产化、高交互性 premium tokens - Elastic Expert Parallelism: 运行时动态增减 worker,expert 跨 worker 重新分布,零中断扩缩容
vLLM-Omni(多模态/全双工): - JoyVL、MiniCPM-o 实时全双工模型 productionization - Cosmos3、Qwen3-Omni 优先优化 - Video streaming generation + FastVideo 集成
vLLM × RL 生态: - 新 SIG 成立,2026 Q3 开始运作
v0.24 Release 实际内容:
- Minimax M3 专门优化
- Wide EP(Expert Parallelism)改进
- sparse MLA 性能工作持续
- 新 watermark 参数: 缓解长输出 token decode 导致的频繁 preemption(生产环境 OOM 的常见原因)
- LLM Compressor 更新:DDP 多卡支持加速量化,新 converter abstraction 用于 checkpoint 格式转换
保留理由: vLLM 是 2026 年推理引擎默认选择,Q3 Roadmap 揭示了未来 3 个月的生产稳定性改进方向。MRV2 迁移和 KV Cache Manager 重新设计是内核级变化,对生产运营直接影响显著。
建议动作: 纳入「vLLM 生产运维」主题页;关注 v0.24 release notes 中的 watermark 参数用法。
二、SGLang Breakable CUDA Graph:2026-09-06 默认开启(Spheron Blog)
来源: spheron.network/blog/llm-inference-optimization-2026
发布时间: 2026年9月6日
链接: https://www.spheron.network/blog/llm-inference-optimization-2026
可信度: 高 · Spheron 技术博客,引用 SGLang 官方文档
分类标签: SGLang CUDA Graph GPU Kernel 性能优化 生产部署
核心工程内容
Breakable CUDA Graph 是什么: - CUDA Graph 将多个 GPU 操作合并为一个"graph"减少 kernel launch 开销 - 传统 CUDA Graph 问题:一旦 shape(batch size、sequence length)与 graph 不匹配,必须完全重新 capture,成本极高 - Breakable CUDA Graph: 支持在特定边界"break"graph,局部 re-capture 而非整体重建,大幅减少 dynamic batching 场景的 graph miss penalty
默认启用(2026年9月): - SGLang 已在 2026-09-06 将 breakable CUDA graph 设为默认,无需手动配置 - 效果:GPU 利用率提升,kernel launch overhead 降低,具体数值因 workload 而异
生产意义: - Agentic workloads(多轮对话、tool use)天然有高度可变的 sequence lengths,最受益 - 适合 SGLang 而非 vLLM 的场景:shared prefix 多(system prompt、tool definitions)、多轮对话 - 如果请求的 prefix 共享率高 → SGLang 显著优于 vLLM;如果 unique prompts 为主 → 两者差异在几个百分点
部署命令参考(SGLang 0.5.9 cu130):
docker run --gpus all --ipc=host -p 8000:8000 \
-e HUGGING_FACE_HUB_TOKEN=your_token_here \
lmsysorg/sglang:v0.5.9-cu130-runtime \
python -m sglang.launch_server \
--model-path meta-llama/Llama-3.3-70B-Instruct \
--quantization fp8 \
--context-length 8192 \
--mem-fraction-static 0.92 \
--host 0.0.0.0 --port 8000
保留理由: SGLang breakable CUDA graph 是 2026 年 9 月最新默认配置,对 agentic 场景有直接 GPU 成本降低。生产部署 SGLang 时无需额外配置,直接受益。
建议动作: 已默认开启;纳入「SGLang vs vLLM 选型」主题页;与 vLLM prefix caching 对比参考。
三、Nexus:Proactive Intra-GPU Disaggregation(arXiv 2507.06608v3)
来源: arxiv.org/html/2507.06608v3
可信度: 高 · 学术论文,有实现(vLLM extension)和生产规模评估
分类标签: Disaggregation GPU调度 TTFT vLLM LLM Serving 调度算法
核心工程数据
Nexus 是什么: - vLLM 的 drop-in extension,实现单 GPU 内 proactive prefill/decode disaggregation - 不需要双节点 RDMA 基础设施,单 GPU 内部署 - 关键创新:SPF(Shortest Processing Time first)调度 + 运行时动态 SM 资源重分配
Benchmark 数据(在 production-scale LLMs 和 traffic 上评估):
| 指标 | vs vLLM | vs SGLang | 备注 |
|---|---|---|---|
| 吞吐量 | 2.2× | 2× | |
| TTFT | 20× lower | 1.6× lower | 最显著改进 |
| TBT | 2.5× lower | 1.7× lower | |
| GPU 资源 | 50%(对比 disaggregated vLLM 双节点) | — | 半 GPU 资源 |
vs 其他系统: - vs FastServe(recomputation-based):Nexus 显著领先,FastServe 在负载下退化为 recomputation - vs vLLM co-scheduling:vLLM 受 intra-batch interference 影响,TTFT trailing Nexus 1.24×–1.48× - vs SGLang:Long Data Collections 和 Arxiv Workload 下接近 Nexus,Mixed Workload(高 prompt 多样性)落后
关键洞察: - FCFS 调度下,vLLM 和 SGLang 都有 head-of-line blocking 问题 - SGLang 通过 Radix Attention 和 runtime 优化缓解,但高多样性负载下仍落后 - Nexus 意义: 证明 intra-GPU PD disaggregation 在单节点就可行,不需要昂贵的 disaggregated 部署
保留理由: 2026 年最新 LLM serving 调度研究,20× TTFT 改进是迄今为止最激进的生产级数据。vLLM extension 形态意味着工程团队可以较低成本试用。
建议动作: 关注 Nexus 开源进度;可作为「推理调度算法」主题页的 2026 年最新数据点纳入。
四、PyTorch Conference NA 2026 — vLLM Sessions 核心摘要
来源: pytorch.org/blog/vllm-sessions-at-pytorch-conference-north-america-2026
发布时间: 2026年8月28日
链接: https://pytorch.org/blog/vllm-sessions-at-pytorch-conference-north-america-2026
可信度: 极高 · PyTorch Foundation 官方发布,vLLM 核心团队技术披露
分类标签: vLLM PyTorch 生产部署 生态 KV Cache Disaggregation
五个关键工程披露
1. KV Push(TTFT 改进): - disaggregated prefill/decode 下,KV Push 相比传统 KV pull/Push 模式,TTFT 改进显著 - 在 Nemotron 上测试,disaggregated prefill Pareto-dominates co-located serving(所有并发级别均更优) - 这意味着 disaggregation 不是"if needed"选项,而是系统性更优
2. LMCache 跨引擎统一 KV 缓存: - LMCache 将 prompt caching 扩展到 vLLM、SGLang、TensorRT-LLM 三引擎 - 连接存储系统:Mooncake、Redis、AWS S3 - 跨引擎 cache 是 2026 年 production stack 重要里程碑
3. Elastic Expert Parallelism(Runtime 动态扩缩容): - 运行时增减 worker,expert 跨 worker 重新分布,最小化服务中断 - 对 MoE 模型(Mixtral、DeepSeek-V3/Ghost)直接利好
4. IBM Tiered KV Cache Offloading(已合并上游): - 无外部依赖的 native tiered KV cache offloading 框架 - CPU 内存作为 universal transport hub - 对 AMD/非 NVIDIA 硬件的生产部署有意义
5. FlagOS + Arm CPU Stack: - vLLM + OpenVINO + Arm CPU,GPTOSS/Llama 吞吐量提升约 2× - 20+ AI chips 测试,FlagOS 推理性能提升 5–40% vs 原始 vendor adaptation - 非 NVIDIA 推理支持持续成熟
保留理由: PyTorch Conference 是 2026 下半年最重要的 vLLM 生态披露窗口,KV Push 和 LMCache 跨引擎是生产基础设施直接相关的内容。
建议动作: 纳入「vLLM 生态」主题页;关注 2026-10-20 PyTorch Conference NA 会议录像(Sessions 2026-10-20)。
五、TGI 维护确认与 vLLM/SGLang 迁移(Premiere Blog)
来源: blog.premai.io/llm-inference-servers-compared-vllm-vs-tgi-vs-sglang-vs-triton-2026
发布时间: 2026年
链接: https://blog.premai.io/llm-inference-servers-compared-vllm-vs-tgi-vs-sglang-vs-triton-2026
可信度: 高 · 技术对比博客,HuggingFace 官方迁移指南引用
分类标签: TGI vLLM SGLang 迁移 推理引擎 生产部署
关键事实确认
TGI 状态(截至 2026 年 9 月): - 2025年12月11日进入维护模式 - 仅接受 minor bug fix 和文档改进 PR,无新功能 - HuggingFace 官方推荐:新部署使用 vLLM 或 SGLang
vLLM vs SGLang vs Triton 2026 对比总结:
| 维度 | vLLM | SGLang | TensorRT-LLM |
|---|---|---|---|
| 冷启动 | ~62s(H100) | ~62s | 显著更慢 |
| 部署复杂度 | 单 Docker 命令 | 单 Docker 命令 | 需要编译 |
| 模型支持 | 最广(数百架构,MoE 多模态) | 较广 | 部分(NVIDIA only) |
| 硬件支持 | GPU/TPU 多厂商 | NVIDIA/AMD | NVIDIA only |
| 生产默认特性 | PagedAttention, continuous batching, prefix caching | RadixAttention, breakable CUDA graph | 编译优化 |
| 适合场景 | 通用默认、安全选择 | Prefix-heavy、agentic | 极致性能、NVIDIA |
TGI → vLLM 迁移路径: - HuggingFace 提供官方迁移指南 - vLLM OpenAI-compatible API 与 TGI API 高度兼容,迁移成本低
Fish Audio Blog 补充(2026): - TGI 维护模式后,Inference 市场三大开源引擎:vLLM、SGLang、MAX(Modular) - MAX:<700MB 容器(vs vLLM/SGLang 5-8GB),500+ HF 模型支持
保留理由: TGI 维护确认是 2026 年推理引擎格局的历史节点。所有仍在 TGI 上的团队需要制定迁移计划。
建议动作: 纳入「推理引擎选型」和「技术债务」主题页;未迁移团队应优先规划。
六、Agentic RAG 评估基准:RAGCap-Bench(arXiv 2510.13910v2)
来源: arxiv.org/html/2510.13910v2
可信度: 高 · 学术论文,有 benchmark 设计和实验数据
分类标签: RAG Agentic RAG 评估基准 Agent 质量工程
核心内容
RAGCap-Bench 设计动机: - 现有 agentic RAG benchmark 只测 end-to-end QA(多跳问答),不提供组件级细粒度反馈 - 实际工程改进需要知道:planning 哪里错、retrieval 哪步差、reasoning 什么失败
评估维度(fine-grained capabilities): 1. Planning / Query Decomposition 2. Retrieval / Document Selection 3. Reasoning / Answer Synthesis 4. Error Recovery / Self-Correction
关键发现: - "slow-thinking" 模型(更强的 reasoning能力)在 RAGCap-Bench 得分更高,下游任务性能更好 - RAGCap-Bench 分数与下游任务性能有相关性 → 可作为代理指标 - 现有 agentic RAG 系统在 intermediate process 上普遍存在错误累积问题
与生产评估的关系: - Ragas + Phoenix + Langfuse 是 2026 年生产 RAG evaluation 事实标准栈 - 离线 benchmark 不能替代生产监控(见 SyncSoft AI 数据:90% enterprise agentic RAG 项目在生产中失败)
保留理由: RAGCap-Bench 是 2026 年 agentic RAG 评估领域的重要新基准,对构建系统化 RAG 评估 pipeline 有参考价值。
建议动作: 纳入「RAG 评估」主题页;关注 benchmark 工具开源。
七、综合筛选结论
🔴 强烈推荐精读(高工程价值 + 新鲜数据)
| 条目 | 理由 | 来源类型 |
|---|---|---|
| vLLM Q3 Roadmap | MRV2/KV Cache Manager 重构直接影响生产稳定性;Elastic EP 是扩缩容关键 | 官方 GitHub |
| Nexus Intra-GPU Disaggregation | 20× TTFT 改进;vLLM extension 形态可用;单 GPU 即可部署 | arXiv 学术 |
| PyTorch Conf vLLM Sessions | KV Push + LMCache 跨引擎是 2026 下半年基础设施关键 | PyTorch 官方 |
| SGLang Breakable CUDA Graph | 2026-09-06 默认开启,GPU 成本直接降低 | 技术博客 |
🟡 推荐纳入主题页更新
| 条目 | 建议纳入主题页 |
|---|---|
| TGI 维护确认 + 迁移指南 | 推理引擎选型 / 技术债务 |
| v0.24 watermark 参数 | vLLM 生产运维 |
| RAGCap-Bench | RAG 评估 |
| Fish Audio 2026 引擎对比 | 推理引擎选型 |
🟢 可归档(有价值但本次优先级低)
| 条目 | 原因 |
|---|---|
| DSpark speculative decoding | 尚未 release,仅在 nightly;纳入监控但不紧急 |
| vLLM-Omni video generation | 多模态方向,非核心推理工程本次优先级 |
| MAX 容器大小优势 | 700MB 优势需对比功能完整性,尚未成熟 |
八、与上轮(2026-09-10 14:50)的去重说明
本次发现的上轮未覆盖内容: - vLLM Q3 Roadmap(路线图,上轮无) - Nexus Intra-GPU Disaggregation(arXiv 新论文,上轮 KV-Cache 论文无此调度数据) - SGLang Breakable CUDA Graph Sep 2026 默认(上轮仅覆盖 general vLLM/SGLang 对比) - PyTorch Conference vLLM Sessions(上轮无) - TGI 维护确认(上轮推理引擎对比有泛化内容,无 TGI 维护节点确认) - RAGCap-Bench(上轮有 general RAG 评估,无 agentic RAG 细粒度基准)
本次未重复的内容: - CUDA Python 1.0(上轮已完整覆盖) - Mooncake / llm-d(上轮已覆盖) - Inference Stack Ch4(上轮已覆盖) - AI Agents Stack 2026(上轮已覆盖 Substack 部分)
Jay · 2026-09-10 19:50 · 工程筛选第2轮 · 第3次/日