工程实践筛选报告 · 2026-07-14 上午

实例:Jay 时间:2026-07-14 09:35 (Asia/Shanghai) 本次主题:推理架构演进 · P/D Disaggregation 生产落地 · KV Cache 系统综述 · H100 vLLM vs SGLang 实测对比


§一 · 候选条目汇总(10 条)

# 来源 标题 工程密度 Substack
1 ByteByteGo Blog A Guide to AI Inference Engineering ⭐⭐⭐⭐⭐
2 arXiv 2607.08057 A Survey on System-Aware KV Cache Optimization ⭐⭐⭐⭐⭐
3 AIMultiple LLM Inference Engines: vLLM vs LMDeploy vs SGLang (H100 实测) ⭐⭐⭐⭐
4 Spheron Blog Prefill-Decode Disaggregation on GPU Cloud (2026 Guide) ⭐⭐⭐⭐
5 HaoaiLab Disaggregated Inference: 18 Months Later (DistServe 团队回顾) ⭐⭐⭐⭐
6 NVIDIA TensorRT-LLM Blog Disaggregated Serving in TensorRT-LLM (2026-03) ⭐⭐⭐
7 SGLang GitHub Changelog 2026 新特性:GB200 NVL72 · DeepSeek-V4 Day-0 ⭐⭐⭐
8 ByteByteGo EP215 The Anatomy of an AI Agent (2026-05) ⭐⭐⭐
9 YottaLabs Best LLM Inference Engines 2026: vLLM vs SGLang vs TGI ⭐⭐⭐
10 AWS SageMaker Blog Disaggregated Prefill and Decode on SageMaker HyperPod ⭐⭐⭐

§二 · 高价值条目详细评估


🔴 条目 1 · ByteByteGo AI Inference Engineering Guide

  • 来源:https://blog.bytebytego.com/p/a-guide-to-ai-inference-engineering
  • 发布时间:2026-06-15
  • 核心观点
  • LLM 推理分为 Prefill(处理输入 prompt,生成首个 token 和 KV cache)和 Decode(自回归逐 token 生成)两个阶段;
  • Prefill 算力密集(FLOPS-bound),Decode 显存带宽密集(HBM-bandwidth-bound);
  • 条件式 Disaggregation(Conditional Disaggregation):短请求或已有 cache 的请求跳过 prefill 直接在 decode 节点运行,减少跨节点传输开销;
  • Prefix Caching:相同 system prompt 的请求共享 KV cache 前缀;但第一个 token 不同则缓存收益为零——这意味着 prompt 结构设计直接影响成本和延迟;
  • 建议将可变用户输入放在 prompt 靠后位置,共享内容靠前,以最大化 prefix caching 收益。
  • 工程价值:系统性梳理推理工程师必须掌握的核心概念,ByteByteGo 标志性的"一张图讲清楚"风格,适合作为团队内部培训材料。
  • 标签:推理工程 / Disaggregation / Prefix Caching / ByteByteGo
  • 可信度:高——ByteByteGo 是高影响力工程师社区 newsletter,2026-06-15 新发布
  • 后续行动:建议纳入推理工程主题页;可精读全文补充图表细节

🔴 条目 2 · arXiv 2607.08057:KV Cache 系统综述

  • 来源:https://arxiv.org/html/2607.08057
  • 发布时间:2026-07(arXiv)
  • 核心观点
  • 全面综述 System-Aware KV Cache Optimization(sKis),覆盖 80+ 篇相关工作;
  • 三轴分类法:① Temporal(时间/调度):执行顺序 + 调度策略;② Spatial(空间/放置):KV cache 的放置位置和迁移策略;③ Structural(结构/保留):KV cache 的表示方式和淘汰策略;
  • 现有综述多从算法角度出发,本文从系统行为角度重新组织,为工程落地提供可操作的分类框架;
  • 涵盖 PagedAttention、Continuous Batching、Prefix Caching、KV Cache Offloading、Quantization、Eviction 等核心技术的系统层面分析。
  • 工程价值:当前最完整的 KV cache 系统综述,为推理系统设计者提供统一术语框架;是理解 vLLM/SGLang 底层设计差异的参考文献。
  • 标签:KV Cache / 推理系统 / 综述 / arXiv / SOTA 分类
  • 可信度:高——arXiv 2026-07 近期工作,系统方向学术综述
  • 后续行动:建议精读第三章节(Taxonomy);补充到推理系统工程主题参考列表

🔴 条目 3 · AIMultiple H100 Benchmark:vLLM vs SGLang vs LMDeploy

  • 来源:https://aimultiple.com/inference-engines
  • 发布时间:2026(持续更新)
  • 核心数据
  • Llama 3.1 8B on H100 80GB,bf16,GPU 利用率 0.8
    • SGLang:16,215 tok/s
    • LMDeploy:16,132 tok/s
    • vLLM(FlashInfer 优化后):12,553 tok/s
  • SGLang + LMDeploy 领先 vLLM 约 29%
  • 即使 vLLM 使用与 SGLang 相同的 FlashInfer kernel,性能差距仍然显著;
  • 推测原因:SGLang 的 RadixAttention 实现更高效,减少了 KV cache 管理开销。
  • ByteByteGo/TECHSY 补充对比
  • vLLM 优势:最广泛硬件支持(NVIDIA + AMD + AWS Trainium)、最大社区(10,000+ 贡献者)、成熟的生产部署路径;
  • SGLang 优势:多轮对话、Structured Output、Prefix-heavy RAG pipeline;RadixAttention 自动跨请求复用 KV cache;
  • TGI:2025-12 被 Hugging Face 置于维护模式,推荐迁移至 vLLM 或 SGLang。
  • 工程价值:H100 是 2026 年最主流推理 GPU,8B 是最通用开源模型尺寸,该数据具有直接参考价值;两引擎差距显著但非绝对——vLLM 的生态优势在生产环境中往往超过原始性能差距。
  • 标签:推理引擎 / Benchmark / vLLM / SGLang / H100
  • 可信度:中高——AIMultiple 为付费研究报告,附具体测试配置;但测试仅为离线 batch,未覆盖在线服务真实负载
  • 后续行动:建议在推理引擎选型页补充该 benchmark;注意验证生产环境实际表现可能与离线测试有偏差

🟡 条目 4 · Spheron Blog:Prefill-Decode Disaggregation 2026 工程指南

  • 来源:https://www.spheron.network/blog/prefill-decode-disaggregation-gpu-cloud
  • 发布时间:2026
  • 核心观点
  • Prefill 节点选型:H100 SXM5、B200、B300(算力优先);关键指标 FP8 TFLOPS
  • Decode 节点选型:H200 SXM5(141GB HBM3e,带宽优先);关键指标 HBM 带宽(TB/s);A100 80GB SXM4 是小型模型成本优化选项
  • NIXL(NVIDIA Inference Xfer Library):2026 年 vLLM 和 NVIDIA Dynamo 的标准 KV cache 传输协议;支持 RDMA(InfiniBand/RoCE)实现亚毫秒级 KV cache 传输;回退方案为 TCP
  • vLLM v0.8+ (V1 Engine)NixlConnector原生支持 disaggregation;Prefill 实例作为 KV cache 生产者,Decode 实例作为消费者
  • SGLang:通过 Router API 支持 disaggregated serving;LMDeploy v0.12 通过 DLSlime 和 Mooncake 实现
  • 工程价值:具体的 GPU 选型建议和 NIXL 配置参考,适合 GPU 集群架构设计阶段。
  • 标签:Disaggregation / vLLM / SGLang / NIXL / GPU 选型
  • 可信度:中高——Spheron 为商业 GPU 云平台博客,内容与具体云服务绑定,参考时需交叉验证
  • 后续行动:建议与 AWS SageMaker HyperPod disaggregation 方案对照;评估 NIXL 与 llm-d 的互通性

🟡 条目 5 · HaoaiLab:Disaggregated Inference 18 个月回顾(DistServe 团队)

  • 来源:https://haoailab.com/blogs/distserve-retro
  • 发布时间:2026(DistServe 论文发表约 18 个月后)
  • 核心观点
  • DistServe(2024 年研究论文)提出的 P/D disaggregation 已成为生产推理系统的标准架构
  • 现已落地到:NVIDIA Dynamo、llm-d、Ray Serve LLM、SGLang、vLLM、LMCache、MoonCake;
  • NVIDIA Dynamo(GTC 2025 发布):最成熟的 datacenter-scale 开源 P/D disaggregation 框架;支持 TensorRT-LLM、vLLM、SGLang 作为后端;核心组件:Prefill Worker + Decode Worker + KV-aware Router + GPU Planner;
  • SGLang DeepSeek-R1 96 H100 实测(3 节点 prefill × 24 GPU + 9 节点 decode × 72 GPU):52.3k input TPS + 22.3k output TPS per node;
  • GB200 NVL72:与 H100 相比,prefill 吞吐提升 3.8x,decode 吞吐提升 4.8x;
  • vLLM + llm-d 0.3:32-way EP 达 2.2k tok/s 或 96-way EP 达 ~2.0k tok/s per H200 GPU(2025-10 数据)。
  • 工程价值:DistServe 作者亲述从学术研究到工业落地的完整路径,是 P/D disaggregation 演进历史的权威一手来源;GB200 NVL72 性能数据是 2026 年 GPU 升级决策的重要参考。
  • 标签:Disaggregation / DistServe / NVIDIA Dynamo / SGLang / GB200 / 历史回顾
  • 可信度:高——DistServe 原创团队亲笔,第一手经验报告
  • 后续行动:建议补充到推理架构演进时间线;与 NVIDIA 官方 TensorRT-LLM disaggregated serving 博客对照

🟡 条目 6 · ByteByteGo EP215:The Anatomy of an AI Agent

  • 来源:https://blog.bytebytego.com/p/ep215-the-anatomy-of-an-ai-agent
  • 发布时间:2026-05-16
  • 核心观点(Agent 四层解剖): 1. 规划(Planning):子目标分解、反思、self-correction 2. 工具使用(Tool Use):MCP、function calling、API 调用链 3. 记忆(Memory):短时 = context window;长时 = vector store / 文件 / knowledge base;窗口填满时 summarize 旧对话并前向传递摘要 4. 循环(Loop):以上三者协同循环直到给出最终答案
  • Guardrails(护栏):沙箱、human-in-the-loop、token 限制、输出验证、scope 限制—— autonomy 越强,护栏越重要
  • 关键工程洞察:最难的是 evaluation——Agent 能执行 plan、调用 tool、总结结果,但仍然可能优化错误的"done"定义;必须将判断外部化为 checks、tests、rubrics、budgets、constraints 和 human review points
  • 工程价值:与 Jay 2026-07-13 的 Substack AI agent stack 主题(#1335)存在重叠,但 ByteByteGo EP215 提供了更结构化的 Agent anatomy 分析,可作为该主题的补充深度阅读。
  • 标签:AI Agent / 系统设计 / ByteByteGo / Agent Anatomy
  • 可信度:高——ByteByteGo 高影响力工程社区内容
  • 后续行动:与 2026-07-13 Substack AI agent stack 草稿合并归档;重点关注"evaluation 难题"工程实践部分

§三 · 本次主题综合判断

核心主题:推理架构的工业化拆分——P/D Disaggregation 成为 2026 生产标配

背景:2024 年 DistServe 论文提出将 prefill 和 decode 分离到不同 GPU 池以匹配各自硬件需求(compute-bound vs memory-bandwidth-bound)。18 个月后,这一架构已成为所有主流推理引擎(vLLM、SGLang、TensorRT-LLM)和编排框架(NVIDIA Dynamo、llm-d)的内置能力。

2026-07 关键进展: - vLLM v0.8+ 通过 NixlConnector 原生支持 disaggregation - SGLang 在 GB200 NVL72 上实测 3.8x/4.8x 吞吐提升 - NVIDIA Dynamo 成为 P/D disaggregation 的标杆开源编排层 - NIXL 成为跨引擎 KV cache 传输的事实标准协议 - ByteByteGo 发布系统性推理工程指南,覆盖 disaggregation、prefix caching、continuous batching

与 Jay 历史草稿的关系: - 2026-07-13 15:06 数据库/云原生/推理草稿覆盖了向量数据库和云原生推理,但未深入 P/D disaggregation - 2026-07-13 18:15 KV cache 架构草稿(Raschka/modular harness)侧重学习笔记,未覆盖 disaggregation - 本次草稿与以上草稿互补,共同构成推理系统工程全景


§四 · 分类标签汇总

推理工程 / Disaggregation / P/D 分离 / vLLM / SGLang / NVIDIA Dynamo /
NIXL / KV Cache / Prefix Caching / ByteByteGo / arXiv 综述 / Benchmark /
H100 / GB200 / Continuous Batching / PagedAttention / RadixAttention /
推理引擎选型 / 生产部署 / 云原生推理

§五 · 建议写入路径

主草稿/shared/research-kb/inbox/jay/2026-07-14-0935-inference-disaggregation-kvcache-survey-h100-benchmarks.md

关联草稿(建议后续合并或交叉引用): - 2026-07-13-1500-engineering-filter-rag-eval-observability-jul2026.md → RAG 评测 × 推理引擎 - 2026-07-13-1506-database-backend-cloudnative-inference.md → 云原生推理 × 向量数据库 - 2026-07-13-1815-kvcache-architecture-raschka-modular-harness-selfplay.md → KV cache 架构(学习笔记)


§六 · 后续行动建议

优先级 行动 负责人 截止
ByteByteGo AI Inference Engineering Guide 全文精读,补充图表到推理工程主题页 Jay 2026-07-15
arXiv 2607.08057 三轴分类法(Temporal/Spatial/Structural)纳入推理系统参考列表 Jay 2026-07-16
对照 NVIDIA TensorRT-LLM disaggregated serving 官方博客(2026-03),验证 Spheron/NIXL 描述准确性 Jay 2026-07-17
SGLang GitHub changelog 2026-04(GB200 NVL72 25x 性能)详细分析独立归档 Jay 2026-07-17
CSDN 高价值推理部署文章筛选(vLLM/SGLang 生产实战) Jay 2026-07-18

本报告由 Jay 实例生成 · 2026-07-14 09:35 (Asia/Shanghai) · 禁止复制全文 · 仅供研究线索和技术洞察用途