Jay · 知识库简报 · 2026-07-02 午间补档(第三次)
📋 任务元信息
- 实例:Jay
- 时间:2026-07-02 11:05 (Asia/Shanghai)
- 检索范围:Tavily · arXiv · RedHat Developer Blog · NVIDIA Research Blog
- 分类标签:
inference·kvcache·backend·cloud-native·database - 本次主题:推理系统工程专项——vLLM/SGLang 生产对比 · KV Cache 压缩工程陷阱 · PD 调度前沿研究 · 分布式推理部署模式
🔬 一、推理引擎 vLLM vs SGLang 生产对比(本轮新增深度数据)
1.1 Spheron 2026 H100 Benchmark(⭐⭐⭐⭐⭐ 本轮最高工程价值)
来源:Spheron: vLLM vs SGLang vs TensorRT-LLM 2026 可信度:⭐⭐⭐⭐⭐(具体硬件规格 + 版本号 + 开箱即用数据) 核心数据:
RadixAttention(SGLang)前缀缓存命中率:
| 前缀长度 | 缓存命中率 | TTFT 降低(c=1) |
|---|---|---|
| 256 tokens | ~75% | ~18% |
| 512 tokens | ~82% | ~26% |
| 1,024 tokens | ~88% | ~35% |
| 2,048 tokens | ~92% | ~42% |
Llama 3.3 70B FP8 H100 唯一提示词吞吐(无前缀共享): - SGLang 略微领先(2-5%),但差距在生产可接受范围内
多轮对话实测(RunPod,高并发压力下): - SGLang:~30-31 tok/s 稳定 - vLLM:从 22 tok/s 降至 16 tok/s(缓存压力增大导致性能衰减)
关键结论: - SGLang 胜出场景:多轮对话、RAG(prefix-heavy)、共享系统提示词场景 - vLLM 胜出场景:模板化批量推理(prompt 模板固定)、独特 prompt 为主的工作负载 - 两者均可作为 TGI 替代:Hugging Face Inference Endpoints 现已默认 vLLM,SGLang 为备选 - TGI 已于 2025 年 12 月进入维护模式
架构差异对比:
| 特性 | vLLM (PagedAttention) | SGLang (RadixAttention) |
|---|---|---|
| KV 缓存分配 | 固定大小块,按需分配 | Radix 前缀树,请求间共享 |
| 前缀复用 | APC(需 opt-in,平坦前缀) | RadixAttention(默认激活,任意前缀边界) |
| 多轮效率 | 无 APC 时每轮重算历史 | 跨轮累积 KV 缓存 |
| 监控 | /metrics Prometheus |
/metrics 含 sglang_cache_hit_rate |
工程建议:前缀重叠 > 60% 选 SGLang;< 60% 选 vLLM。OpenAI 兼容 API 使切换成本低。
是否需精读:✅ 生产部署选型必备数据,建议归档 inference/ 主题页
1.2 TECHSY vLLM vs SGLang 2026(⭐⭐⭐⭐ 补充视角)
来源:TECHSY: vLLM vs SGLang 2026 核心观点: - 选 vLLM:硬件支持最广、社区最大、生产路径最成熟(AWS/GCP/Azure) - 选 SGLang:多轮对话、结构化输出、prefix-heavy 管道(如 RAG);生态较小 - Llama 3.1 8B H100 吞吐:vLLM ~12,500 tok/s;SGLang ~16,200 tok/s(SGLang 领先 ~30%) - Speculative decoding:vLLM 的 EAGLE3/EAGLE2 与 MRv2 集成成熟;SGLang 支持仍为实验性 结论:两者均已 production-ready,差异主要在 workload 特征匹配度 是否需精读:⚠️ 补充视角,快速浏览即可
🧠 二、KV Cache 压缩工程陷阱(⭐⭐⭐⭐⭐ 本轮最高研究价值)
2.1 NVIDIA Research Blog:KV Cache 压缩的两大基础设施冲突(⭐⭐⭐⭐⭐ 必读)
来源:KV Cache Compression and Its Infra Problems(NVIDIA EAI Blog) 可信度:⭐⭐⭐⭐⭐(NVIDIA 官方研究,工程视角权威) 发布时间:2026 年(新鲜)
核心观点:
冲突一:历史注意力分数从不存在于 GPU 内存 - 现有压缩方法(H2O、StreamingLLM、SnapKV、R-KV 等)都需要历史注意力分数来决定保留哪些 token - 但 FlashAttention 内核从不将注意力分数写入 GPU 内存——这是个系统设计层面的根本矛盾 - 只有 StreamingLLM 的 fixed sink-plus-recency 规则不需要注意力分数
冲突二:逐出后 GPU 内存实际无法回收 - vLLM 等生产系统用 paged attention 管理 KV cache:GPU 内存分为固定大小块(每块约 16 token) - 一个块只有完全为空时才能被释放 - 假设 16,000 token 中逐出 14,400 个,幸存者会分散在约 1,000 个块中——几乎每个块都至少保留 1 个 token,allocator 几乎什么都回收不了 - R-KV 报告 90% 内存节省,但那是在预分配连续内存(非生产 paged attention 条件)下测量的
NVIDIA 的出路:几何表征代替注意力分数 - 提出问题重构:不是"哪些 token 最近收到了高注意力",而是"模型学到的表征空间几何是否预测 token 重要性" - TriAttention 是基于此问题的实现,不依赖历史注意力分数 - 评价:这是 2026 年 KV cache 压缩从"学术有效"走向"生产可用"的关键突破点
技术洞察评价:
这篇文章是本轮研究最高价值。它揭示了一个根本性的 Research-Practice Gap:学术论文在连续内存假设下验证的 KV 压缩方法,在实际 paged attention 生产系统中根本无法工作。这是 2026 年 inference systems 领域最重要的工程洞察之一。
是否需精读:✅ 必读,建议归档 inference/kvcache/ 子类,与 arXiv 1.2(Tangram)配合理解完整图景
2.2 TurboQuant:AMD ROCm 生产级 KV Cache 压缩(⭐⭐⭐⭐ 高工程价值)
来源:Productionizing TurboQuant on AMD GPUs for KV-Cache-Bound LLM Inference(AMD ROCm Blog) 可信度:⭐⭐⭐⭐⭐(AMD 官方 ROCm 团队,生产级验证) 核心观点: - TurboQuant(TQ):结构化 rotation + 小型固定 codebook,将 KV cache 压缩到 4/3/2 bit,精度损失极小 - TQ4/4(K-bits/V-bits 均为 4):生产推荐配置,精度/压缩/性能平衡最佳 - 适用场景:KV-cache-bound 而非 compute-bound 的场景——长上下文、多轮 Agentic 工作负载 - AMD 生产验证了在 vLLM 中的可行性,解决了 kernel 级别优化问题
工程价值:高。为 ROCm/AMD GPU 用户提供了生产可用的 KV 压缩方案
建议分类:inference · kvcache · backend
是否需精读:✅ 有 AMD/ROCm 部署需求者可精读
2.3 Tangram:非均匀 KV Cache 压缩框架(arXiv 2606.06302v2)(⭐⭐⭐⭐)
来源:Tangram: Unlocking Non-Uniform KV Cache Compression for Efficient Multi-turn LLM Serving 可信度:⭐⭐⭐⭐(arXiv 论文,工程系统贡献) 核心观点: - 问题:非均匀压缩(不同 attention head 分配不同预算)在理论上精度更好,但实际不可行——现代 serving stack 假设所有 head 的 KV 长度相同 - 异构性陷阱:压缩后内存碎片化 → 25% prefill 时间浪费在页回收 → decode latency 膨胀 1.7× - Tangram 解决方案: 1. Budget Reservation:调度时固定每个 head 的压缩后占用,消除页回收 2. Ragged Paging:将相似预算的 head 聚类到独立页表,将碎片转化为可回收内存 3. Ahead-of-Time Load Balancing:预计算均衡 GPU 分区,零运行时规划开销
技术洞察评价:
Tangram 与 NVIDIA Blog 2.1 形成互补:NVIDIA 指出了"生产 KV 压缩的两大基础设施冲突",Tangram 提供了针对"非均匀压缩"这个具体场景的工程解决路径。
是否需精读:✅ inference systems 高价值论文,建议归档 inference/kvcache/ 子类
2.4 LMCache:KV Cache 管理抽象层(⭐⭐⭐ 高工具价值)
来源:LMCache - PyPI
核心观点:
- LMCache 将 KV cache 从临时状态转化为可复用的 AI-native 知识
- 提供跨请求的 KV 缓存复用抽象,与 vLLM/SGLang 集成
工程价值:中。有助于工程团队标准化 KV cache 复用逻辑
建议分类:inference · backend
📐 三、PD 调度与分布式推理系统(新增前沿研究)
3.1 Tail-Aware Scheduling for LLM Inference(arXiv 2606.18431)(⭐⭐⭐⭐⭐ 本轮最高算法价值)
来源:Beyond Prediction: Tail-Aware Scheduling for LLM Inference 可信度:⭐⭐⭐⭐⭐(arXiv,有完整算法和评估) 核心观点: - 问题:现有 LLM 调度系统依赖 decode-length prediction(SRPT/SJF 变体),但预测驱动的策略在分布漂移、突发到达、GPU 内存压力下脆弱 - 即便拥有完美的 decode-length 知识,对 P90-P99 尾延迟控制仍然有限 - 解决方案:Tail-Aware Scheduling,无需精确预测即可优化尾延迟 - 评估结果:相比完美长度预测的 SRPT,P99 TTLT 低 35-50%;TTFT 低 34-47%,覆盖 reasoning-heavy 和 chat-heavy 任务 - 意义:首个不需要精确长度预测的生产可用尾延迟优化算法
工程价值:高。为高并发 LLM 服务的 SLA 保障提供了新范式
是否需精读:✅ 调度系统高优先级论文,建议归档 inference/scheduling/ 子类
3.2 Prefill/Decode 异构推理设计空间(arXiv 2606.29708v2)(⭐⭐⭐⭐ 高系统价值)
来源:Demystifying the Design Space and Best Practices for Heterogeneous LLM Inference and Serving 可信度:⭐⭐⭐⭐(arXiv,四轴设计空间,系统化分析) 核心观点: - 四轴设计空间:accelerator / precision / interconnect / KV residency - 三个关键边界决策:compute placement(计算放置)/ KV representation(KV 表示)/ KV ownership(KV 归属) - 核心洞察:精度策略属于运行时角色而非全局设置——低比特格式在不同边界侧缓解的瓶颈不同 - 单请求路径:可能在加速器 A 上 prefill,在加速器 B 上 decode,通过独立通信基板传输,KV 状态驻留在 GPU 内存之外
工程价值:高。为 2026 年 PD disaggregation 生产部署提供了系统性决策框架
是否需精读:✅ 分布式推理架构设计必备,建议归档 inference/ 和 cloud-native/ 子类
3.3 HBM Is Not All You Need:MemHA 异构加速器 Serving(arXiv 2606.29986v1)(⭐⭐⭐⭐)
来源:HBM Is Not All You Need: Efficient Disaggregated LLM Serving across Memory-heterogeneous Accelerators 可信度:⭐⭐⭐⭐(arXiv,HMA-Serve 系统论文) 核心观点: - MemHA 场景:GDDR 加速器做 prefill + HBM GPU 做 decode(成本最优组合) - HMA-Serve 三项技术: 1. 阶段化量化:prefill 用 vendor-native 低精度(高吞吐),decode 保持 BF16 高精度 2. 计算-传输流水线:将每层 KV cache 传输与后续层 prefill 重叠,降低 TTFT 3. Lazy KV transfer:按需在 decode GPU 上懒加载,降低网络带宽和 HBM 使用 - 结果:3.2× 更高 goodput,4.8× 更高 goodput-per-dollar,无精度损失
工程价值:中高。为跨 vendor 异构硬件部署提供了成本优化路径
建议分类:inference · cloud-native
是否需精读:⚠️ 关注 MemHA 架构但资源受限团队可先浏览
3.4 RedHat Developer:分布式 AI 推理高级部署模式(⭐⭐⭐⭐⭐ 本轮最高生产工程价值)
来源:Optimizing distributed AI inference: Advanced deployment patterns(RedHat Developer Blog,2026-06-24) 作者:Fatih E. Nar · Yuchen Fama · Greg Pereira · Yuan Tang 可信度:⭐⭐⭐⭐⭐(RedHat 官方工程团队,2026-06-24 新鲜发布) 发布时间:2026-06-24(近一周)
核心观点:
① PD Disaggregation 决策规则 - Prefill:compute-bound,计算密集 - Decode:memory-bound,内存带宽敏感 - 典型配比:1:3 到 1:5(prefill:decode workers,chat 工作负载) - 何时值得 disaggregation:长上下文 + 高并发 + 多租户场景
② Decode 内核生态(vLLM 2026) - FlashMLA(DeepSeek) - ThunderMLA(Stanford) - PyTorch FlexAttention decode path - 平台团队通常不直接调优内核,但了解内核版本有助于版本升级后排查 decode 回归
③ disaggregated KV cache pool 生产关注点 - KV-transfer fabric 按生产数据路径处理:测量端到端延迟,告警尾延迟而非均值,验证每节点 RDMA 驱动健康 - NIXL 异步 send/receive:需要 prefill worker 不阻塞 decode 端确认才能用于生产
④ Speculative Decoding 2026 状态 - vLLM:EAGLE3 和 EAGLE2 与 MRv2 成熟集成 - SGLang:支持仍为实验性
技术洞察评价:
RedHat 这篇文章是 2026 年分布式推理工程领域最实用的生产指南。"将 KV-transfer fabric 视为生产数据路径"这一工程思维,以及 disaggregation 的决策规则,对实际部署有直接指导价值。
是否需精读:✅ 分布式推理生产部署必备,建议归档 inference/ 和 cloud-native/ 主题页
3.5 Prefill/Decode Aware Evaluation on Emerging AI Accelerators(arXiv 2606.17104v1)(⭐⭐⭐⭐)
来源:Prefill/Decode-Aware Evaluation of LLM Inference on Emerging AI Accelerators(HPAI4S'26, IEEE IPDPS 2026) 可信度:⭐⭐⭐⭐(IEEE 会议论文,有系统化 benchmark) 核心观点: - Llama2-7B 在 GPU vs 新兴 AI 加速器上的 PD 分解评测 - GPU 在 Prefill 阶段一致领先(compute-intensive) - GroqRack 在 Decode 阶段显著更低的 TPOT(但不支持 batching) - 异构 PD disaggregation 的性能和网络条件分析
建议分类:inference · backend
是否需精读:⚠️ benchmark 参考价值,快速浏览即可
🗄️ 四、数据库系统前沿(LLM+Graphs / Responsible Data Systems)
4.1 LLMs+Graphs: Toward Graph-Native Synergistic AI Systems(arXiv 2606.11560v1)(⭐⭐⭐⭐)
来源:LLMs+Graphs: Toward Graph‑Native, Synergistic AI Systems
可信度:⭐⭐⭐⭐(arXiv,Tutorial/Survey,SIGKDD 方向)
核心观点:
- 三大互补协同:① LLM 增强图检索和推理 ② 双向 KG集成(LLM 建 KG,KG 约束 LLM)③ 图算法增强 Agent(规划/决策/多跳推理)
- 这是教程类论文,覆盖 LLMs + 图数据管理 + 图挖掘 + Agent 的完整框架
- 对 GraphRAG 工程实现有分类索引价值
建议分类:database · rag · agent
是否需精读:✅ GraphRAG 架构设计参考,可归档 database/graphrag/ 子类
4.2 RAIDS: Responsible Intelligent Data Systems(arXiv 2606.21831v1)(⭐⭐⭐)
来源:RAIDS: Rethinking Data Systems as Responsible Intelligent Infrastructure
可信度:⭐⭐⭐(arXiv,vision paper,AI+Data Systems 新兴方向)
核心观点:
- 提出 data system 作为 responsible intelligent infrastructure 的愿景
- 核心抽象:operator-level responsibility contract(输出 + support/constraint/actionability state)
- 组织目标:responsibility preservation(执行过程中责任状态保持充分)
- BlueSky 研究议程:负责任执行、感知优化、血统、监督、评估
建议分类:database
是否需精读:⚠️ 方向性论文,AI governance 相关者快速浏览
4.3 SurrealDB:Context Layer + Semantic Layer + Knowledge Graph 统一架构(⭐⭐⭐⭐ 高数据库工程价值)
来源:Context layers, semantic layers, and knowledge graphs: the modern data architecture for AI
核心观点:
- Context Layer:在数据系统和 AI 模型之间,检索相关事实/文档/图遍历,封装进 prompt
- Semantic Layer:持久化语义 schema,对 tool-use agent 查询数据库至关重要
- Knowledge Graph:传统 KG 不是为 operational AI layer 设计(sub-ms 上下文组装、实时图遍历、agent memory 读写同会话)
- SurrealDB 的多模型架构:一个系统同时构建三种层,无需拼接专家系统
工程价值:中高。为 AI-native 数据库架构提供了统一视图
建议分类:database · agent
是否需精读:⚠️ 架构参考,了解数据库演进方向
📝 五、本轮综合洞察
5.1 核心趋势:推理系统工程进入"生产精度"时代
| 方向 | 代表工作 | 核心信息 |
|---|---|---|
| KV Cache 压缩工程陷阱 | NVIDIA Blog (2.1) + Tangram (2.3) | 学术有效 ≠ 生产可用;两大基础设施冲突是核心瓶颈 |
| PD 调度新范式 | Tail-Aware Scheduling (3.1) | 脱离精确长度预测的尾延迟优化,35-50% P99 改善 |
| 异构 PD 生产化 | arXiv 2606.29708 (3.2) + MemHA (3.3) + RedHat (3.4) | 四轴设计空间 + cross-vendor disaggregation + goodput-per-dollar 优化 |
| 推理引擎选型 | Spheron benchmark (1.1) + TECHSY (1.2) | SGLang 多轮/RAG 领先;vLLM 批量/独特 prompt 领先;差距 2-30% |
| 数据库+AI 融合 | LLMs+Graphs (4.1) + SurrealDB (4.3) | 图数据管理演进为 graph-native AI 系统 |
5.2 技术路线优先级建议(2026 H2 推理系统)
推理系统工程优先级:
① vLLM/SGLang 选型:先测 prefix overlap ratio(>60% 选 SGLang)
② PD disaggregation:确认 KV-transfer fabric 成本和网络条件
③ 尾延迟优化:评估 Tail-Aware Scheduling 而非依赖长度预测
④ KV 压缩:关注 TriAttention 等不依赖注意力分数的新方法(NVIDIA 路线)
⑤ 异构硬件:GDDR prefill + HBM decode 的 MemHA 路径值得关注
📦 六、建议写入路径
| 分类 | 文件路径 | 优先级 | 关联本轮条目 |
|---|---|---|---|
inference |
/shared/research-kb/inbox/jay/2026-07-02-inference-kvcache-pd-scheduling.md |
⭐⭐⭐⭐⭐ 高 | 1.1 · 1.2 · 2.1 · 2.2 · 2.3 · 3.1 · 3.2 · 3.3 · 3.4 |
backend |
/shared/research-kb/inbox/jay/2026-07-02-backend-inference-systems-vllm-sglang-pd.md |
高 | 1.1 · 1.2 · 3.4 |
cloud-native |
/shared/research-kb/inbox/jay/2026-07-02-cloudnative-distributed-inference-pd-disaggregation.md |
高 | 3.2 · 3.3 · 3.4 |
database |
/shared/research-kb/inbox/jay/2026-07-02-database-llms-graphs-surrealdb-2026.md |
中 | 4.1 · 4.3 |
✅ 精读/审稿/主题页更新建议
建议精读(4篇): 1. NVIDIA KV Cache Compression Blog (2.1) → inference/kvcache 主题页核心参考文献,揭示生产 KV 压缩两大工程冲突 2. Tail-Aware Scheduling (arXiv 2606.18431, 3.1) → inference/scheduling 主题页,无预测尾延迟优化 3. RedHat Distributed Inference (3.4) → cloud-native/inference 主题页,PD disaggregation 生产部署指南 4. Spheron vLLM vs SGLang Benchmark (1.1) → inference 主题页,选型数据锚点
建议审稿(2篇):
- Tangram (2.3) → inference/kvcache/ 子类,与 NVIDIA 2.1 配合归档
- HMA-Serve (3.3) → cloud-native/ 子类,异构加速器路径
主题页更新建议:
- inference/ 主题页:新增"KV 压缩工程陷阱"章节(2.1)+ "vLLM vs SGLang 2026 选型决策树"(1.1)
- inference/kvcache/ 子类:新建,整合 Tangram + TurboQuant + NVIDIA Blog
- cloud-native/ 主题页:新增"PD Disaggregation 生产部署检查清单"(3.4)
📚 参考文献
- Spheron Network: "vLLM vs SGLang 2026: RadixAttention vs PagedAttention Benchmarks" https://www.spheron.network/blog/vllm-vs-sglang-2026
- TECHSY: "vLLM vs SGLang 2026: H100 Benchmarks Inside" https://techsy.io/en/blog/vllm-vs-sglang
- NVIDIA EAI Blog: "KV Cache Compression and Its Infra Problems" https://research.nvidia.com/labs/eai/blogs/kv-cache-compression-and-its-infra-problems
- AMD ROCm Blog: "Productionizing TurboQuant on AMD GPUs" https://rocm.blogs.amd.com/artificial-intelligence/turboquant-vllm-agentic/README.html
- arXiv 2606.06302v2: "Tangram: Non-Uniform KV Cache Compression" https://arxiv.org/html/2606.06302v2
- arXiv 2606.18431: "Tail-Aware Scheduling for LLM Inference" https://arxiv.org/pdf/2606.18431
- arXiv 2606.29708v2: "Heterogeneous LLM Inference Design Space" https://arxiv.org/html/2606.29708v2
- arXiv 2606.29986v1: "HBM Is Not All You Need (MemHA)" https://arxiv.org/html/2606.29986v1
- RedHat Developer: "Optimizing distributed AI inference" https://developers.redhat.com/articles/2026/06/24/optimizing-distributed-ai-inference-advanced-deployment-patterns
- arXiv 2606.17104v1: "Prefill/Decode-Aware Evaluation" https://arxiv.org/html/2606.17104v1
- arXiv 2606.11560v1: "LLMs+Graphs: Graph-Native Synergistic AI" https://arxiv.org/html/2606.11560v1
- arXiv 2606.21831v1: "RAIDS: Responsible Intelligent Data Systems" https://arxiv.org/html/2606.21831v1
- SurrealDB: "Context Layers, Semantic Layers, Knowledge Graphs" https://surrealdb.com/blog/context-layers-semantic-layers-and-knowledge-graphs-the-modern-data-architecture-for-ai
Jay · 知识库简报 · 2026-07-02 11:05 (Asia/Shanghai) 本次覆盖:Tavily × 4,arXiv × 6,RedHat × 1,NVIDIA Research × 1,AMD ROCm × 1 去重覆盖:上午档(08:20)已覆盖 LangGraph/HERA/GraphRAG;本档聚焦推理系统工程补全