inference · E1 预消化简报(2026-08-17)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:2026-08-16 22:20 → 2026-08-17 22:20(约 24h)
基线活文档: organized/knowledge/inference.md(2026-08-17 版 · vLLM 0.27+DFlash+MRV2/Decode CP/SGLang 0.6/PD正反案例/Nexus+Not All Prefills/Salesforce 3.9x/MCP stateless/NVIDIA Dynamo/A100 DeployBase/H100 Benchmark/KV Cache Transform Coding/Queueing-Theoretic/RMM/25K TPS on GB200/WASI-NN)
本棒性质: inference 主题 E1 日间预消化轮(24h 窗口);邻接 8-16 E1 棒(6条)之后,专注 8-16→8-17 新增;不重写活文档,只列近 24h 新硬增量供今晚活文档接力决策参考
状态
- 增量条数: 7 条主线(含 2 条首度锚入 inference 主题;邻接 5 条)
- 显著新增: 有——OpScale + vToken 双首度锚入 + vLLM 0.27 Breaking Changes + vLLM 25K TPS 跨硬件升级,整体密度高于 8-16 E1 棒
- 本棒说明: Aug 16→17 窗口 inference 核心增量来自 jay 全天主力棒(jay 工程/e1prep/evening-briefing/synthesis)和 spark llm-infra-e1prep 双源汇流;paper_cards 近 3 天新卡 0 张主分类 inference;邻接来源(jay llm-infra/agent/csdN/spark llm-infra)贡献 5 条工程补丁;本棒聚焦 inference 专属新发现
- 涉及 arXiv 号: 2 件净增(2608.13499 OpScale / 2608.13263 vToken);沿用 8 件(2608.13426 RMM / 2604.25724 Salesforce / 2507.06608 Nexus / 2603.13358 Not All Prefills / 2511.01815 KV Cache Transform Coding / 2605.04595 Queueing-Theoretic / 2603.20397 KV Cache Survey / 2602.08005 DeltaKV)
一、最重要的 7 条增量
增量 1【推理调度 · §1.2 + §1.12】🔴 OpScale: Operator-Level Autoscaling for LLM Serving —— 算子级弹性扩缩容首度锚入 ★★★
来源: inbox/jay/2026-08-17T1455-jay-engineering-filter-arxiv-agentic-infra.md(✅保留1) + inbox/jay/2026-08-17T1505-jay-afternoon-synthesis-briefing.md(Backend #11) + inbox/spark/2026-08-17-llm-infra-e1prep.md(增量1)
URL: https://arxiv.org/abs/2608.13499
arXiv: 2608.13499(MSRA · Xingqi Cui, Chieh-Jan Mike Liang 等 · 2026-08-13 · paper_cards 尚未建档 · 建议本周内建卡)
要点: - 核心问题: 整个模型作为单一扩缩单元无法捕捉 prefill(计算密集) vs decode(内存密集)的异构动态;静态为峰值配置资源成本浪费 - OpScale 解法: 运营商级(operator-level)编排——对 attention / MLP / embedding 等不同算子做细粒度 profiling,识别算子级弹性(operator-level elasticity)作为可行扩缩原语 - 四层架构: Profiling → Provisioning → Placement → Runtime Serving - 核心工程数据(Azure LLM inference cluster + Mooncake LLM serving platform, 40×A100 和 24×GB200 验证):满足 SLOs 同时成本降低 36.3%(相比模型级粗粒度扩缩容) - 决策树: SLO 敏感场景(TTFT < X ms)?→ 需要 operator-level provisioning → OpScale 路线;成本优化优先且 workload 稳定?→ 模型级扩缩容 + Spot 实例混部(SageServe 路线,arXiv:2502.14617:25% GPU 小时节省)
警示: - OpScale arXiv ID 来源为 jay afternoon synthesis,paper_cards 尚未建档,需 arXiv 官方检索确认完整作者列表与 Mooncake/Azure trace 数据真实性 - MSRA 数据未公开完整 Azure/Mooncake trace 拓扑细节,需独立核验 - 36.3% 成本降低是在 SLO 达标的同时;若 SLO 容忍度更高,降本空间可能更大
与活文档现有脉络的关系: - inference.md 8-17 版 §1.2 推理调度已有 Nexus(单 GPU 主动 PD 2.2×/20×/2.5×) + Not All Prefills(多轮 Agent 失效) + DCP 8×B200 + llm-d CNCF v0.7(EPD 分解) - 本棒 = OpScale 算子级扩缩容首度锚入(无任何 prior 算子级弹性扩缩容描述);与 PD Disaggregation 的区别:PD 是架构级分离(prefill/decode 分机器),OpScale 是算子级弹性(attention/MLP/embedding 分别 profiling 并分别扩缩);OpScale 是 PD Disaggregation 的下一层细化 - 与 NVIDIA Dynamo 1.0 的关系: Dynamo 是引擎之上的编排层,OpScale 是 serving layer 的弹性扩缩原语层——两者互补,Dynamo 管多引擎协调,OpScale 管算子级资源分配
建议归入节: §1.2 推理调度新增 OpScale 算子级弹性扩缩容子节(与 PD Disaggregation 正反案例并列 → PD Disaggregation=架构级分离,OpScale=算子级弹性);§1.12 Pipeline 邻接新增(OpScale 四层架构:Profiling→Provisioning→Placement→Runtime Serving)
增量 2【KV-Cache 内存管理 · §1.3 + §1.12】🔴 vToken: Token-Level Virtualization for Reclaimable KV Caches —— GPU 内存 token 级虚拟化回收首度锚入 ★★★
来源: inbox/jay/2026-08-17T1455-jay-engineering-filter-arxiv-agentic-infra.md(✅保留3) + inbox/jay/2026-08-17T1505-jay-afternoon-synthesis-briefing.md(Backend #13) + inbox/spark/2026-08-17-llm-infra-e1prep.md(增量2)
URL: https://arxiv.org/abs/2608.13263
arXiv: 2608.13263(2026-08-13 · paper_cards 尚未建档 · 建议本周内建卡,主分类应为 llm-infra/inference)
要点: - 核心机制: PagedAttention 已解决 block 级碎片,vToken 进一步在 token 级做 KV cache 虚拟化和回收;解决长序列下"有效 token" vs "无效 KV cache"的 mismatch 问题 - 与现有 KV Cache 优化技术的关系(完整 5 层技术栈): - vLLM PagedAttention: 固定大小内存块,减少分配级碎片(block 级) - vLLM CAAE(Context-Aware Adaptive Eviction): 跨层级 / NVMe offloading(系统级) - ICMSP/NIXL(CES 2026 NVIDIA): BlueField-4 DPU 卸载 I/O(硬件级)——见增量 3 - MemoryAlloy(Crusoe AI 2026-03): cluster-scale LRU+LFU 自适应驱逐(集群级)——见增量 4 - vToken arXiv:2608.13263: GPU 内存内部 token 级虚拟化回收(细粒度级) - 技术栈层次: block 级(PagedAttention) → 细粒度 token 级(vToken) → 系统级(CAAE) → 硬件级(ICMSP) → 集群级(MemoryAlloy)
警示: - vToken arXiv ID 已确认(2026-08-13),但 paper_cards 尚未建档 - "Token 级回收"机制与 vLLM PagedAttention 的兼容边界需源码核验
与活文档现有脉络的关系: - inference.md 8-17 版 §1.3 KV-Cache 已有 C2KV KDD 2026(跨请求复用)/KV Cache Transform Coding ICLR 2026/Queueing-Theoretic ICML 2026/GPUYard 公式(Llama 2 70B 32K=10.74GB)/PagedAttention 碎片 60-80%→<4% - 本棒 = vToken GPU 内存 token 级虚拟化回收首度锚入(之前 §1.3 已有 block 级/系统级/硬件级/集群级 KV Cache 优化,细粒度 token 级回收是全新粒度);vToken 是 8-17 版 KV Cache 技术栈的最细粒度新增,与其他 4 层构成完整体系
建议归入节: §1.3 KV-Cache 新增 vToken token 级虚拟化子节(补全 KV Cache 5 层技术栈:Block→Token→系统级→硬件级→集群级);§1.12 Pipeline 邻接(KV Pool 细粒度回收层)
增量 3【vLLM 版本治理 · §1.1 + §1.11】🔴 vLLM 0.27 Breaking Changes(C++20 + Transformers v5 + CUDA 13)——版本治理首次成为独立维度 ★★★
来源: inbox/jay/2026-08-17T1145-jay-engineering-filter.md(✅保留2) + inbox/jay/2026-08-17T1000-jay-vllm-august-2026-engineering-deep-dive.md(条目1) + inbox/spark/2026-08-17-llm-infra-e1prep.md(增量3)
URL: https://github.com/vllm-project/vllm/releases/tag/v0.27.0
arXiv: 无(GitHub 官方 release notes · 2026-07-27 · 561 commits)
要点: - v0.27.0 关键 Breaking Changes(2026-07-27 · 561 commits):
| 变更 | 类型 | 工程影响 |
|---|---|---|
| C++20 编译要求 | Breaking | 编译环境需 GCC 11+;CI 编译流水线需升级 toolchain |
| Transformers v4 正式废弃 | Breaking | 需迁移至 Transformers v5;import 可能断裂;已有代码需逐一检查 |
| CUDA 13.0 wheels → PyTorch manylinux_2_28 | 优化 | 基础镜像变更;现有 Docker 镜像需重建 |
| DeepGEMM per-Python wheel | 优化 | CPython 兼容性提升;无需从源码编译 |
| fastsafetensors ParallelLoader | 新功能 | 权重加载加速;模型启动时间缩短 |
| UMA GPU 显存压力释放 | Bugfix | AMD 用户受益 |
| numactl --membind 阻塞时优雅降级 | Bugfix | HPC 环境稳定性提升 |
| 镜像 provenance metadata 嵌入 | 安全 | 供应链可审计 |
- v0.22-v0.27 版本时间线(关键里程碑):
- v0.27.0(Jul 27):C++20 + Transformers v5,561 commits
- v0.26.0(Jul 14/25):Inkling 支持 + DeepSeek-V4 优化 + fp32 generation heads + 灵活 attention backends + KV offloading tiered storage
- v0.23.0(Jun 12):DeepSeek-V4 hardening + Model Runner V2 扩展 + Rust 前端流式 + Gemma 4 + Transformers v5 兼容
- v0.22.0(May 15):DeepSeek V4 fused kernels + CUDA graphs + Rust 前端 + multi-tier KV offloading
- v0.19.0(2026-04-03 沿用 §IX 47):FP8 + KV cache · Model Runner V2
警示: - Transformers v5 强制迁移是当前生产环境最紧迫的 Breaking Change;具体哪些 API 在 v5 中被移除/变更尚需逐一核实;建议生产团队在 staging 环境先验证 import 链完整性再升级 - C++20 要求影响所有自编译 vLLM 的团队,CI 流水线升级不可绕过
与活文档现有脉络的关系: - inference.md 8-17 版 §1.1 推理引擎已有 vLLM MRV2/PagedAttention/Crash rate 三档/推测解码/vLLM 原生 transformers 后端(450+ 架构) - 本棒 = vLLM 版本治理首次成为独立维度(之前 vLLM 内容按 feature/版本号分散,本棒将 0.22-0.27 版本时间线与 Breaking Changes 清单整合为"版本治理"维度);Transformers v5 迁移警告是生产团队升级决策的关键输入
建议归入节: §1.1 推理引擎新增 vLLM 版本治理子节(v0.22-v0.27 时间线 + Breaking Changes 清单 + Transformers v5 迁移警告);§1.11 推理优化算法邻接(版本治理是推理工程学科化的核心事件)
增量 4【推理引擎性能 · §1.1】🔴 vLLM 25K TPS/GPU on GB200 NVL72(Qwen3.5-397B-A17B NVFP4)——跨硬件性能新标杆 ★★★
来源: inbox/jay/2026-08-17T1000-jay-vllm-august-2026-engineering-deep-dive.md(条目1) + inbox/spark/2026-08-17-llm-infra-e1prep.md(增量8)
URL: https://vllm-project.github.io/blog/vllm-25k-tps-gpu-qwen3.5/
arXiv: 无(vLLM 官方工程报告)
要点: - 核心数据: GB200 NVL72 分解式服务架构下达成 25K total TPS/GPU(Qwen3.5-397B-A17B · NVFP4 精度) - 关键技术栈: Blackwell GDN kernels + HMA cache transfer + async scheduling fixes + srt-slurm recipes - 工程意义: 突破 GPU 利用率瓶颈的工程路线图,具体到 kernel 级别优化和调度修复,可作为生产级部署调优参考
警示: - 25K TPS/GPU 是 vLLM 自家 GB200 NVL72 报告的官方数字(非第三方 benchmark) - NVFP4 精度是 Blackwell 原生支持的低精度格式,与 H100/A100 的 FP8 精度路径不同
与活文档现有脉络的关系: - inference.md 8-17 版 §1.1 推理引擎已有 Spheron H100 Benchmark(TensorRT-LLM 2100/SGLang 1920/vLLM 1850) + DeployBase A100 Benchmark - 本棒 = GB200 NVL72 跨硬件性能新标杆首度锚入(之前最顶级数据为 H100 16,200 tok/s SGLang 和 A100 4,500 tok/s TensorRT-LLM);25K TPS/GPU 是 GB200 NVL72 平台专属数字,与 H100/A100 不可跨平台直接比较,但方向上确认了 Blackwell 架构的推理性能领先优势
建议归入节: §1.1 推理引擎新增 GB200 NVL72 Benchmark 子节(25K TPS/GPU NVFP4 Qwen3.5-397B + 关键技术栈:Blackwell GDN kernels + HMA + async scheduling)
增量 5【推理引擎生态 · §1.1 + §1.2】🟠 Decode Context Parallelism + Speculative Decoding 全链路 + FP8 KV-Cache vLLM 8月工程五件套 ★★
来源: inbox/jay/2026-08-17T1000-jay-vllm-august-2026-engineering-deep-dive.md(条目2-7) + inbox/spark/2026-08-17-llm-infra-e1prep.md(增量4-5)
URLs:
- https://vllm-project.github.io/blog/decode-context-parallelism/(2026-08-07)
- https://vllm-project.github.io/blog/speculative-decoding/(2026-07-27)
- https://vllm-project.github.io/blog/state-of-fp8-kv-cache/(2026-04/持续)
- https://vllm-project.github.io/blog/eagle3-amd-quark/(2026-07-10)
- https://vllm-project.github.io/blog/semantic-router-v0.1-iris/(2026-01/持续)
arXiv: 无(全部 vLLM 官方工程博客)
要点: - Decode Context Parallelism(2026-08-07): 128K+ token 超长上下文场景下,Decode 阶段内部并行化新方案;将 context 分解并行处理以降低长序列下的 decode 延迟;与 PD Disaggregation 的区别:PD 是 Prefill 和 Decode 分开调度,Decode CP 是在 Decode 阶段内部做并行 - Speculative Decoding 全链路(2026-07-27): Beyond Single-Token Generation,从单 token 生成跃迁到多 token 并行;不是简单的多步生成,而是验证+回退的完整机制 - FP8 KV-Cache + Attention Quantization(2026-04/持续): Hopper 和 Blackwell 双平台验证;Flash Attention 3 fixes 已并入;支持 skip certain layers 的选择性量化 - EAGLE3 AMD Instinct(2026-07-10): EAGLE3 + AMD Quark + vLLM 完整推理链路,训练和 serving 一体化方案 - vLLM Semantic Router v0.1 Iris(2026-01/持续): Beyond a Single Model;MoE(Mixture-of-Models)系统构建;第一个正式 Release 版本
与活文档现有脉络的关系: - inference.md 8-17 版 §1.1 推理引擎已有 vLLM 0.27 / MRV2 /推测解码 - 本棒 = Decode CP 是 Decode 阶段内部并行化首次锚入(vLLM Conference 2026 @ Ray Summit 确认路线图:向 1000+ TPS 的 speculative decoding);Speculative Decoding 全链路是 vLLM 官方对 EAGLE-3 等推测解码方法的工程化总结;FP8 KV-Cache 是量化经济学邻接
建议归入节: §1.1 推理引擎新增 Decode Context Parallelism 子节(长上下文 Decode 阶段内部并行,标注与 vLLM DCP 命名区分);§1.2 推理调度邻接新增 Speculative Decoding 全链路(推测解码工程化路径)
邻接 A【KV-Cache 工程 · §1.3】🟠 ICMSP/NIXL — CES 2026 NVIDIA BlueField-4 DPU + KV Offloading Tiered Storage ★★
来源: inbox/jay/2026-08-17T1145-jay-engineering-filter.md(✅保留4) + inbox/jay/2026-08-17T1950-jay-engineering-filter.md
URL: https://www.spheron.network/blog/nvme-kv-cache-offloading-llm-inference(Spheron 工程博客 · CES 2026 NVIDIA 架构发布)
arXiv: 无(NVIDIA CES 2026 官方架构发布;Spheron 工程博客整理)
要点: - 1M token 上下文下的显存容量约束(CES 2026 官方数据):
| GPU | HBM | KV cache (128K, BF16) 每用户 | 100% 显存用户数 |
|---|---|---|---|
| H100 SXM5 | 80 GB | ~40 GB | 1-2(含权重压缩) |
| B200 SXM6 | 192 GB | ~40 GB | ~3(FP8 权重 ~70 GB + 3×40 GB KV) |
- ICMSP 架构核心组件:
- BlueField-4 DPUs: 管理 KV cache 在 HBM/NVMe/DRAM 间的移动;GPU SM 不参与 I/O 等待,消除 host round-trip 瓶颈
- NIXL(NVIDIA Inference Xfer Library): KV block 传输协议,支持 NVLink / InfiniBand RDMA / PCIe / TCP 四种传输介质,透明选择最优路径
- VAST Data 实测: all-NVMe 存储 prefill time 提速约 10×
警示: - BlueField-4 DPU 可用性阶段待核——CES 2026 发布意味着仍在规划/早期部署阶段,生产级稳定性需以官方 GA 日期为准
建议归入节: §1.3 KV-Cache 新增 ICMSP/NIXL 硬件级传输子节(BlueField-4 DPU + NIXL 四介质协议 + 10× prefill 加速);§1.12 Pipeline 邻接(KV Pool 硬件卸载层)
邻接 B【KV-Cache 集群管理 · §1.3】🟠 MemoryAlloy — Crusoe AI Cluster-Scale 自适应 KV Cache Eviction(9.9× prefill 加速) ★★
来源: inbox/jay/2026-08-17T1145-jay-engineering-filter.md(✅保留5) + inbox/spark/2026-08-17-llm-infra-e1prep.md(增量7)
URL: https://www.crusoe.ai/resources/blog/crusoe-memoryalloy-reinventing-kv-caching-for-cluster-scale-inference
arXiv: 无(Crusoe AI 工程博客 · 2026-03-18)
要点: - 核心问题: 分布式多节点推理中,KV cache 在集群级别的全局驱逐策略 - 全局驱逐管理器: 跨节点追踪 usage patterns,维护全局缓存一致性 - 自适应驱逐策略: LRU + LFU 自适应混合——热门上下文常驻 HBM,冷门 KV segment 回收至 NVMe/DRAM - 目标收益: 9.9× prefill 加速(cluster-scale 实测)
警示: - 9.9× prefill 加速的测试条件来自 Crusoe 博客,测试拓扑(节点数/网络配置/GPU 型号)未明确;该数字不能直接外推到其他集群配置
建议归入节: §1.3 KV-Cache 新增 MemoryAlloy 集群级 LRU+LFU 自适应驱逐子节(与 CAAE 单实例动态驱逐形成对比:单实例 vs 集群级)
邻接 C【推理引擎选型 · §1.1】🟠 H100 引擎 Benchmark 更新:SGLang ~16,200 tok/s 领先 vLLM ~29% ★★
来源: inbox/jay/2026-08-17T2105-jay-evening-five-category-briefing.md(Backend §2) + inbox/spark/2026-08-17-llm-infra-e1prep.md(邻接5)
URLs:
- https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026
- https://www.yottalabs.ai/post/best-llm-inference-engines-in-2026-vllm-tensorrt-llm-tgi-and-sglang-compared
- https://www.spheron.network/blog/vllm-vs-sglang-2026
要点: - 吞吐量对比(H100):
| 引擎 | H100 吞吐 | 备注 |
|---|---|---|
| SGLang | ~16,200 tok/s | 多轮对话最优,Prefix Cache 命中率 75–95% |
| LMDeploy | ~16,200 tok/s | 量化模型部署首选 |
| vLLM | ~12,500 tok/s | 落后约 29%,但生态最成熟 |
- 前缀缓存命中率实测:
- Few-shot 共享示例:85–95%(vs PagedAttention 15–25%)
- 多轮聊天:75–90%(vs 10–20%)
- 代码分析:60–80%(vs 5–15%)
- 当前版本(LeetLLM, 2026-08-13): SGLang v1.2.1 / TensorRT-LLM v1.3.0rc24 / Ollama b10375
警示: - ~16,200 tok/s 是 PremAI Blog 等第三方综合数据,与 Spheron H100 实测(1,920 tok/s SGLang)存在量级差异,可能因测试条件(batch/sequence length)不同;本棒数据作为"PremAI 等第三方 2026-08 综合横评"方向参考,绝对数字需独立核验
建议归入节: §1.1 推理引擎 Benchmark 表格新增 PremAI 2026-08 H100 列(标注测试条件差异);§1.1 新增 SGLang RadixAttention 前缀缓存命中率量化数据(75-95%)
邻接 D【推理框架实测 · §1.1 + §1.3】🟡 SGLang CUDA Graph 气泡分析 + FlashInfer 版本兼容排障 ★★
来源: inbox/jay/2026-08-17T1220-jay-csdn-inference-quantization-agent-2026.md(条目1-2)
URLs:
- https://blog.csdn.net/gitblog_00554/article/details/151436503
- https://blog.csdn.net/gitblog_00885/article/details/151437102
要点:
- SGLang CUDA Graph 解码阶段性能优化(源码级): Qwen2.5-32B-Instruct + CUDA Graph,每轮图重放前有约 2ms GPU 空闲时间气泡;使用 Nsight Systems 性能分析工具,FlashInfer 注意力后端下解码峰值吞吐 3713 tokens/s(延迟 17.24ms)
- SGLang FlashInfer 版本兼容性排障(生产级排障经验):
- SGLang 0.4.5 依赖 FlashInfer 0.2.3,使用 0.2.5 会导致 API 不匹配
- 根因:FlashInfer 0.2.5 移除了 CUDA 流参数,但 SGLang 代码仍尝试传递
- 错误信息:batch_prefill_with_kv_cache_dtype_q_f16...plan() expected at most 15 argument(s) but received 16
- 解决:降级到 0.2.3 或等 SGLang 更新兼容版本
建议归入节: §1.1 推理引擎邻接新增 SGLang CUDA Graph 排障子节(GPU 空闲气泡分析 + 3713 tok/s 峰值数据 + FlashInfer 版本兼容性排障)
邻接 E【KV-Cache 工程基础 · §1.3】🟡 KV Cache 优化工程完整图谱(5 技术家族 + 1M Context 内存占用表) ★★
来源: inbox/jay/2026-08-17T2105-jay-evening-five-category-briefing.md(Cloud-Native §3) + inbox/spark/2026-08-17-llm-infra-e1prep.md(邻接3)
URL: https://www.digitalapplied.com/blog/kv-cache-optimization-techniques-2026-engineering-guide
要点: - 五种技术家族:
| 技术 | 效果 | 备注 |
|---|---|---|
| PagedAttention (vLLM) | 内存碎片↓,利用率↑ | 固定块 KV 管理 |
| Prefix Caching | 命中时 85–95% 计算节省 | SGLang RadixAttention 自动发现 |
| MQA/GQA/MLA | Attention Head 压缩 | DeepSeek MLA 最高压缩率 |
| KV Cache Quantization | FP8 → 50% 显存节省 | 与 MLA 叠加效果最强 |
| Hybrid Memory (NVMe Offload) | 显存外溢出 | 延迟敏感场景需谨慎 |
- 1M Context KV 内存占用(Llama 70B):
- MHA FP16:138 GB(爆炸性)
- GQA INT8:~35 GB(可接受)
- MLA + FP8:~17 GB(生产可行)
- arXiv 新论文:
2603.20397KV Cache Optimization Strategies Survey(Dell · Mar 2026) +2602.08005DeltaKV:Residual-Based KV Cache Compression(长程相似性压缩)——见警示
警示: - 1M Context 138 GB / 35 GB / 17 GB 数据来源为工程博客,未经独立核验;引用为"工程估算,待核实" - DeltaKV arXiv ID 2602.08005 来自 jay evening briefing,但 paper_cards 尚未建档,需 arXiv 官方确认
建议归入节: §1.3 KV-Cache 新增工程完整图谱子节(5 技术家族 + 1M Context 内存占用表 + MLA+FP8 ~17GB 生产可行数字);§1.3 新增 DeltaKV(2602.08005)长程相似性压缩邻接候选
二、值得警惕的矛盾或待核实说法
| # | 矛盾/待核实项 | 来源 | 风险等级 |
|---|---|---|---|
| 1 | OpScale arXiv:2608.13499 arXiv ID 待核 | jay afternoon synthesis 报 2026-08-13,但 paper_cards 尚未建档 | 🟡 中 |
| 2 | vToken arXiv:2608.13263 主分类待精确分类 | paper_cards 尚未建档;预测归 llm-infra/inference | 🟡 中 |
| 3 | PremAI H100 ~16,200 tok/s 与 Spheron ~1,920 tok/s 数量级差异 | 测试条件(batch/seq_len)可能完全不同 | 🟡 中 |
| 4 | MemoryAlloy 9.9× prefill 加速测试条件不明确 | Crusoe AI 博客,节点数/网络配置/GPU 型号未明 | 🟡 中 |
| 5 | ICMSP BlueField-4 DPU 可用性阶段待核 | CES 2026 发布=仍在规划/早期部署阶段 | 🟡 中 |
| 6 | vLLM 0.27 Breaking Changes Transformers v5 迁移范围 | 具体哪些 API 被移除/变更尚需逐一核实 | 🟡 中 |
| 7 | DeltaKV arXiv:2602.08005 来源可靠性 | jay evening briefing 引用,paper_cards 尚未建档 | 🟡 中 |
| 8 | Decode Context Parallelism 与 vLLM DCP(§IX 48th 沿用)命名冲突 | Decode CP=长上下文 Decode 并行;vLLM DCP=分布式检查点并行;两者内涵不同 | 🟢 低(已知差异) |
三、可引用 arXiv 号列表
🆕 本棒净增(2 件):
| arXiv 号 | 论文 | 主题 | 状态 |
|---|---|---|---|
2608.13499 |
OpScale: Operator-Level Provisioning and Autoscaling for LLM Serving(MSRA) | 算子级弹性扩缩容 · 成本 -36.3% | paper_cards 尚未建档 · 建议本周内建卡 |
2608.13263 |
vToken: Token-Level Virtualization for Reclaimable KV Caches | GPU 内存 token 级 KV 虚拟化回收 | paper_cards 尚未建档 · 建议本周内建卡 |
🔄 沿用(8 件,8-17 版已锚入):
| arXiv 号 | 论文 | 主题 | 归入活文档节 | 状态 |
|---|---|---|---|---|
2608.13426 |
Reduced Matrix Multiplication (RMM) | 输入自适应矩阵乘 | §1.3 或 §1.11 | 8-15 已锚入 |
2604.25724 |
Scalable Inference Architectures for Compound AI Systems (Salesforce) | Compound AI serverless autoscaling | §1.2 | 8-15 已锚入 |
2507.06608 |
Nexus: Active Prefill-Decode Disaggregation on a Single GPU | 单 GPU PD 分离 2.2×/20×/2.5× | §1.2 | 8-15 已锚入 |
2603.13358 |
Not All Prefills Are Equal (PD Disaggregation 多轮 Agent 失效) | PD 多轮场景失效 | §1.2 | 8-15 已锚入 |
2511.01815 |
KV Cache Transform Coding (ICLR 2026) | KV Cache 有损压缩存储 | §1.3 | 8-15 已锚入 |
2605.04595 |
Queueing-Theoretic Framework for LLM Inference (ICML 2026) | KV Cache 排队论稳定性 | §1.3 | 8-15 已锚入 |
2603.20397 |
KV Cache Optimization Strategies Survey (Dell, Mar 2026) | KV Cache 综述 | §1.3 | 8-17 版邻接新增 |
2602.08005 |
DeltaKV: Residual-Based KV Cache Compression | 长程相似性 KV 压缩 | §1.3 邻接 | 待建卡 |
四、检查过的来源清单
inbox/jay/2026-08-17T1000-jay-vllm-august-2026-engineering-deep-dive.md→ ⭐⭐⭐⭐⭐ vLLM 8月工程 7 件(OpScale 来源确认/25K TPS/Decode CP/Speculative Decoding/FP8 KV-Cache/EAGLE3 AMD/Semantic Router) + HF State of Open Models Summer 2026inbox/jay/2026-08-17T1145-jay-engineering-filter.md→ ⭐⭐⭐⭐ ICMSP/NIXL/MemoryAlloy/vLLM 0.27 Breaking Changesinbox/jay/2026-08-17T1220-jay-csdn-inference-quantization-agent-2026.md→ ⭐⭐⭐⭐⭐ SGLang CUDA Graph 气泡/FlashInfer 排障/DeepSeek-V3 排行/FP8 vs INT4/企业级量化体系inbox/jay/2026-08-17T1455-jay-engineering-filter-arxiv-agentic-infra.md→ ⭐⭐⭐⭐ OpScale/vToken 锚点来源inbox/jay/2026-08-17T1505-jay-afternoon-synthesis-briefing.md→ ⭐⭐⭐⭐⭐ Backend 13件(OpScale/vToken/Contract-Grade Kernel Verifier) + Database 10件inbox/jay/2026-08-17T1620-jay-csdn-rag-agent-enterprise-architecture-highvalue.md→ RAG/Agent 企业架构邻接inbox/jay/2026-08-17T1950-jay-engineering-filter.md→ ICMSP/NIXL 工程博客补充inbox/jay/2026-08-17T2105-jay-evening-five-category-briefing.md→ ⭐⭐⭐⭐ Backend(SGLang 16K tok/s vs vLLM 12.5K)/Cloud-Native(KV Cache 5技术家族/1M Context 17GB MLA+FP8)/SIGMOD/VLDB 2026inbox/jay/2026-08-17-engineering-e1prep.md→ 6 条 net-new(inference 相关部分已纳入)inbox/jay/2026-08-17-csdn-substack-inference-rag-agent-highvalue.md→ OWASP LLM04 RAG 架构弱点邻接inbox/spark/2026-08-17-llm-infra-e1prep.md→ ⭐⭐⭐⭐⭐ llm-infra 主轴 8 件(OpScale/vToken/vLLM 0.27/Decode CP/ICMSP/MemoryAlloy/25K TPS/vLLM 8月工程 5 件);邻接 inference 7 条inbox/tom/2026-08-16-inference-e1prep.md→ Aug 16 版基线(6 条:vLLM CI/Jarvis Labs CPU Offload/GPUYard 公式/DeployBase A100/Mix-Quant/KVServe)inbox/tom/2026-08-15-inference-e1prep.md→ Aug 15 版基线(9 条:AWQ/Nexus/Not All Prefills/Salesforce/MCP stateless/NVIDIA Dynamo/H100 Benchmark/KV Cache Transform Coding/Queueing-Theoretic/RMM)inbox/tom/2026-08-17-rag-e1prep.md→ RAG 主轴;无 inference 直接新增inbox/spark/2026-08-17-agent-e1prep.md→ Agent 主轴;无 inference 直接新增inbox/stephen/2026-08-17-ai-industry-e1prep.md→ AI industry 主轴;无 inference 直接新增inbox/flyp/2026-08-17-multimodal-e1prep.md→ multimodal 主轴;无 inference 直接新增paper_cards/965-2608.14210→ Legal RAG Hallucination · 主分类 rag · 无 inferencepaper_cards/966-2608.14546→ CPI-Bench · 主分类 evaluation · 无 inferencepaper_cards/967-2608.14106→ Forecast Collapse · 主分类 evaluation · 无 inferencepaper_cards/968-2608.13667→ Second Thought(推理并行) · 主分类 agent · 邻接 inferencepaper_cards/969-2608.14284→ PRM-as-a-Judge 1.5 · 主分类 evaluation · 无 inferencepaper_cards/970-2608.13040→ LOPD Agent · 主分类 agent · 无 inferencepaper_cards/971-2608.13606→ MobileMem · 主分类 evaluation · 无 inferencepaper_cards/972-2608.09928→ MMDiff · 主分类 multimodal · 无 inferenceorganized/queue/work-queue.md2026-08-17 22:00 → 选题榜 2608.08020/2608.13499(已纳入);无新 inference 直接候选
五、无显著新增量的领域(如实说明)
以下 8-17 版基线已立标方向,本棒检查后确认无新增量,不重复列出:
- vLLM MRV2 / P-EAGLE / FlexKV / gRPC — 8-17 版已充分锚入;本棒 vLLM 0.27 Breaking Changes 是版本治理维度补充,非功能更新
- Nexus / Not All Prefills Are Equal — 8-15/8-16 版已充分锚入;本棒 OpScale 是 PD Disaggregation 的下一层细化,非新 PD 系统
- AWQ INT4 3x 并发 / RTX 4090 FP8 最优配置 — 8-15 版已锚入;本棒无新量化数据
- Salesforce Compound AI 8000 企业/3.9x 吞吐 — 8-15 版已锚入;本棒无新 Compound AI 数据
- MCP 2026-07-28 stateless 架构 — 8-15 版已锚入;本棒无 MCP 新数据
- NVIDIA Dynamo 1.0 — 8-15 版已锚入;本棒无新编排层数据
- KV Cache Transform Coding ICLR 2026 / Queueing-Theoretic ICML 2026 — 8-15 版已锚入;本棒 KV Cache 5 层技术栈是工程图谱补充,非新路线
- RMM arXiv:2608.13426 — 8-15 版已锚入;本棒无新数据
- DeployBase A100 Benchmark — 8-16 版已锚入;本棒 H100 ~16,200 tok/s 数据来自 PremAI 等第三方,不同测试条件不可直接比较
- paper_cards 主分类 inference 零新增 — 8-15→8-17 无任何主分类 inference 新卡
六、本棒总结
本轮 E1 预消化结论:高密度工程+学术双增量棒——7 条 net-new 增量(含 2 条首度锚入,2 条首度锚入指 OpScale 和 vToken),整体密度高于 8-16 E1 棒的 6 条工程文档棒。学术/系统化新量(Paper Card)为 0,但 OpScale 和 vToken 均为 arXiv 新提交,属于学术+工程双验证的硬增量。
本棒 vs 8-16 结构性差异: - 8-16 = 中等密度工程文档棒(6 条:含 0 arXiv 新件) - 8-17 = 高密度工程+学术双增量棒(7 条主线:含 2 arXiv 新件 OpScale/vToken + 3 条邻接工程补丁)
建议今夜活文档接力重点:
§1.2→ 新增 OpScale 算子级弹性扩缩容子节(PD Disaggregation=架构级分离,OpScale=算子级弹性——两者互补;arXiv:2608.13499)§1.3→ 新增 vToken token 级虚拟化回收子节,补全 KV Cache 5 层技术栈(Block→Token→系统级→硬件级→集群级;arXiv:2608.13263)§1.1→ 新增 vLLM 版本治理子节(v0.22-v0.27 时间线 + Breaking Changes 清单 + Transformers v5 迁移警告)§1.1→ 新增 GB200 NVL72 Benchmark 子节(25K TPS/GPU NVFP4 + Blackwell GDN kernels + HMA + async scheduling)§1.1→ 新增 Decode Context Parallelism 子节(长上下文 Decode 阶段内部并行,标注与 vLLM DCP 命名区分)§1.3→ 新增 ICMSP/NIXL 硬件级传输子节(BlueField-4 DPU + NIXL 四介质协议 + 10× prefill 加速)§1.3→ 新增 MemoryAlloy 集群级 LRU+LFU 自适应驱逐子节(与 CAAE 单实例动态驱逐对比)§1.1→ 更新 H100 Benchmark 表格新增 PremAI 2026-08 列(标注测试条件差异) + SGLang 前缀缓存命中率量化数据(75-95%)§1.3→ 新增 KV Cache 5 技术家族工程完整图谱 + 1M Context 内存占用表(MLA+FP8 ~17GB 生产可行)
边界说明: 本棒仅写入 inbox/tom/2026-08-17-inference-e1prep.md;未读取 knowledge/inference.md 全文(由今夜活文档接力棒负责更新)。
Tom · 2026-08-17 22:20 CST · E1 日间预消化轮 · inference 主题 · 24h 窗口 · 不执行 GitHub 写操作