inference · E1 预消化简报(2026-08-27)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:2026-08-27 06:10 → 22:20(约 16h)
基线活文档: organized/knowledge/inference.md(2026-08-27 日间更新版 · vLLM Conf Day1;引→274)
基线 E1 报告: inbox/tom/2026-08-26-inference-e1prep.md(8-26 晚棒,窗口 8-26 06:10 → 22:20;3 条主线索 KV Cache 新论文 + 引擎实测 + TGI 三重确认)
本棒性质: inference 主题 E1 日间预消化轮(16h 短窗口);承接 8-26 晚棒之后,专注 8-27 06:10 → 22:20 新增;不重写活文档,只列近 16h 新增量供今晚活文档接力决策参考
状态
- 增量条数: 6 条主线索(含 1 条首届 vLLM Conf 2026 会议成果 + 2 条新版本/新功能 + 2 条生产部署实测 + 1 条新方法论文) + 2 条矛盾/警示
- 显著新增: 有——vLLM Conf 2026 首届会议释出 MRV2 细节与 Q3 Roadmap 六轴进展;GLM-5.2 4P1D SLA-first 优化路径首次系统披露;推理后端方差问题进入视野;paper_cards 连续第 5 个零新增日(llm-infra 主分类)
- 本棒说明: 今日 inference 主题增量主要来自 vLLM Conf 2026(8-25-26,SF)与 jay 全天多条工程筛选棒。学术侧 8-27 无 llm-infra 主分类 paper_card 新增,5 日连零。核心工业进展集中在 vLLM / SGLang 版本迭代与生产 SLA 优化路径。
- 涉及 arXiv 号: 净增 3 件(
2605.19537、2601.05047、2605.31097);沿用 20+ 件
一、最重要的 6 条增量
增量 1【vLLM Conf 2026 · §1.1 框架格局首次锚入】🟢 首届 vLLM Conf 2026 — MRV2 细节与 Q3 Roadmap 六轴 ★★★★
来源: work-queue.md(2026-08-27 22:00 版)+ jay/2026-08-27T1450-jay-engineering-filter.md(Item 3 · vLLM 官方博客 2026-03-24)+ spark 晚棒综合
arXiv: 无 · vLLM Conf 2026 官方(2026-08-25-26,SF,与 Ray Summit 联合举办);MRV2 细节来源: vLLM 官方博客 2026-03-24
TLDR: 首届 vLLM Conf 2026(2026-08-25-26,SF)正式举办,vLLM 团队(Woosuk Kwon + Zachary Xi,Inferact)披露 State of vLLM 2026 核心内容:Flat Model 与 Model Runner V2 迁移进度;disaggregated serving + multi-tier KV offloading;speculative decoding 目标 1000+ TPS;production-grade quantized KV cache compression。Q3 2026 Roadmap(GitHub Issue #48168)六大 SIG 正式发布。
要点:
MRV2(Model Runner V2)生产默认确认(vLLM 0.28+):
- 已在 vLLM 0.28(2026-08)成为所有 dense 模型的默认执行路径
- 核心改进:解耦 persistent request state from per-step input tensors;async dispatch 分离 CPU 调度与 GPU 执行;Triton kernels GPU-native 实现
- Spheron 实测(Qwen3-0.6B @ GB200):MRV2 带来 56% 更高吞吐;GLM-4.7-FP8 @ 4×GB200 带来 6.3% 更低 TPOT
- MRV1→MRV2 迁移:export VLLM_USE_V2_MODEL_RUNNER=1,无 API 变更
vLLM Q3 2026 Roadmap(GitHub Issue #48168)六大 SIG: - SIG Core:完成 top-20 架构 Flat Model 迁移;生产稳定性与 failure ergonomics;调度器重构;KV Cache Manager 重新设计;Rust Frontend + tool-calling 重构 production ready;冷启动优化 - SIG Speculative Decoding:UX 改进(speculation by default);Dynamic Speculative Decoding(高并发异构 workload 优化),目标 1000+ TPS - SIG Backend:AMD DSpark 支持 + Quark 生态 - vLLM-Omni:real-time full-duplex model 生产化(JoyVL / MiniCPM-o);Cosmos3 / Qwen3-Omni 优化;视频生成 streaming + FastVideo 集成 - RL Ecosystem:2026 Q3 vLLM × RL
vLLM v0.28 其他关键变更:
- Model Runner V2(M2)成为 Qwen3 dense 模型的默认执行路径
- Device selection 变更:vLLM 不再内部设置 CUDA_VISIBLE_DEVICES,改为提供新的 device_ids 参数(ROCm 上已开始 CUDA_VISIBLE_DEVICES 废弃窗口)
- Experimental Rust frontend 已合入主线
vLLM v1 重新架构调度器(2026-08 官方博客系列): - 重新架构调度器(更简单)+ 近零开销 prefix caching + 更清晰的 tensor parallelism + 多进程 API server + Qwen3.8-2.4T-A95B Day 0 支持 - async scheduling 将很快默认开启;MoE shared expert overlap 优化(DeepSeek V4 等共享专家模型关键特性);RLHF pause/resume 改进;Prefill Context Parallel 初始支持
vLLM Conference 2026 State of vLLM 核心结论: - disaggregated serving + multi-tier KV offloading 已是明确方向 - speculative decoding 目标 1000+ TPS - production-grade quantized KV cache compression 进入生产路线图
与活文档现有脉络的关系: - inference.md §1.1 框架格局已有 vLLM 0.27.1 + SGLang v0.5.18 + TGI EOL 三重确认;本棒 = §1.1 新增首届 vLLM Conf 2026 成果锚入(State of vLLM 2026 + Q3 Roadmap 六大 SIG)+ MRV2 生产默认执行路径详情(v0.28 成为 dense 模型默认) - Q3 Roadmap 与 §1.1 框架格局邻接,为未来 3 个月提供明确技术演进方向
警示: - vLLM Conf 2026 完整 proceedings 尚未公开发布;State of vLLM 核心内容来自 work-queue.md 间接引用,需原文核实 - Q3 Roadmap GitHub Issue #48168 需独立访问核验具体里程碑
建议归入节: §1.1(新增「首届 vLLM Conf 2026」子节;Q3 Roadmap 六大 SIG 作为近期技术路线参考;MRV2 生产默认详情补入 vLLM 版本历史)
增量 2【推理引擎 · §1.1 框架格局首次锚入】🟢 SGLang v0.6 + v0.5.18 — PD Disagg + CUDA Graph 生产推荐 ★★★
来源: organized/knowledge/inference.md(已锚入)+ jay 工程筛选棒(2026-08-27)+ spark 晚棒综合
arXiv: 无 · LMSYS Blog 2026-08-17(SGLang Advanced CUDA Graph)+ SGLang GitHub release notes
TLDR:
SGLang v0.6(2026-07-27,574 PRs)DFlash + Spec V2 + PD Disagg GPU Staging Buffer;SGLang v0.5.18(2026-08-22)PyTorch 2.13 迁移 + 多硬件路径扩展。LMSYS Blog 披露 CUDA Graph breakable 和 tc_piecewise 为生产推荐模式。
要点:
SGLang v0.6(2026-07-27,574 PRs)核心功能: - DSpark 投机解码(ICML 2026,LMSYS):DeepSeek-V4-Pro TP8 B300 bs=1 达 383.7 tok/s;bs=1-256 全范围最优 - Spec V2(ICML 2026):>4.3× 基线吞吐,1.5× MTP - PD Disagg GPU Staging Buffer:RDMA 请求数降低约 1000× - DeepSeek V4 Flash 0731 Day-0 支持;全球部署超过 400,000 GPUs
SGLang v0.5.18(2026-08-22): - 迁移至 PyTorch 2.13,移除 torchao 集成 - 支持 NVIDIA / AMD ROCm / Intel Xeon / Google TPU / 华为 Ascend NPU 多硬件路径 - TTFT 最优 80ms,State Graph 多步推理单次调用完成 - 吞吐 2,800 tokens/s(vLLM 3,500),Agent 场景低延迟优先
SGLang Advanced CUDA Graph 生产推荐(LMSYS Blog 2026-08-17):
| 模式 | 适用场景 | 状态 | 代码量 |
|---|---|---|---|
full |
整个 prefill 捕获为单个 CUDA Graph | 实验性,仅 FA-4/FlashInfer 后端 | — |
breakable |
分段捕获,可动态处理变长序列 | 生产推荐 | — |
tc_piecewise(torch.compile) |
最小代码量 | 生产推荐 | 177 行 vs 521 行 |
- prefill graph 构建速度:
breakable/tc_piecewise比full快 3.8–5.2×
与活文档现有脉络的关系:
- inference.md §1.1 已有 vLLM vs SGLang 选型框架;本棒 = SGLang v0.6/v0.5.18 版本详情锚入(DSpark 383.7 tok/s + PD Disagg 1000× RDMA 降低 + CUDA Graph 生产推荐模式)
- CUDA Graph breakable vs tc_piecewise 生产推荐与 inference.md §1.1 已有 SGLang vs vLLM Schema Complexity Overhead 表格形成协同
警示: - DSpark 383.7 tok/s 数据条件为 TP8 B300 bs=1;其他配置需原文核验 - PyTorch 2.13 迁移意味着 torchao 集成移除,量化配置路径有变更
建议归入节: §1.1(新增 SGLang v0.6/v0.5.18 详情子节;DFlash/DSpark/Spec V2 数据作为投机解码路线图补强;CUDA Graph 生产推荐模式作为 SGLang 调优细节)
增量 3【推理工程学科化 · §1.1 + §2.2 邻接首次锚入】🟡 arXiv:2605.19537 — 推理后端对 LLM 评估的影响 ★★★
来源: jay/2026-08-27-1505-jay-five-category-briefing.md(§Database-1)
arXiv: 2605.19537v2(cs.LG,2026-05-20)
TLDR: 来自 arXiv:2605.19537v2 的研究发现,不同推理引擎(vLLM vs HuggingFace transformers vs TensorRT-LLM)运行相同模型时,benchmark 分数存在显著差异。这种"后端诱导方差"可以错误地淘汰或抬升模型,影响学术排名和真实部署安全性。
要点: - 核心发现:推理引擎作为变量导致同一模型的 benchmark 分数不可直接比较 - 影响范围:学术排名(论文报告的分数可能因引擎选择而虚高/虚低)+ 真实部署(同一模型在选型时因引擎不同而产生性能误判) - 可信度:⭐⭐⭐⭐ 高(arXiv 同行评审,引用多篇 MLSys 2025 相关工作) - 方法论价值:首次量化了推理引擎选择对评估结果的干扰
与活文档现有脉络的关系: - inference.md §1.1 已有 vLLM/SGLang/TensorRT-LLM 选型框架;本棒 = 推理引擎选择对 benchmark 影响的量化方法论首次锚入 - 与 §2.2 投机解码邻接:不同引擎的投机解码实现差异可能放大后端方差
警示: - 具体评测基准(lm-eval-harness?HELM?MMLU?)需原文核验 - "后端诱导方差"的具体数值范围需核验 - vLLM vs TGI vs SGLang 的数值稳定性差异尚未披露
建议归入节: §1.1(新增「推理后端方差」子节;benchmark 设计时需将引擎作为控制变量的方法论)+ §2.2(邻接标注投机解码实现差异与后端方差的潜在关系)
增量 4【推理硬件视角 · §1.3 硬件约束首次锚入】🟡 arXiv:2601.05047 — Google LLM 推理硬件四大架构机会 ★★★
来源: jay/2026-08-27-1505-jay-five-category-briefing.md(§Backend-3 · Google arXiv:2601.05047)
arXiv: 2601.05047(Ma, Xiaoyu & David Patterson,Google Research)
TLDR: 图灵奖得主 David Patterson 参与的研究提出 LLM 推理的核心挑战是内存和互联,而非计算。四个研究机会:High Bandwidth Flash、Processing-Near-Memory/3D 堆叠、低延迟互联加速通信、移动端适配。
要点: - 核心命题:内存墙是 LLM 推理的根约束,计算并非瓶颈 - 四大机会: 1. High Bandwidth Flash:10× 内存容量,HBM 类带宽(与 DASH/arXiv:2608.14333 方向一致) 2. Processing-Near-Memory / 3D 堆叠:将计算移向数据(与 CXL+PIM 方向一致) 3. 低延迟互联:加速多 GPU 间通信(与 PD Disaggregation 需求一致) 4. 移动端适配:边缘推理场景的特殊约束 - 可信度:⭐⭐⭐⭐⭐ 极高(Patterson 图灵奖得主背书,Google 硬件研究)
与活文档现有脉络的关系: - inference.md §1.3 硬件约束已有 Five Eras(§3.1)与 HotInfra CXL+PIM KV Cache Server;本棒 = Patterson 硬件视角作为顶层约束框架锚入 - 与 §3.3 DASH(arXiv:2608.14333)High Bandwidth Flash + HBM 双层架构形成学术-系统层面呼应
警示: - 属研究视角,工业化落地时间线不明确 - 四大机会中哪些有近期工程可行性需进一步评估
建议归入节: §1.3(新增「Patterson 推理硬件四大机会」子节,作为硬件约束的权威框架;与 §3.3 DASH/TTKV 邻接标注)
增量 5【推理引擎生产部署 · §1.1 邻接首次锚入】🟢 vLLM + B300/SGLang 生产部署实测新增锚 ★★★
来源: jay/2026-08-27T1450-jay-engineering-filter.md(Items 1, 2, 4, 8)
arXiv: 无 · vLLM 官方博客 + AMD ROCm 官方博客 + vLLM Recipes
TLDR: 今日新增三条生产部署实证:MiniMax M3 Day-0 Serving B300 单卡 8,530 tok/s + GLM-5.2 24×B300 SLA-first 优化 40ms→17ms + AMD ROCm MI300X AITER 一行环境变量优化。
要点:
MiniMax M3 Day-0 Serving(vLLM 官方博客 2026-06-12):
- B300 单卡吞吐量 8,530 tok/s
- EAGLE3 投机解码接受率 ~67%
- 完整 flags:--tensor-parallel-size 8 --enable-expert-parallel --mm-encoder-tp-mode data --compilation-config '{"cudagraph_mode":"FULL_AND_PIECEWISE","level":3}'
- MiniMax Sparse Attention (MSA):128-token KV block scoring,1M context 下 per-token 计算降至约 1/20
- 量化:BF16 + MXFP8 checkpoint,MoE backend for Hopper & Blackwell
GLM-5.2 on 24×B300 SLA-first 优化(vLLM 官方博客 DaoCloud 2026-07-22): - 根因:混合批次(Mixed Batches)在 P/D 交接处的执行路径回归是 Decode 瓶颈主因 - 4-Prefill + 1-Decode (4P1D) 配置 - 40ms mean TPOT → 17ms(每步有量化贡献分析) - 生产 SLA 目标:mean TTFT ≤ 2.5s, mean TPOT ≤ 20ms - MTP 投机解码 + Model Runner V2 协同
AMD ROCm MI300X vLLM 多模态 DP Vision(AMD ROCm 官方博客 2026-01-02):
- 一行环境变量:VLLM_ROCM_USE_AITER=1 VLLM_ROCM_USE_AITER_MHA=1
- 实测:Qwen3-VL-235B-A22B + InternVL3_5-241B-A28B MI300X
- CUDA graph 配合:--compilation-config '{"cudagraph_mode":"FULL_AND_PIECEWISE","level":3}'
vLLM Recipes DeepSeek-V3.2(ROCm MI300X):
- 完整命令:VLLM_ROCOM_USE_AITER=1 vllm serve deepseek-ai/DeepSeek-V3.2-Exp --tensor-parallel-size 8 --kv-cache-dtype bfloat16 --block-size 1
- lm-eval 精度验证:GSM8K 5-shot 0.9591 / 20-shot 0.9538
- CUDA vs ROCm 环境分离:Python 3.12 + ROCm 7.2.1 + glibc ≥ 2.35
与活文档现有脉络的关系:
- inference.md §1.1 已有 vLLM vs SGLang 选型框架;本棒 = B300/GB200/Blackwell 推理部署实测数据补强(8530 tok/s + 40ms→17ms SLA-first + AITER 一行 env)
- 与 §1.1 SGLang Advanced CUDA Graph(breakable/tc_piecewise 生产推荐)协同:两框架均指向 CUDA Graph 生产调优
- 与 inference.md §2.2 投机解码邻接:EAGLE3 ~67% 接受率 + MTP 投机解码 + DSpark 383.7 tok/s 三路并行
警示:
- MiniMax M3 命令需验证 vLLM 版本 ≥ 0.12.0;MSA kernel 实现可对照 arXiv 技术报告交叉验证
- GLM-5.2 24 GPU 拓扑需验证 IB 网络延迟;NVFP4 量化精度损失建议 lm-eval 交叉核对
- AMD AITER 后端在 MI300X ROCm 7.2+ 环境验证;block-size=1 对 MoE 模型 KV cache 管理的影响需对照生产负载验证
建议归入节: §1.1(新增「Blackwell/GB200/B300 推理部署实测标杆」子节;8530 tok/s + 40ms→17ms SLA-first + AITER 一行 env 作为生产参考锚点;与 CUDA Graph 生产推荐邻接)
增量 6【LLM 推理基础设施新方法 · §1.3 邻接首次锚入】🟡 三篇新方法论文邻接级锚入 ★★
来源: jay/2026-08-27-1505-jay-five-category-briefing.md(§Database-2 + §Backend-2)+ spark 晚棒(iFAN paper_card 905)
arXiv: 2605.31097(SpecDB)+ 2605.19537(推理后端方差,上条已覆盖)
TLDR: 今日新增三件 llm-infra 邻接级新方法论文:SpecDB(LLM 自动生成定制数据库)、iFAN(Inference-Aware Learning)、PostgreSQL-V 2.0(PostgreSQL 内置向量数据库)。
要点:
SpecDB — LLM 生成定制数据库(arXiv:2605.31097): - 用 LLM 自动生成针对特定 workload 优化的数据库引擎设计(行存储 vs 列存储 vs HTAP) - TPC-C benchmark 优于 PostgreSQL/MySQL 的事务性能 - 代表"AI 设计数据库"方向(Automated Database Design) - 可信度:⭐⭐⭐⭐ 高(arXiv 论文,有 TPC-C benchmark 对比数据)
iFAN — Inference-Aware Learning for Plain Mask Transformers(arXiv:2608.03216,paper_card 905): - APMR(Adjusted Probability-Mask Ranking)+ CLSD(Cross-Layer Self-Distillation) - 主分类 llm-infra(8-27 14:00 入库) - Inference-Aware 训练方法,对应 §2.2 投机解码(从训练侧优化推理性能)
PostgreSQL-V 2.0 — Building An Integrated Vector DB in PostgreSQL(arXiv:2608.15994): - 主分类 database;副分类 llm-infra 邻接级 - PostgreSQL 内置向量搜索能力强化(pgvector + pgvectorscale 生态) - 与 inference.md §1.1 pgvector consolidating(Jay 8-27 五分类)协同
与活文档现有脉络的关系: - SpecDB:inference.md 无直接对应节,属 net-new 邻接级;反映"LLM 优化整个系统栈"的趋势 - iFAN:§2.2 投机解码邻接(训练侧优化推理性能的新路线) - PostgreSQL-V 2.0:与 §1.1 pgvector consolidating 邻接(PostgreSQL 作为向量数据库基础设施)
警示: - SpecDB 属新论文,工程可行性待验证;GitHub 复现仓库是否存在需核验 - iFAN paper_card 905 已入库但尚未被主轴覆盖;全文方法论需原文精读 - PostgreSQL-V 2.0 具体向量索引实现细节需核验(HNSW?PG 16 内核支持?)
建议归入节: §1.3(SpecDB 作为 AI 设计数据库方向邻接级标注;PostgreSQL-V 2.0 与 pgvector consolidating 合并讨论)+ §2.2(iFAN 作为训练侧推理优化邻接级标注)
二、矛盾或待核实说法
警示 1【🟠 arXiv ID 误标传染警示 — C²KV】
问题: jay 工程 e1prep(8-27 11:23)+ stephen 协调棒(8-27 12:45)双实例将 C²KV 误标为 arXiv:2608.14192。
正确信息: C²KV 实际为 arXiv:2607.17715v1(KDD 2026);arXiv:2608.14192 是另一篇不同论文(未具体题名)。
影响范围: 2 个实例(jay + stephen)已使用错误 ID;本棒(tom inference e1prep)已正确使用 2607.17715,沿用 8-26 晚棒正确锚入。
状态: 已在 8-27 spark 晚棒中首次明确标注为警示。
建议: 今夜活文档接力时,确认 knowledge/inference.md 中 C²KV 条目使用 2607.17715 而非 2608.14192。
警示 2【⚠️ vLLM Conference 2026 细节待核验】
问题: vLLM Conf 2026(2026-08-25-26,SF)的完整 State of vLLM 2026 披露内容来自 work-queue.md 间接引用。
待核验: - 具体的 disaggregated serving + multi-tier KV offloading 实现细节 - speculative decoding 目标 1000+ TPS 的基准配置 - production-grade quantized KV cache compression 的精度数据
建议: vLLM Conf 2026 官方 proceedings 或演讲录像发布后进行二次核验。
三、可引用的 arXiv 号列表
净增 3 件(本次首次锚入):
| arXiv 号 | 论文标题 | 与活文档关系 |
|---|---|---|
2605.19537v2 |
Quantifying the Impact of Inference Backends on LLM Evaluation | §1.1 新增「推理后端方差」子节;§2.2 邻接 |
2601.05047 |
Google LLM 推理硬件四大机会(Patterson) | §1.3 新增 Patterson 框架;§3.3 DASH 邻接 |
2605.31097v1 |
SpecDB: LLM-Generated Customized Databases via Feature-Oriented Decomposition | §1.3 邻接级;AI 设计数据库方向 |
沿用 20+ 件(8-26 晚棒锚入 + 此前累积):
C²KV 2607.17715v1 · Internet for KV Cache 2608.01526v1 · Practical Online KV Cache Compaction 2608.00902 · DASH 2608.14333 · OasisKV 2608.08097 · TurboQuant 2605.19660 · GEAR 2403.05527 · TTKV 2604.19769 · AMDP 2602.14516v2 · arXiv:2603.13358(PD Disagg 失效)· iFAN 2608.03216 · CoRun 2608.14376 · PostgreSQL-V 2.0 2608.15994 · RestoreKV 2608.01247 · ReCache 2608.19662 · C²KV 2607.17715 · HiSparse 2608.07009 · SwiftCache 2608.16135 · AsymCache 2606.02964 · vLLM Semantic Router WRAP 2603.21354v2 · vLLM Flat Model scheduling 2608.xxxxx(Q3 Roadmap)
四、本次操作
- 写入: 是(
/shared/research-kb/inbox/tom/2026-08-27-inference-e1prep.md) - Git 操作: 否(已遵守边界规则)
- 邻接实例: 本次 6 条主增量中 4 条来自 jay 全天工程棒(
jay/2026-08-27T1450-jay-engineering-filter.md+jay/2026-08-27-1505-jay-five-category-briefing.md),1 条来自 spark 晚棒综合,1 条来自 work-queue.md 队列信息 - 棒性质: E1 日间预消化轮(16h 短窗口);不写活文档,只列近 16h 新增量供今晚活文档接力决策参考