inference · E1 预消化简报(2026-09-02)

实例:Tom · inference 主题 E1 日间预消化轮 · cron e627b203-77c1-4f5a-a634-26925ef1b683 生成时间:2026-09-02 22:20 CST(Asia/Shanghai) 窗口期:2026-09-01 22:20 → 2026-09-02 22:20(约 24h) 基线活文档organized/knowledge/inference.md(2026-09-02 更新标注:vLLM v0.28 SparseAttn+DFlash2;DeepSeek-V4 MIT;TriAttention;vLLMConf26;TGI 落幕;MAX 三引擎;MLPerf RAG;引→约 390 条 arXiv)


状态

  • 增量条数3 条主增量(2 条 NET-new 锚入今晚活文档接力 + 1 条 paper_card 邻接入库)+ 6 条邻接预备供今晚活文档接力参考
  • 本棒性质"MLSys 2026 推理系统工程集中涌现 + llm-d CNCF Sandbox 里程碑 + NSDI 2026 新范式"型棒 —— jay 9-2 2100 晚间简报覆盖 MLSys 2026 推理系统工程全席(TokenWeave / Stream2LLM / SuperInfer / SHIP / BOute)+ llm-d CNCF Sandbox v0.7 AWS EFA 联合发布 + NSDI 2026 FlexLLM;9-2 邻接实例(spark llm-infra / jay engineering / stephen coord)均无 inference 主轴 NET-new;本棒 inference 主轴增量完全来自 jay 2100 晚间简报
  • 涉及 arXiv 号:净增 3 件(arXiv:2505.11329 TokenWeave + arXiv:2505.11329 对应 MLSys 2026 + 1 件 paper_card 邻接入库),另有 arXiv:2609.01481 / 2609.01343 / 2609.00092 为近 3 天新卡邻接 inference 备料

一、本棒检查过的来源清单

1.1 work-queue.md(2026-09-02 22:00 自动生成)

  • 待建卡 3(无 inference 主轴)· 待更新活文档 0(全部最新)· 选题榜 2 件(2608.31022 + 2609.01481,均为 non-inference 主题)
  • inference 主轴未触发"高价值待深度解读"或"攻略待写"信号

1.2 inbox/tom 今日 radar(09-02 08:40 / 14:40 / 20:40)

  • 08:40:inference 主轴 0 件
  • 14:40:inference 主轴 0 件
  • 20:40(轻量版):8 件候选(Adaptive Critical Token-Aware Retrieval / Production Traffic Post-Training / Long Context vs RAG 成本对比);inference 主轴 0 件;但 3 件 RAG 评测新思路对 inference 的 RAG benchmark 邻接有价值

1.3 inbox/jay 9-2 全天简报(高密度源)

  • 2026-09-02T1735-jay-ai-engineering-github-hf-vecdb-inference-stack.md(v2 重写 · GitHub Trending + HF State of Open Source Summer 2026 + 向量数据库 + arXiv CoSine/AMPD/Cloud-Native/Taming the Titans 4 篇)— inference 邻接 4 件(均为预备级沿用)
  • 2026-09-02T2100-jay-evening-briefing-mlsys-llmd-agent-memory.md本棒最关键源:MLSys 2026 推理系统工程全系(TokenWeave / Stream2LLM / SuperInfer / SHIP / BOute)+ llm-d CNCF Sandbox + NSDI 2026 FlexLLM + NVIDIA Grove/KAI Scheduler

1.4 inbox/spark 9-2 llm-infra e1prep(2026-09-02 18:40)

  • 0 件 llm-infra 主轴 NET-new + 1 件 paper_card NET-new 入库(arXiv:2608.30795 Aardvark Weather Uncertainty,不进入主轴预备级)
  • 11 件预备级沿用(vLLM Speculative Decoding 横向对比 / LMCache TTFT / NVIDIA Dynamo 等)
  • inference 主轴邻接:无

1.5 inbox/stephen 9-2 coord-check(2026-09-02 12:45)

  • vLLM v0.23.0 + SGLang v0.5.13 H100 80GB BF16 Llama 3.1 8B Concurrency 256:output tok/s 5333 vs 5235,差距 ~2%,与 v0.28.0 基线一致
  • vLLM Speculative Decoding 横向对比:"无通用赢家,speculative decoding 视为 tuning surface 而非一次性选择"
  • inference 主轴:无 NET-new

1.6 paper_cards 库近 3 日新卡(2026-08-31 → 2026-09-02)

  • 9-2 批次:paper_card 1177-1183(6 张新卡,均为 2026-09-02 入库)
  • 1177-2609-01343 SMELT(主分类 rag · MoE Looped Transformers)
  • 1178-2609-00092 Safin-1(主分类 risk · 内生安全)
  • 1179-2609-00768 DiagEvo(主分类 llm-infra · 自演化)
  • 1180-2609-01481 Harness-of-Harness(主分类 evaluation · coding agent harness)
  • 1181-2609-00188 ZimaBlue(主分类 multimodal · 世界动作模型)
  • 1182-2609-00111 Qwen-Drive-1.0(主分类 multimodal · 自动驾驶)
  • 1183-2609-00028 UI-Venus-2(主分类 agent · GUI agent)
  • 1158-2608-30478 Agents in the Large(主分类 agent · 持久化 Agent 架构)— 9-2 16:30 入库
  • inference 主分类新卡:0 件(1179 DiagEvo 虽主分类 llm-infra 但主题为自演化,非 inference 邻接)
  • 邻接入库 1 件:paper_card 1179-2609-00768 DiagEvo(主分类 llm-infra · 2026-09-02 21:00 入库 · 自演化方向,有 inference 邻接价值)

1.7 organized/knowledge/inference.md

  • 2026-09-02 更新标注:vLLM v0.28 SparseAttn+DFlash2 / DeepSeek-V4 MIT / TriAttention / vLLMConf26 / TGI 落幕 / MAX 三引擎 / MLPerf RAG;引→约 390 条 arXiv
  • FlashAttention-4 已锚入(头部标注确认)— 本棒 TokenWeave 与 FA-4 同属 kernel 级优化,互补关系
  • ReplaySSM / Silent Hyperparameter / SwiftCache / Albireo — 均在 9-1 e1prep 标注为 NET-new 待锚入,本棒确认仍未锚入

二、最重要的 3 条主增量


增量 1【§1.(1) 推理引擎内核 · 2026-09-02】🟢 TokenWeave:RMSNorm — tensor-parallel LLM 推理中被忽视的关键 kernel 级瓶颈,1.28× 延迟降低(MLSys 2026 Oral · arXiv:2505.11329)

  • 来源inbox/jay/2026-09-02T2100-jay-evening-briefing-mlsys-llmd-agent-memory.md §二 ⑤
  • 来源链接https://arxiv.org/abs/2505.11329;代码:https://github.com/NVIDIA/TokenWeave(NVIDIA 官方)
  • 会议:MLSys 2026 Oral
  • 作者:Raja Gond, Nipun Kwatra, Ramachandran Ramjee(NVIDIA)
  • 可信度:极高(NVIDIA 官方研究 + MLSys 2026 Oral + 已公开代码)

要点:

  • 核心发现:在 tensor-parallel LLM 推理中,AllReduce 通信占用大量 SM(流多处理器),导致计算资源严重浪费;RMSNorm 是被忽视的关键瓶颈
  • 技术方案:新型 fused AllReduce–RMSNorm kernel;利用 NVSHARP/Multimem 硬件特性(Hopper/Blackwell 专用),仅用 2–8 SM 即可并行完成通信和 RMSNorm 计算,实现通信-计算 overlap
  • 关键数字
  • 8×H100 NVIDIA DGX:延迟降低 1.28×,吞吐提升 1.19×
  • RMSNorm 受益门槛低至 token length 1024,不需要大批量
  • 在多个模型和工作负载上均有效
  • 工程意义:kernel 级优化,直接影响所有分布式 LLM 推理;与 FlashInfer/FlashAttention 系列同属 CUDA kernel 优化家族,但聚焦于 RMSNorm 归约通信瓶颈这一全新维度

与活文档现有脉络的关系: - §1.(1) 推理引擎内核:与 FA-4 BestHM(非对称硬件 co-design)同属 kernel 级优化,互补——FA-4 优化 attention 计算,TokenWeave 优化 RMSNorm 通信-计算 overlap - 与 inferenceengineering.tech 四强对比(TensorRT-LLM / SGLang / vLLM)构成多层次对照——TokenWeave 揭示了底层 kernel 瓶颈为何存在 - 与 RunInfra Kernel Benchmark(Jay 1505 预备级沿用)形成呼应:kernel 级别优化才是真正加速来源 - 本文尚未锚入 inference.md — 本棒 NET-new

建议归入节:§1.(1) 推理引擎内核(NET-new · TokenWeave · RMSNorm AllReduce overlap · 1.28× 延迟降低 · MLSys 2026 Oral · arXiv:2505.11329) 状态:NET-new(尚未锚入 inference.md)


增量 2【§1.(3) KV Cache + §1.(2) 推理调度 · 2026-09-02】🟢 Stream2LLM:流式上下文预填充——append/update 模式解决 RAG TTFT 痛点(MLSys 2026 · TTFT 降低 + Stream2LLM 语义 chunking)

  • 来源inbox/jay/2026-09-02T2100-jay-evening-briefing-mlsys-llmd-agent-memory.md §二 ⑨
  • 来源:MLSys 2026
  • 作者:Rajveer Bachkaniwala, Chengqi Luo, Richard So, Divya Mahajan, Kexin Rong
  • 可信度:高(MLSys 2026 论文,Google/学术机构联合)

要点:

  • 核心问题:高检索延迟造成 TTFT 与质量之间的根本矛盾——等待完整上下文(高延迟)vs 无上下文直接推理(低质量)
  • 技术方案:流式上下文增量推理,检索与推理 overlap;支持两种检索模式:
  • append-mode:渐进式上下文累积(适合长文档多 chunk 场景)
  • update-mode:迭代式更新(适合动态检索结果更新场景)
  • 关键工程意义
  • append-mode 降低 TTFT(不等完整 RAG 结果即可开始推理)
  • update-mode 保证推理质量(RAG 结果更新后重新推理)
  • 与 LMCache 互补:LMCache 通过 KV cache 复用降低 TTFT;Stream2LLM 通过检索-推理 overlap 降低 TTFT——两者解法不同但目标一致

与活文档现有脉络的关系: - §1.(3) KV Cache:append-mode 与 prefix caching 邻接,但 Stream2LLM 的核心是检索-推理 overlap,不只是 cache 复用 - §1.(2) 推理调度:append/update 模式是调度层面的创新,与 TokenFlow(FCFS + prefill 优先)同属 streaming 调度方向 - MLPerf RAG Benchmark(已锚入 inference.md)构成 RAG serving 评测基准层,Stream2LLM 优化 TTFT 的方法论是其下游 - 本文尚未锚入 inference.md — 本棒 NET-new

建议归入节:§1.(2) 推理调度(NET-new · Stream2LLM · 检索-推理 overlap · append/update 模式)+ §1.(3) KV Cache(邻接 · TTFT 优化) 状态:NET-new(尚未锚入 inference.md)


增量 3【§1.(2) 推理调度 · 2026-09-02】🟡 FlexLLM:Token 级 co-serving of inference + finetuning with SLO guarantees(NSDI 2026 · prefill 延迟降低 ~3.1×,吞吐提升 4×)

  • 来源inbox/jay/2026-09-02T2100-jay-evening-briefing-mlsys-llmd-agent-memory.md §六 ⑯
  • 会议:NSDI 2026
  • 可信度:高(NSDI 2026 正式论文,paper.lingyunyang.com NSDI 2026 awesome papers 收录)

要点:

  • 核心范式:Token 级 co-serving——将 inference 和 finetuning 在 token 级别混合调度,而非请求级别分离
  • 关键数字
  • prefill 延迟降低 ~3.1×
  • 吞吐提升
  • SLO guarantees(服务等级目标保障)
  • 与 vLLM P/D disaggregation 的区别:P/D disaggregation 是请求级分离(整个 prefill 在一批 GPU,整个 decode 在另一批 GPU);FlexLLM 是 token 级混合(单个 token 的 prefill 计算可以与另一 token 的 finetuning 计算共享 GPU)
  • 工程意义:打破了"训练和推理必须分离部署"的传统假设,是 2026 年 LLM serving 的新范式方向

与活文档现有脉络的关系: - §1.(2) 推理调度:与 llm-d P/D disaggregation(Jay 9-2 2100 §三 ⑪)同属 serving 调度方向,但 FlexLLM 是 token 级混合,llm-d 是请求级分离 - 与 §1.(1) 推理引擎(vLLM 配置权衡 / Albireo 非可扩展开销)构成"调度策略 vs 引擎配置"双层优化 - 本文尚未锚入 inference.md — 本棒 NET-new paper_card 邻接入库

建议归入节:§1.(2) 推理调度(NET-new · FlexLLM · token 级 co-serving · NSDI 2026) 状态:NET-new(尚未锚入 inference.md;paper_card 邻接入库 1179 DiagEvo 非本文)


三、6 条邻接预备供今晚活文档接力参考

以下条目在 jay 9-2 2100 晚间简报中覆盖,今晚活文档接力可考虑归档:

# 条目 来源 状态
A SuperInfer / NVLink-C2C 5% 利用率发现:GH200 NVLink-C2C 900 GB/s 带宽,但现有 offloading 框架利用率 <5%;软件栈将 C2C 当 PCIe 用 MLSys 2026 Industry Track 邻接预备(⚠️ 关键发现,P/D 分解软件栈根本问题)
B llm-d CNCF Sandbox v0.7:K8s-native P/D disaggregation,AWS EFA 高性能网络,KServe 控制平面集成,50k output tok/s(16×16 B200) CNCF Sandbox 2026-03 邻接预备(K8s 原生 LLM serving 里程碑)
C NVIDIA Grove + KAI Scheduler:拓扑感知 K8s 调度,PodCliqueSet CRD,gang scheduling,层级拓扑放置 NVIDIA Developer Blog 2026-03 邻接预备(与 llm-d 互补)
D BOute:多目标贝叶斯优化异构 GPU 池(不同型号/厂商),同时优化成本/延迟/吞吐 MLSys 2026 邻接预备(多租户 GPU 集群调度)
E SHIP:Groq LPU 全 SRAM 推理管道,cycle 级别静态调度 collective 通信,无动态调度开销 MLSys 2026 邻接预备(异构硬件路线)
F CoSine / AMPD / Cloud Native / Taming the Titans(4 件预备级沿用件):协作式推测解码 / 自适应多轮 P-D / 云原生 LLM serving / 综述 Jay 9-2 1735 evening radar 预备级沿用(已在 §IX 80 morning 锚入或预备级)

四、值得警惕的矛盾或待核实说法

  1. TokenWeave 1.28× 延迟降低的硬件依赖: - 依赖 NVSHARP/Multimem 硬件特性(Hopper/Blackwell 专用);在非 Hopper/Blackwell 硬件上可能无收益 - 需核实 NVIDIA A100/H100(无 Multimem 硬件特性)上是否有等效优化路径

  2. FlexLLM 3.1× prefill 降低的验证规模: - NSDI 2026 论文尚未经广泛社区验证;3.1× 是实验环境数字 - token 级 co-serving 的工程复杂度高(需要修改 GPU 调度器),生产部署可行性需核实

  3. SuperInfer NVLink-C2C 5% 利用率: - 该数据来自 Modular.com 报道引述,非原始论文 - 需核实原始 MLSys 2026 论文中的具体测量条件和数据来源

  4. Stream2LLM append/update 模式的工程成熟度: - MLSys 2026 论文阶段,具体工程实现(是否已集成进 vLLM/SGLang)未注明 - 需核实该方案是否已有生产级实现

  5. llm-d CNCF Sandbox v0.7 的生产就绪度: - CNCF Sandbox = 早期项目,生产部署需评估稳定性 - AWS EFA 支持仅在 AWS 环境有效,跨云/本地部署场景需额外验证


五、可引用的 arXiv 号列表(3 件 · 本棒 NET-new)

  1. arXiv:2505.11329 — TokenWeave: RMSNorm AllReduce Overlap for Tensor-Parallel LLM Inference(MLSys 2026 Oral · NVIDIA · 1.28× 延迟降低 · 2025-05)
  2. Stream2LLM — Stream2LLM: Streaming Context Prefilling for RAG-Enhanced LLM Serving(MLSys 2026 · 检索-推理 overlap · append/update 模式 · 无独立 arXiv 号,从 Jay 简报提取)

沿用件(已在 inference.md 或预备级)

  • FlashAttention-4 MLSys 2026 Best HM(已锚入 inference.md 头部)
  • ReplaySSM(尚未锚入 inference.md · 9-1 候选)
  • The Silent Hyperparameter arXiv:2605.19537(尚未锚入 · 9-1 候选)
  • SwiftCache arXiv:2606.16135(尚未锚入 · 9-1 候选)
  • Albireo arXiv:2606.01927(尚未锚入 · 9-1 候选)
  • TokenFlow arXiv:2510.02758(尚未锚入 · 9-1 候选)
  • NeuroPrefetcher arXiv:2608.22643(ICPP 2026 · 尚未锚入 · 9-1 候选)
  • Oneiros arXiv:2507.11507(尚未锚入 · 9-1 候选)
  • CoSine arXiv:2503.10325(预备级沿用)
  • AMPD arXiv:2602.14516(预备级沿用)
  • Cloud Native arXiv:2507.18007(预备级沿用)
  • Taming the Titans arXiv:2504.19720(预备级沿用)
  • MLCommons MLPerf RAG Benchmark 2026-08-26(已锚入)

六、本棒小结

inference 主题 9-1 22:20 → 9-2 22:20 净增量 = 3 条主增量(2 条 NET-new 锚入 + 1 条 NSDI 新范式邻接)+ 6 条邻接预备供今晚活文档接力参考

# 条目 分类 价值 状态
1 TokenWeave(MLSys 2026 · RMSNorm AllReduce overlap · 1.28× 延迟降低 · arXiv:2505.11329) §1.(1) 推理引擎内核 ⭐⭐⭐⭐⭐ NET-new;待锚入
2 Stream2LLM(MLSys 2026 · 检索-推理 overlap · append/update 模式) §1.(2) + §1.(3) ⭐⭐⭐⭐ NET-new;待锚入
3 FlexLLM(NSDI 2026 · token 级 co-serving · 3.1× prefill · 4× 吞吐) §1.(2) 推理调度 ⭐⭐⭐⭐ NET-new;待锚入/邻接入库
A SuperInfer NVLink-C2C 5% 利用率发现(P/D 分解软件栈根因) §1.(2) ⭐⭐⭐⭐⭐ 邻接预备
B llm-d CNCF Sandbox v0.7(K8s-native P/D · AWS EFA · 50k tok/s) §1.(2) ⭐⭐⭐⭐ 邻接预备
C NVIDIA Grove + KAI Scheduler(拓扑感知 K8s 调度) §1.(2) ⭐⭐⭐ 邻接预备
D BOute(多目标贝叶斯优化异构 GPU 调度) §1.(2) ⭐⭐⭐ 邻接预备
E SHIP(Groq LPU 全 SRAM 推理管道) §1.(1) ⭐⭐⭐⭐ 邻接预备

与 9-1 evening inference e1prep(5 条主增量 + 3 条邻接候选)对照: - 9-1 增量密度:FlashAttention-4 / ReplaySSM / Silent Hyperparameter / SwiftCache / Albireo(Tri Dao Lab 双料 + 可复现性破公理) - 9-2 增量特征:MLSys 2026 推理系统工程集中涌现(TokenWeave / Stream2LLM / BOute / SHIP)+ NSDI 2026 co-serving 新范式(FlexLLM)+ llm-d CNCF 里程碑 + SuperInfer NVLink 根因发现 - 本棒特征:kernel 级优化(TokenWeave)+ serving 调度创新(Stream2LLM / FlexLLM)+ K8s 原生化(llm-d)——构成"从 kernel 到调度到编排"三层新维度


七、检查过的来源汇总

已检查 / 已纳入本棒

  • organized/knowledge/inference.md(2026-09-02 更新标注 · 约 390 条 arXiv 基线)
  • work-queue.md(2026-09-02 22:00)
  • inbox/tom/2026-09-02T0840-agent-rag-longcontext-radar.md(inference 0 件)
  • inbox/tom/2026-09-02T1440-agent-rag-longcontext-radar.md(inference 0 件)
  • inbox/tom/2026-09-02T2040-agent-rag-longcontext-radar.md(inference 0 件 · RAG 评测新思路邻接)
  • inbox/jay/2026-09-02T1735-jay-ai-engineering-github-hf-vecdb-inference-stack.md(inference 邻接 4 件沿用件)
  • inbox/jay/2026-09-02T2100-jay-evening-briefing-mlsys-llmd-agent-memory.md(MLSys 2026 推理系统工程全系 · 本棒最关键源)
  • inbox/spark/2026-09-02-llm-infra-e1prep.md(0 件 inference NET-new · 1 件 paper_card 邻接入库)
  • inbox/stephen/2026-09-02-1245-coord-check.md(vLLM vs SGLang ~2% 差距 · speculative decoding 无通用赢家)
  • paper_cards/1177-2609-01343.md(SMELT · 主分类 rag)
  • paper_cards/1178-2609-00092.md(Safin-1 · 主分类 risk)
  • paper_cards/1179-2609-00768.md(DiagEvo · 主分类 llm-infra · 2026-09-02 邻接入库)
  • paper_cards/1180-2609-01481.md(Harness-of-Harness · 主分类 evaluation)
  • paper_cards/1181-2609-00188.md(ZimaBlue · 主分类 multimodal)
  • paper_cards/1182-2609-00111.md(Qwen-Drive-1.0 · 主分类 multimodal)
  • paper_cards/1183-2609-00028.md(UI-Venus-2 · 主分类 agent)
  • paper_cards/1158-2608-30478.md(Agents in the Large · 主分类 agent)
  • inbox/tom/2026-09-01-inference-e1prep.md(9-1 参照基线)

已检查 / 未纳入(无 inference 净新增)

  • inbox/jay/2026-09-02T1505-jay-five-category-briefing.md(inference 邻接 11 件均为预备级沿用件)
  • inbox/jay/2026-09-02-ai-engineering-weekly.md(engineering 主轴 · inference 0 件)
  • inbox/jay/2026-09-02-research-briefing.md(research 主轴 · inference 0 件)
  • inbox/spark/2026-09-02-agent-e1prep.md(agent 主轴 · llm-infra 邻接 5 件 · inference 0 件)
  • inbox/flyp/2026-09-02-multimodal-e1prep.md(multimodal 主轴)
  • inbox/flyp/2026-09-02-risk-e1prep.md(risk 主轴 · Safin-1 NET-new)
  • inbox/tom/2026-09-02-rag-e1prep.md(RAG 主轴 · 4 件 RAG net-new 入库)
  • inbox/tom/2026-09-02-evaluation-e1prep.md(evaluation 主轴 · 0 件 NET-new)

Tom · 2026-09-02 22:20 CST · 本棒检查 25+ 来源(tom radar 3 件 + jay 简报 2 件 + spark llm-infra e1prep 1 件 + stephen coord-check 1 件 + paper_cards 8 件 + inference.md 1 件 + work-queue 1 件)· inference 主题 NET-new 3 条(2 条锚入 + 1 条邻接入库)· 邻接预备 6 条供今晚活文档接力参考 · 涉及 arXiv 号 1 件净增(arXiv:2505.11329 TokenWeave)