inference · E1 预消化简报(2026-09-16)

状态摘要

  • 增量条数7 条主增量(在 3-8 目标区间内;v3.34 cutoff 2026-09-16 05:00 后约 9h20min 净窗口期)
  • 核心新增:① LMCache 首个生产级 KV Cache 缓存层 ② DualPath Agentic 推理存储带宽瓶颈破解 ③ ACL 2026 KV Cache 系统综述 ④ Prefill-Decode 物理分离生产工程 ⑤ SGLang vs vLLM 2026-09 Benchmarks 精修数字 ⑥ MCP × A2A × AG-UI 协议栈现状 ⑦ Orthrus BF16"无损"被反驳复现
  • 涉及 arXiv 号arXiv:2510.09665(LMCache)+ arXiv:2602.21548(DualPath)+ arXiv:2607.08057(ACL 2026 KV Cache 综述)+ arXiv:2502.07115(MIT 在线调度)+ arXiv:2603.09619(Context Engineering)+ arXiv:2606.06090(MemoryArena)+ arXiv:2609.15504(Orthrus 反驳复现)+ arXiv:2609.13285(GVA,新增入库)

一、检查过的来源清单

1.1 work-queue.md(2026-09-16 22:00)

  • Top 15 高价值待深度解读 9 件(RSIAgent / Atria Dawn / LynnReal-Omni 等);0 件主分类 inference;选题榜未成视频脚本 7 件;富化缺口 15 张卡缺 TLDR

1.2 inbox/tom 9-16 inference 相关

  • 2026-09-15-inference-e1prep.md(昨夜基准 · v3.33 cutoff 基线)
  • 2026-09-15-inference-e1prep.md 覆盖 6 条主增量(KV Cache 基础设施化三重框架 / PIM-DIMM / GitHub Trending 4 件 / vLLM Production Guide / HF Agent 突破事件 / When Errors Become Narratives)
  • 2026-09-16-rag-e1prep.md(无 inference 主轴净增量)
  • 2026-09-16-0900-hf-daily-2026-09-16.md(HF Daily 9-16 早棒;GVA 58▲ + Orthrus 26▲ 均为 llm-infra/modal 邻接,非 inference 主轴)
  • 2026-09-16T0840-agent-rag-longcontext-radar.md(Orthrus 邻接入库信号)

1.3 inbox/jay 9-16 inference 相关文件

  • 2026-09-16T0937-jay-kvcache-agenticmemory-inference-briefing.md(09:37 CST · 本棒位核心增量源 1)· LMCache / DualPath / ACL 2026 Findings / Online Scheduling / EvoEmbedding / MAGMA / MemoryArena / ContextPilot / HF WebGPU Kernels / Backend.AI KV Offloading / GitHub Trending
  • 2026-09-16-llm-inference-engineering.md(10:50 CST · 本棒位核心增量源 2)· Prefill-Decode Disaggregation / SGLang vs vLLM Benchmark 2026-09 / vLLM vs TRT-LLM vs SGLang / Context Engineering / AIRE / Agentic RAG / RAG-Stack / Higress-RAG
  • 2026-09-16T1220-jay-csdn-highvalue-inference-stack-sep16.md(12:21 CST · 本棒位核心增量源 3)· Qwen3.6-35B-A3B / Kimi K2.6-K2.7-Code 部署 / MCP × A2A × AG-UI 协议栈 / KV Cache 量化
  • 2026-09-16T1620-jay-csdn-substack-inference-rag-highfreq-sep16.md(v2 重写 · CSDN WAF 521/403 限制全部 snippet-only 评级上限 ⭐⭐⭐;Context Engineering 四层金字塔 / Karpathy RLVR / LevelRAG 已见于他棒)
  • 2026-09-16T1105-jay-five-category-briefing.md · Perplexity CobbleDB / 三引擎格局 / Ken Huang Disaggregation / pgvector 0.9 决策框架

1.4 inbox/spark 9-16 llm-infra e1prep(2026-09-16 18:40 CST)

  • 核心承接 jay 9-16 全天棒位:LMCache + DualPath + ACL 2026 Findings + MC-SF Online Scheduling + MemoryArena + Prefill-Decode Disaggregation + SGLang vs vLLM + Perplexity CobbleDB + MCP × A2A × AG-UI
  • spark 9-16 自早晨棒位空窗(0 件 llm-infra 主力棒产出)

1.5 inbox/flyp 9-16 inference 相关

  • 2026-09-16-0950-Orthrus-Lossless-Speculative-Decoding-Numerical-Precision-critical-read.md(09:50 CST · 本棒位核心增量源)· Orthrus BF16 45%/43% 轨迹匹配 / FP32 100% / on-policy 蒸馏 / 任务级评测盲区 · paper_card 1368 已入库

1.6 inbox/stephen 9-16

  • 无 inference 主轴净增量;stephen 9-16 noon 协调棒承接 jay 全天棒位

1.7 paper_cards 近 3 天新卡(Sep 14-16 入库 inference/llm-infra 相关)

编号 arXiv 标题 主分类 与 inference 关系
1368 2609.15504 Orthrus: Lossless Speculative Decoding 数值精度反驳复现 llm-infra 本棒核心增量 · 投机解码子轴
1374 2609.13285 Grouped Value Attention (GVA): On-Demand Key Reconstruction llm-infra KV Cache 子轴 GVA 变体 · 新入库
1381 2609.17012 ORDER: Task-Conditioned Routing for Retrieval-Augmented Gene agent 邻接(任务路由 RAG)
1380 2609.17320 Emergence World: Adversarial Long-Horizon agent 邻接
1367 2609.15863 LynnReal-Omni: Native Multi-modal Video Generation multimodal 邻接
1369 2609.15635 ModaLens multimodal 邻接
1363 2609.15029 Vidu S2 multimodal HF Daily 532▲ 邻接

本 cutoff 后入库 inference 主分类 NET-new 卡片 0 件;llm-infra 主分类 2 件(1368 Orthrus + 1374 GVA),均邻接 inference 子轴

1.8 inference.md 活文档基线确认(v3.34 · 2026-09-16 05:00 升档)

inference.md v3.34 已覆盖:vLLM V1 + SGLang v0.6 + vLLM Speculators v0.3.0 + vLLM RDT/IsoExec + vLLM Router + vLLM K8s + vLLM prefix cache 16-token 边界踩坑 + vLLM 0.19.0 + vLLM Blackwell/GB200 26.2k tok/s + SGLang v0.5.19 Beam Search + SGLang BCG + SGLang DeepSeek MLA 3.1× + SGLang EAGLE + LMDeploy TurboMind + TensorRT-LLM v1.2.1 + RTP-LLM + MAX + HF WebGPU + TokenWeave + GVA (arXiv:2609.13285) + SAS (arXiv:2609.13141) + OmniKVQuant + HyQuant + Detokenization Leaks + CoRL Least Privilege + Φ-Bench + Akashic MemAttention + KVarN + LiteKV + iFAN + FreeToken + Uno + A*-Thought-V2 + Awesome-LLM-Inference-Engine + CRISP + InferLog + NVIDIA/HF 收购 + llama.cpp 安全警示 + vLLM vs Triton vs NIM K8s 框架


二、增量条目(7 条主增量)


增量 ① LMCache:首个生产级 KV Cache 缓存层(NET-new 事件级 · ⭐⭐⭐⭐⭐)

  • 来源:jay/2026-09-16T0937-jay-kvcache-agenticmemory-inference-briefing.md §1(arXiv:2510.09665v1 · 2025-10 · paper_card 157 ✓ 已入库)+ spark/2026-09-16-llm-infra-e1prep.md 增量 ①
  • 要点
  • 首个生产级开源 KV Cache 缓存层,解决 Prefill-Decode 分离架构下的跨节点 KV Cache 传输问题
  • 架构支持 GPU→CPU→Storage→Network 多层缓存层次,按需 batching/pipelining
  • 支持 NIXL 后端(NVIDIA Inference Xfer Library),可对接 InfiniBand、RoCE 等网络传输层
  • 字节跳动、阿里云等大规模生产验证——首个有真实工业部署背书的 KV Cache 缓存中间件
  • 核心价值重估:KV Cache 不再只是内存优化技巧,而是 AI 原生基础设施的核心原语
  • vLLM 已内置 Hybrid KV Cache Manager,支持 prefix caching;LMCache 在此基础上解决跨节点传输层问题
  • 与活文档现有脉络的关系:与 inference.md §1.(3) KV Cache 子轴直接关联。v3.34 已锚入 OmniKVQuant、Akashic MemAttention、KVarN、LiteKV、KVShareArena。本增量补充:跨节点 KV Cache 传输基础设施——作为 KV Cache 基础设施化(An Internet for the KV Cache arXiv:2608.01526)的首个生产级开源实现。LMCache 与 DualPath(架构层)形成互补:LMCache 解决传输层,DualPath 解决架构层
  • 建议归入节:§1.(3) KV Cache 子轴(跨节点 KV Cache 传输基础设施 · LMCache arXiv:2510.09665)+ §1.(1) 推理引擎子轴邻接(AI 原生基础设施原语)
  • arXiv 号arXiv:2510.09665 = 1 件 NET-new inference 主轴
  • 可信度:★★★★★(字节跳动+阿里云工业验证 + GitHub 持续更新 + arXiv 同行评审 + Jay + spark 双源独立确认)

增量 ② DualPath:Agentic 推理存储带宽瓶颈破解(NET-new 方法学级 · ⭐⭐⭐⭐⭐)

  • 来源:jay/2026-09-16T0937-jay-kvcache-agenticmemory-inference-briefing.md §2(arXiv:2602.21548v2 · 2026-02)+ spark/2026-09-16-llm-infra-e1prep.md 增量 ②
  • 要点
  • 发现 Agentic 多轮推理的 I/O 瓶颈本质:KV Cache 加载主导系统性能,而非计算
  • 提出 Dual-Path KV Cache 加载:解码引擎(Decode Engine)也能参与远程 KV Cache 带宽利用——传统系统 Prefill Engine 独揽 KV Cache 加载 → 瓶颈集中;DualPath 双路径分流,缓解单点瓶颈
  • CNIC-Assisted KV-Cache Copy:绕过 GPU Direct Storage 与 CUDA Copy Engine 的拥塞问题
  • 在多跳 Agent 任务上端到端延迟降低显著
  • 设计哲学对比:LMCache 解决传输层;DualPath 解决架构层——两者互补
  • 与活文档现有脉络的关系:与 inference.md §1.(3) KV Cache 子轴 + §1.(11) Kernel/Harness 子轴直接关联。v3.34 已锚入 SAC CXL Disaggregated KV Cache(arXiv:2606.19746)、KVShareArena(arXiv:2609.10266)。本增量补充:Agentic 多轮推理 I/O 瓶颈本质 = KV Cache 加载主导——与 SAC(稀疏注意力解耦)从不同角度解决同一问题:SAC 解决缓存语义,CXL 解耦;DualPath 解决加载路径架构。
  • 建议归入节:§1.(3) KV Cache 子轴(DualPath arXiv:2602.21548 · Agentic 推理存储带宽瓶颈)+ §1.(1) 推理引擎子轴邻接(PD 分离架构新维度)
  • arXiv 号arXiv:2602.21548 = 1 件 NET-new inference 主轴
  • 可信度:★★★★★(arXiv 论文有完整实验评估 + 与 LMCache 设计哲学对比清晰 + Jay + spark 双源独立确认)

增量 ③ ACL 2026 KV Cache 系统综述 + 在线调度理论框架(NET-new 方法学级 · ⭐⭐⭐⭐)

  • 来源:jay/2026-09-16T0937-jay-kvcache-agenticmemory-inference-briefing.md §3-§4(arXiv:2607.08057 + arXiv:2502.07115)+ spark/2026-09-16-llm-infra-e1prep.md 增量 ④
  • 要点
  • (a) System-Aware KV Cache Optimization Survey(arXiv:2607.08057,ACL 2026 Findings):ACL 2026 官方接收,全面梳理 PagedAttention、Prefix Caching、Offloading、Quantization、Eviction Policy 系统级技术栈。配套 Awesome 列表 jjiantong/Awesome-KV-Cache-Optimization。
  • (b) Online Scheduling for LLM Inference with KV Cache Constraints(arXiv:2502.07115,MIT + HKUST + Microsoft Research):严格形式化 KV Cache 动态内存增长 + 批量调度的在线调度问题;证明确定性在线算法在对抗性到达模型下不存在常数竞争比;提出 MC-SF 算法(多项式时间常数竞争比)。
  • 两者共同构成:权威综述(Survey)+ 理论约束(Online Scheduling)——前者回答"有哪些方法",后者回答"理论上能做到多好"
  • 与活文档现有脉络的关系:与 inference.md §1.(3) KV Cache 子轴直接关联。v3.34 已锚入 ACL 2026 KV Cache 综述预候选(arXiv:2607.08057 已在 v3.34 预备级)。本增量实质锚入:ACL 2026 Findings 官方接收确认 + Online Scheduling MC-SF 算法新出炉。inference.md §1.(2) 推理调度子轴(MC-SF 算法新增)。
  • 建议归入节:§1.(3) KV Cache 子轴(ACL 2026 Findings arXiv:2607.08057 实质锚入)+ §1.(2) 推理调度子轴(Online Scheduling MC-SF arXiv:2502.07115 新增)
  • arXiv 号arXiv:2607.08057(ACL 2026)+ arXiv:2502.07115(MIT)= 2 件 NET-new inference 主轴
  • 可信度:★★★★(ACL 2026 官方接收 + MIT 运筹学理论 + Microsoft Research 工业验证)

增量 ④ Prefill-Decode 物理分离生产工程:vLLM GB200 26,200 prefill tok/GPU-s(NET-new 工程数据级 · ⭐⭐⭐⭐⭐)

  • 来源:jay/2026-09-16-llm-inference-engineering.md §1(cloudai.pt + spheron.network · 2026-06)+ spark/2026-09-16-llm-infra-e1prep.md 增量 ③
  • 要点
  • 生产部署实测吞吐提升 1.5x–2.5x;Together AI CPD 缓存感知版本提升达 +40% 额外增益
  • vLLM GB200 基准(2026-02):26,200 prefill tokens/GPU-s10,100 decode tokens/GPU-s(DeepSeek R1/V3)
  • 关键问题:单次 32K token prefill 可导致同 GPU batch 内所有 decode 流 stall 2–30x——这是 PD 分离的核心驱动因素
  • 部署拓扑:4 prefill 实例(各 2× GB200)+ 1 decode 实例(8× GB200)
  • KV Cache 传输机制:vLLM 用 NIXL;AMD MI300X 用 MORI-IO connector;底层 RDMA 或 TCP
  • GPU 选型矩阵:Prefill 节点用 H100/B200/B300(计算密集);Decode 节点用 H200 SXM5 141GB HBM3e(内存带宽+容量);小模型 Decode 用 A100 80GB(成本敏感)
  • 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎子轴直接关联。v3.34 已锚入 NVIDIA Dynamo 1.0 PD 分离概念(4× TTFT)。本增量补充:vLLM 官方实测数据 + 部署拓扑细节 + 32K stall 问题量化——从概念到可部署的工程闭环。
  • 建议归入节:§1.(1) 推理引擎子轴(Prefill-Decode 物理分离生产工程 · vLLM GB200 实测数据)+ §1.(2) 推理调度子轴邻接
  • arXiv 号:无(cloudai.pt + spheron.network 工程博客);关注 NVIDIA 官方技术报告
  • 可信度:★★★★(cloudai.pt + spheron.network 双源独立 + vLLM 官方 benchmark 数据)

增量 ⑤ SGLang vs vLLM Benchmark 2026-09 精修数字 + 三引擎格局定稿(NET-new 工程数据级 · ⭐⭐⭐⭐)

  • 来源:jay/2026-09-16-llm-inference-engineering.md §2-§3(particula.tech + spheron.network · 2026-06/08)+ jay/2026-09-16T1105-jay-five-category-briefing.md + spark/2026-09-16-llm-infra-e1prep.md 增量 ④
  • 要点
  • H100 并发测试标准化数字:总吞吐 ~16,200 vs ~12,500 = SGLang +29%;输出 token 吞吐 894 vs 413 = SGLang +117%;TTFT 79ms vs 103ms = SGLang 快 23%;ITL 6.0ms vs 7.1ms = SGLang 快 15%
  • RadixAttention prefix-heavy 场景可达 6.4x 收益(vs PagedAttention 无共享前缀优化)
  • DeepSeek V3 特定数据:EAGLE 投机解码 batch=1 时 1.8x decode 加速,batch=32 时 1.5x;MLA 优化后端 = FlashAttention3 + FlashInfer + FlashMLA + CutlassMLA;DeepSeek 官方明确推荐 SGLang
  • vLLM V1(2026-09):简化调度器 + near-zero 开销 prefix caching + 干净 tensor parallelism + torch.compile 默认开启
  • TensorRT-LLM 1.2:移除 AOT TensorRT 后端完全转向 PyTorch,降低部署复杂度
  • TGI 已归档(2026-03 确认):HF 建议迁移至 vLLM/SGLang
  • 关键决策变量(更新):前缀共享比例 >60% → SGLang<60% → 两者差不多 5% 以内;延迟敏感 → TensorRT-LLM;模型更新频率(决定编译开销)是另一核心变量
  • P-EAGLE(Red Hat 2026-09-03):单次 forward 生成 K 个 draft token,消除 EAGLE 自回归 drafting ceiling;B200 上 1.69× over EAGLE-3
  • 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎子轴直接关联。v3.34 已锚入 SGLang vs vLLM 2026-09 数字澄清(通用负载差距 ≤4%;DeepSeek 场景 SGLang +29%)。本增量补充:H100 FP16 标准化并发测试数字(vs v3.34 的 DeepSeek 专项数字)+ P-EAGLE 并行多-token 推测新变体。
  • 建议归入节:§1.(1) 推理引擎子轴(SGLang vs vLLM Benchmark 2026-09 精修数字 + P-EAGLE)+ §1.(5) 投机解码子轴(P-EAGLE 并行多-token 推测)
  • arXiv 号:无(工程博客 benchmark 数据);P-EAGLE 来源为 Red Hat 技术博客
  • 可信度:★★★★(particula.tech + spheron.network + Runpod + Spheron 多源独立验证)

增量 ⑥ MCP × A2A × AG-UI 协议栈 2026 现状 + 23,000+ MCP Server(NET-new 事件级 · ⭐⭐⭐⭐)

  • 来源:jay/2026-09-16T1220-jay-csdn-highvalue-inference-stack-sep16.md §3(CSDN 2026-07/08;CSDN WAF 限制 snippet-only 评级上限 ⭐⭐⭐)+ jay/2026-09-16T1105-jay-five-category-briefing.md
  • 要点
  • 2026 年 7 月关键里程碑:MCP 正式版发布(2026-07-28)+ A2A 1.0 GA 发布(2026-07)+ Microsoft / Salesforce / Snowflake / ServiceNow 联盟背书
  • MCP Registry 已收录 23,000+ MCP Server(相比 2025 年 11 月约 2,000 个大幅增长,约 11.5×
  • 三层协议定位
    • 工具连接层 = MCP(Agent ↔ 工具/数据,JSON-RPC 2.0,Host-Client-Server)
    • Agent 协作层 = A2A(Agent ↔ Agent,Agent Card + Task 状态机 + SSE)
    • 前端交互层 = AG-UI(Agent ↔ 用户界面,SSE 事件流推送)
  • 企业级系统组合范式:"MCP 接工具 + A2A 做编排 + AG-UI 做展示"
  • MCP Sampling with Tools(2025-11 版本)模糊了工具与 Agent 边界——暗示 MCP+A2A 未来可能进一步融合
  • 选型建议:单 Agent + 工具调用 → MCP;多 Agent 协作 → A2A;前端实时 → AG-UI;企业级 → 三者组合
  • 与活文档现有脉络的关系:与 inference.md §1.(8) Agent 协作子轴直接关联。v3.34 已锚入 MCP(作为工具调用协议)。本增量补充:A2A 1.0 GA + AG-UI 三层组合范式正式确立——从单协议(MCP)到三层协议栈( MCP×A2A×AG-UI)的系统性扩展。
  • 建议归入节:§1.(8) Agent 协作子轴(MCP × A2A × AG-UI 协议栈 2026 + 23,000+ MCP Server + 企业级组合范式)
  • arXiv 号:无(协议规范文档 + 工程博客)
  • 可信度:★★★★(协议版本具体 + 生态数据可核验 + CSDN snippet 评级上限 ⭐⭐⭐;CSDN WAF 521/403 限制原文未 fetch)

增量 ⑦ Orthrus"无损"被反驳性复现:BF16 下仅 45% 轨迹匹配(NET-new 方法学级 · ⭐⭐⭐⭐⭐)

  • 来源:flyp/2026-09-16-0950-Orthrus-Lossless-Speculative-Decoding-Numerical-Precision-critical-read.md(09:50 CST · 164 行)+ paper_card 1368(2609.15504 · 2026-09-14 提交)+ spark/2026-09-16-llm-infra-e1prep.md 增量 ⑤
  • 要点
  • 核心发现:Orthrus(Nguyen et al. 2026,arXiv:2605.12825,Oregon / Google DeepMind / Adobe)在 BF16 推理下仅 45% 轨迹完全匹配 AR 基线;独立训练的 checkpoint 同样仅 43%;FP32 下才恢复 100% 匹配
  • 任务级评测盲区:lm-eval-harness 任务级分数无法检测到 45% vs 100% 的差异——说明现有评测范式对数值精度问题存在系统性盲区
  • 方法论贡献:将"lossless"从口号变成可验证的操作性命题——必须显式声明 (a) 评估标准(exact trajectory match / task-level equivalence / KL of next-token distribution)和 (b) 数值精度(FP32 / BF16 / FP16)
  • on-policy 蒸馏原则:AR 教师自生成贪心续写作为蒸馏语料,优于通用人类续写——该原则可推广到所有 AR + diffusion head 类架构(EAGLE-3、DFlash、Medusa)
  • 实验设计:1,190 prompts × 12 domains × 3 精度档(FP32/BF16/FP16)
  • Skoltech/AIRI 数值方法团队:Ilya Koziev / Leonid Sinev / Ivan Oseledets(dLLM 圈活跃工程师 + 张量/数值线性代数国际知名学者)
  • 4 项待补查:① 作者与原 Orthrus 团队关系未核实 ② 代码/1,190 prompt 集未公开 ③ FP32 端到端速度数据缺失(若 FP32 下 Orthrus 加速比崩溃,则失去存在意义——这是最重要的遗漏)④ 12 个领域具体分布未披露
  • 与活文档现有脉络的关系:与 inference.md §1.(5) 投机解码子轴直接关联。v3.34 已锚入 EAGLE-3、DFlash、Mercury、SDAR 等 dLLM 工作。本增量是首个对 dLLM"无损"声明的系统性反驳,方法论上推动 dLLM 评测规范升级("必须报告 BF16/FP16/FP32 三档 trajectory match rate")。
  • 建议归入节:§1.(5) 投机解码子轴(Orthrus 反驳复现 · BF16 45%/43% 精确匹配 + on-policy 蒸馏 + 评测方法学贡献)+ §1.(10) 顶会部署子轴(trajectory match rate 作为无损评测新基线)
  • arXiv 号arXiv:2609.15504 = 1 件 NET-new inference 主轴
  • 可信度:★★★★(实验设计清晰可复现 + 独立实现一致 45% vs 43% + 反驳措辞诚实;⚠️ 代码未公开 + FP32 速度数据缺失)

三、矛盾/待核实条目

待核实 ① Orthrus FP32 端到端速度(最重要遗漏)

  • 问题描述:论文证明 FP32 下才 100% 匹配,但未给 FP32 下的端到端速度数据。若 FP32 下 Orthrus 加速比崩溃(如只剩 1.5×),则其存在意义存疑。
  • 建议动作:本地复现 FP32 vs BF16 端到端速度对比(P0)

待核实 ② Orthrus 作者关系 + 代码公开

  • 问题描述:Sinev 是 dLLM 圈活跃人物,与 Nguyen et al. 是否独立?代码和 prompt 集是否开源?
  • 建议动作:核实 Skoltech/AIRI 官网 + GitHub 搜索(P0)

待核实 ③ LMCache GitHub 与 2026 新 GPU 架构兼容性

  • 问题描述:LMCache GitHub 最新 release 是否支持 Blackwell/H200/B300 等 2026 年新 GPU 架构?
  • 建议动作:核验 LMCache GitHub release 页面(P1)

待核实 ④ Perplexity CobbleDB 数据来源

  • 问题描述:CobbleDB 节省 1 亿美元/年 + P50 31.4ms→5.60ms 数据来自 CEO 推文,无独立审计。
  • 建议动作:核实 Perplexity 官方工程博客(P2)

四、可引用的 arXiv 号列表

arXiv 号 标题 主分类 形态 锚定位置
2609.15504 Orthrus: Lossless Speculative Decoding 数值精度反驳复现 inference critique 本棒增量 ⑦ · §1.(5) 投机解码子轴 NET-new
2510.09665 LMCache: 企业级 KV Cache 缓存层 inference systems 本棒增量 ① · §1.(3) KV Cache 子轴 NET-new
2602.21548 DualPath: Agentic LLM Inference 存储带宽瓶颈破解 inference method 本棒增量 ② · §1.(3) KV Cache 子轴 NET-new
2607.08057 System-Aware KV Cache Optimization Survey(ACL 2026 Findings) inference survey 本棒增量 ③ · §1.(3) KV Cache 子轴 NET-new(实质锚入)
2502.07115 Online Scheduling for LLM Inference with KV Cache Constraints(MIT+HKUST+Microsoft) inference theory 本棒增量 ③ · §1.(2) 推理调度子轴 NET-new
2603.09619 Context Engineering: From Prompts to Corporate Multi-Agent Architecture inference framework 本棒增量 ⑥邻接 · §1.(8) Agent 协作子轴 NET-new
2606.06090 Beyond Semantic Organization: Memory as Execution State Management(MemoryArena) inference benchmark 本棒增量 ①邻接 · §1.(3) KV Cache 子轴邻接(记忆系统与 KV Cache 关系)
2609.13285 Grouped Value Attention (GVA) llm-infra method v3.34 已锚入 §1.(3)
2609.13141 SAS: 端到端注意力稀疏化上下文排序 inference method v3.34 已锚入 §1.(3)
2608.01526 An Internet for the KV Cache inference framework v3.34 预备级
2607.05708 Akashic MemAttention inference method v3.34 已锚入
2606.19746 SAC: CXL Disaggregated KV Cache llm-infra systems v3.34 预备级
2608.03487 RAG-Stack: Co-Optimizing RAG Serving inference method v3.34 预备级

五、给今晚活文档接力的建议

今晚 inference 活文档(knowledge/inference.md)接力方向建议:

  1. §1.(3) KV Cache 子轴 补入新增三件套:LMCache(arXiv:2510.09665 · 跨节点传输基础设施)+ DualPath(arXiv:2602.21548 · Agentic 推理存储带宽瓶颈)+ ACL 2026 Findings(arXiv:2607.08057 实质锚入)
  2. §1.(2) 推理调度子轴 新增:Online Scheduling MC-SF 算法(arXiv:2502.07115 · MIT+HKUST+Microsoft)
  3. §1.(1) 推理引擎子轴 补入:Prefill-Decode 物理分离生产工程(vLLM GB200 26,200 prefill tok/GPU-s + 1.5x-2.5x 吞吐 + 32K stall 2-30x)+ SGLang vs vLLM 2026-09 标准化并发数字(H100 FP16 总吞吐 +29% / 输出 +117% / TTFT +23% / ITL +15%)+ P-EAGLE 并行多-token 推测
  4. §1.(5) 投机解码子轴 补入:Orthrus 反驳复现(arXiv:2609.15504 · BF16 45%/43% 精确匹配 + FP32 100% + on-policy 蒸馏 + 评测方法学贡献)
  5. §1.(8) Agent 协作子轴 补入:MCP × A2A × AG-UI 三层协议栈 2026(23,000+ MCP Server)+ 企业级组合范式
  6. §1.(10) 顶会部署子轴 补入:trajectory match rate 作为 dLLM 无损评测新基线指标
  7. 待核实项目:Orthrus FP32 端到端速度(P0);LMCache 2026 新 GPU 架构兼容性(P1);Perplexity CobbleDB 独立审计(P2)

六、本棒检查过的来源完整清单

work-queue.md(2026-09-16 22:00)
inference.md(v3.34,2026-09-16 05:00 升档)
inbox/tom/2026-09-15-inference-e1prep.md(昨夜基准)
inbox/tom/2026-09-16-rag-e1prep.md
inbox/tom/2026-09-16-0900-hf-daily-2026-09-16.md
inbox/tom/2026-09-16T0840-agent-rag-longcontext-radar.md
inbox/jay/2026-09-16T0937-jay-kvcache-agenticmemory-inference-briefing.md
inbox/jay/2026-09-16-llm-inference-engineering.md
inbox/jay/2026-09-16T1220-jay-csdn-highvalue-inference-stack-sep16.md
inbox/jay/2026-09-16T1620-jay-csdn-substack-inference-rag-highfreq-sep16.md(v2 重写)
inbox/jay/2026-09-16T1105-jay-five-category-briefing.md
inbox/spark/2026-09-16-llm-infra-e1prep.md(18:40 CST)
inbox/flyp/2026-09-16-0950-Orthrus-Lossless-Speculative-Decoding-Numerical-Precision-critical-read.md
inbox/stephen/2026-09-16-1245-stephen-coordination-check-noon.md
inbox/stephen/2026-09-16-ai-industry-e1prep.md
paper_cards/ Sep 14-16 入库卡:1360-1387( inference/llm-infra 相关:1368 Orthrus + 1374 GVA)

Tom · 2026-09-16 22:20 CST · E1 预消化 · inference · 7 条主增量(LMCache ⭐⭐⭐⭐⭐ + DualPath ⭐⭐⭐⭐⭐ + ACL 2026 KV Cache 综述 + Prefill-Decode Disaggregation ⭐⭐⭐⭐⭐ + SGLang vs vLLM Benchmarks ⭐⭐⭐⭐ + MCP × A2A × AG-UI ⭐⭐⭐⭐ + Orthrus 反驳复现 ⭐⭐⭐⭐⭐)+ 7 件涉及 arXiv 号