inference · E1 预消化简报(2026-09-16)
状态摘要
- 增量条数:7 条主增量(在 3-8 目标区间内;v3.34 cutoff 2026-09-16 05:00 后约 9h20min 净窗口期)
- 核心新增:① LMCache 首个生产级 KV Cache 缓存层 ② DualPath Agentic 推理存储带宽瓶颈破解 ③ ACL 2026 KV Cache 系统综述 ④ Prefill-Decode 物理分离生产工程 ⑤ SGLang vs vLLM 2026-09 Benchmarks 精修数字 ⑥ MCP × A2A × AG-UI 协议栈现状 ⑦ Orthrus BF16"无损"被反驳复现
- 涉及 arXiv 号:
arXiv:2510.09665(LMCache)+arXiv:2602.21548(DualPath)+arXiv:2607.08057(ACL 2026 KV Cache 综述)+arXiv:2502.07115(MIT 在线调度)+arXiv:2603.09619(Context Engineering)+arXiv:2606.06090(MemoryArena)+arXiv:2609.15504(Orthrus 反驳复现)+arXiv:2609.13285(GVA,新增入库)
一、检查过的来源清单
1.1 work-queue.md(2026-09-16 22:00)
- Top 15 高价值待深度解读 9 件(RSIAgent / Atria Dawn / LynnReal-Omni 等);0 件主分类 inference;选题榜未成视频脚本 7 件;富化缺口 15 张卡缺 TLDR
1.2 inbox/tom 9-16 inference 相关
2026-09-15-inference-e1prep.md(昨夜基准 · v3.33 cutoff 基线)2026-09-15-inference-e1prep.md覆盖 6 条主增量(KV Cache 基础设施化三重框架 / PIM-DIMM / GitHub Trending 4 件 / vLLM Production Guide / HF Agent 突破事件 / When Errors Become Narratives)2026-09-16-rag-e1prep.md(无 inference 主轴净增量)2026-09-16-0900-hf-daily-2026-09-16.md(HF Daily 9-16 早棒;GVA 58▲ + Orthrus 26▲ 均为 llm-infra/modal 邻接,非 inference 主轴)2026-09-16T0840-agent-rag-longcontext-radar.md(Orthrus 邻接入库信号)
1.3 inbox/jay 9-16 inference 相关文件
2026-09-16T0937-jay-kvcache-agenticmemory-inference-briefing.md(09:37 CST · 本棒位核心增量源 1)· LMCache / DualPath / ACL 2026 Findings / Online Scheduling / EvoEmbedding / MAGMA / MemoryArena / ContextPilot / HF WebGPU Kernels / Backend.AI KV Offloading / GitHub Trending2026-09-16-llm-inference-engineering.md(10:50 CST · 本棒位核心增量源 2)· Prefill-Decode Disaggregation / SGLang vs vLLM Benchmark 2026-09 / vLLM vs TRT-LLM vs SGLang / Context Engineering / AIRE / Agentic RAG / RAG-Stack / Higress-RAG2026-09-16T1220-jay-csdn-highvalue-inference-stack-sep16.md(12:21 CST · 本棒位核心增量源 3)· Qwen3.6-35B-A3B / Kimi K2.6-K2.7-Code 部署 / MCP × A2A × AG-UI 协议栈 / KV Cache 量化2026-09-16T1620-jay-csdn-substack-inference-rag-highfreq-sep16.md(v2 重写 · CSDN WAF 521/403 限制全部 snippet-only 评级上限 ⭐⭐⭐;Context Engineering 四层金字塔 / Karpathy RLVR / LevelRAG 已见于他棒)2026-09-16T1105-jay-five-category-briefing.md· Perplexity CobbleDB / 三引擎格局 / Ken Huang Disaggregation / pgvector 0.9 决策框架
1.4 inbox/spark 9-16 llm-infra e1prep(2026-09-16 18:40 CST)
- 核心承接 jay 9-16 全天棒位:LMCache + DualPath + ACL 2026 Findings + MC-SF Online Scheduling + MemoryArena + Prefill-Decode Disaggregation + SGLang vs vLLM + Perplexity CobbleDB + MCP × A2A × AG-UI
- spark 9-16 自早晨棒位空窗(0 件 llm-infra 主力棒产出)
1.5 inbox/flyp 9-16 inference 相关
2026-09-16-0950-Orthrus-Lossless-Speculative-Decoding-Numerical-Precision-critical-read.md(09:50 CST · 本棒位核心增量源)· Orthrus BF16 45%/43% 轨迹匹配 / FP32 100% / on-policy 蒸馏 / 任务级评测盲区 · paper_card 1368 已入库
1.6 inbox/stephen 9-16
- 无 inference 主轴净增量;stephen 9-16 noon 协调棒承接 jay 全天棒位
1.7 paper_cards 近 3 天新卡(Sep 14-16 入库 inference/llm-infra 相关)
| 编号 | arXiv | 标题 | 主分类 | 与 inference 关系 |
|---|---|---|---|---|
| 1368 | 2609.15504 | Orthrus: Lossless Speculative Decoding 数值精度反驳复现 | llm-infra | 本棒核心增量 · 投机解码子轴 |
| 1374 | 2609.13285 | Grouped Value Attention (GVA): On-Demand Key Reconstruction | llm-infra | KV Cache 子轴 GVA 变体 · 新入库 |
| 1381 | 2609.17012 | ORDER: Task-Conditioned Routing for Retrieval-Augmented Gene | agent | 邻接(任务路由 RAG) |
| 1380 | 2609.17320 | Emergence World: Adversarial Long-Horizon | agent | 邻接 |
| 1367 | 2609.15863 | LynnReal-Omni: Native Multi-modal Video Generation | multimodal | 邻接 |
| 1369 | 2609.15635 | ModaLens | multimodal | 邻接 |
| 1363 | 2609.15029 | Vidu S2 | multimodal | HF Daily 532▲ 邻接 |
本 cutoff 后入库 inference 主分类 NET-new 卡片 0 件;llm-infra 主分类 2 件(1368 Orthrus + 1374 GVA),均邻接 inference 子轴
1.8 inference.md 活文档基线确认(v3.34 · 2026-09-16 05:00 升档)
inference.md v3.34 已覆盖:vLLM V1 + SGLang v0.6 + vLLM Speculators v0.3.0 + vLLM RDT/IsoExec + vLLM Router + vLLM K8s + vLLM prefix cache 16-token 边界踩坑 + vLLM 0.19.0 + vLLM Blackwell/GB200 26.2k tok/s + SGLang v0.5.19 Beam Search + SGLang BCG + SGLang DeepSeek MLA 3.1× + SGLang EAGLE + LMDeploy TurboMind + TensorRT-LLM v1.2.1 + RTP-LLM + MAX + HF WebGPU + TokenWeave + GVA (arXiv:2609.13285) + SAS (arXiv:2609.13141) + OmniKVQuant + HyQuant + Detokenization Leaks + CoRL Least Privilege + Φ-Bench + Akashic MemAttention + KVarN + LiteKV + iFAN + FreeToken + Uno + A*-Thought-V2 + Awesome-LLM-Inference-Engine + CRISP + InferLog + NVIDIA/HF 收购 + llama.cpp 安全警示 + vLLM vs Triton vs NIM K8s 框架
二、增量条目(7 条主增量)
增量 ① LMCache:首个生产级 KV Cache 缓存层(NET-new 事件级 · ⭐⭐⭐⭐⭐)
- 来源:jay/2026-09-16T0937-jay-kvcache-agenticmemory-inference-briefing.md §1(arXiv:2510.09665v1 · 2025-10 · paper_card 157 ✓ 已入库)+ spark/2026-09-16-llm-infra-e1prep.md 增量 ①
- 要点:
- 首个生产级开源 KV Cache 缓存层,解决 Prefill-Decode 分离架构下的跨节点 KV Cache 传输问题
- 架构支持 GPU→CPU→Storage→Network 多层缓存层次,按需 batching/pipelining
- 支持 NIXL 后端(NVIDIA Inference Xfer Library),可对接 InfiniBand、RoCE 等网络传输层
- 字节跳动、阿里云等大规模生产验证——首个有真实工业部署背书的 KV Cache 缓存中间件
- 核心价值重估:KV Cache 不再只是内存优化技巧,而是 AI 原生基础设施的核心原语
- vLLM 已内置 Hybrid KV Cache Manager,支持 prefix caching;LMCache 在此基础上解决跨节点传输层问题
- 与活文档现有脉络的关系:与 inference.md §1.(3) KV Cache 子轴直接关联。v3.34 已锚入 OmniKVQuant、Akashic MemAttention、KVarN、LiteKV、KVShareArena。本增量补充:跨节点 KV Cache 传输基础设施——作为 KV Cache 基础设施化(An Internet for the KV Cache arXiv:2608.01526)的首个生产级开源实现。LMCache 与 DualPath(架构层)形成互补:LMCache 解决传输层,DualPath 解决架构层。
- 建议归入节:§1.(3) KV Cache 子轴(跨节点 KV Cache 传输基础设施 · LMCache arXiv:2510.09665)+ §1.(1) 推理引擎子轴邻接(AI 原生基础设施原语)
- arXiv 号:
arXiv:2510.09665= 1 件 NET-new inference 主轴 - 可信度:★★★★★(字节跳动+阿里云工业验证 + GitHub 持续更新 + arXiv 同行评审 + Jay + spark 双源独立确认)
增量 ② DualPath:Agentic 推理存储带宽瓶颈破解(NET-new 方法学级 · ⭐⭐⭐⭐⭐)
- 来源:jay/2026-09-16T0937-jay-kvcache-agenticmemory-inference-briefing.md §2(arXiv:2602.21548v2 · 2026-02)+ spark/2026-09-16-llm-infra-e1prep.md 增量 ②
- 要点:
- 发现 Agentic 多轮推理的 I/O 瓶颈本质:KV Cache 加载主导系统性能,而非计算
- 提出 Dual-Path KV Cache 加载:解码引擎(Decode Engine)也能参与远程 KV Cache 带宽利用——传统系统 Prefill Engine 独揽 KV Cache 加载 → 瓶颈集中;DualPath 双路径分流,缓解单点瓶颈
- CNIC-Assisted KV-Cache Copy:绕过 GPU Direct Storage 与 CUDA Copy Engine 的拥塞问题
- 在多跳 Agent 任务上端到端延迟降低显著
- 设计哲学对比:LMCache 解决传输层;DualPath 解决架构层——两者互补
- 与活文档现有脉络的关系:与 inference.md §1.(3) KV Cache 子轴 + §1.(11) Kernel/Harness 子轴直接关联。v3.34 已锚入 SAC CXL Disaggregated KV Cache(arXiv:2606.19746)、KVShareArena(arXiv:2609.10266)。本增量补充:Agentic 多轮推理 I/O 瓶颈本质 = KV Cache 加载主导——与 SAC(稀疏注意力解耦)从不同角度解决同一问题:SAC 解决缓存语义,CXL 解耦;DualPath 解决加载路径架构。
- 建议归入节:§1.(3) KV Cache 子轴(DualPath arXiv:2602.21548 · Agentic 推理存储带宽瓶颈)+ §1.(1) 推理引擎子轴邻接(PD 分离架构新维度)
- arXiv 号:
arXiv:2602.21548= 1 件 NET-new inference 主轴 - 可信度:★★★★★(arXiv 论文有完整实验评估 + 与 LMCache 设计哲学对比清晰 + Jay + spark 双源独立确认)
增量 ③ ACL 2026 KV Cache 系统综述 + 在线调度理论框架(NET-new 方法学级 · ⭐⭐⭐⭐)
- 来源:jay/2026-09-16T0937-jay-kvcache-agenticmemory-inference-briefing.md §3-§4(arXiv:2607.08057 + arXiv:2502.07115)+ spark/2026-09-16-llm-infra-e1prep.md 增量 ④
- 要点:
- (a) System-Aware KV Cache Optimization Survey(arXiv:2607.08057,ACL 2026 Findings):ACL 2026 官方接收,全面梳理 PagedAttention、Prefix Caching、Offloading、Quantization、Eviction Policy 系统级技术栈。配套 Awesome 列表 jjiantong/Awesome-KV-Cache-Optimization。
- (b) Online Scheduling for LLM Inference with KV Cache Constraints(arXiv:2502.07115,MIT + HKUST + Microsoft Research):严格形式化 KV Cache 动态内存增长 + 批量调度的在线调度问题;证明确定性在线算法在对抗性到达模型下不存在常数竞争比;提出 MC-SF 算法(多项式时间常数竞争比)。
- 两者共同构成:权威综述(Survey)+ 理论约束(Online Scheduling)——前者回答"有哪些方法",后者回答"理论上能做到多好"
- 与活文档现有脉络的关系:与 inference.md §1.(3) KV Cache 子轴直接关联。v3.34 已锚入 ACL 2026 KV Cache 综述预候选(arXiv:2607.08057 已在 v3.34 预备级)。本增量实质锚入:ACL 2026 Findings 官方接收确认 + Online Scheduling MC-SF 算法新出炉。inference.md §1.(2) 推理调度子轴(MC-SF 算法新增)。
- 建议归入节:§1.(3) KV Cache 子轴(ACL 2026 Findings arXiv:2607.08057 实质锚入)+ §1.(2) 推理调度子轴(Online Scheduling MC-SF arXiv:2502.07115 新增)
- arXiv 号:
arXiv:2607.08057(ACL 2026)+arXiv:2502.07115(MIT)= 2 件 NET-new inference 主轴 - 可信度:★★★★(ACL 2026 官方接收 + MIT 运筹学理论 + Microsoft Research 工业验证)
增量 ④ Prefill-Decode 物理分离生产工程:vLLM GB200 26,200 prefill tok/GPU-s(NET-new 工程数据级 · ⭐⭐⭐⭐⭐)
- 来源:jay/2026-09-16-llm-inference-engineering.md §1(cloudai.pt + spheron.network · 2026-06)+ spark/2026-09-16-llm-infra-e1prep.md 增量 ③
- 要点:
- 生产部署实测吞吐提升 1.5x–2.5x;Together AI CPD 缓存感知版本提升达 +40% 额外增益
- vLLM GB200 基准(2026-02):26,200 prefill tokens/GPU-s,10,100 decode tokens/GPU-s(DeepSeek R1/V3)
- 关键问题:单次 32K token prefill 可导致同 GPU batch 内所有 decode 流 stall 2–30x——这是 PD 分离的核心驱动因素
- 部署拓扑:4 prefill 实例(各 2× GB200)+ 1 decode 实例(8× GB200)
- KV Cache 传输机制:vLLM 用 NIXL;AMD MI300X 用 MORI-IO connector;底层 RDMA 或 TCP
- GPU 选型矩阵:Prefill 节点用 H100/B200/B300(计算密集);Decode 节点用 H200 SXM5 141GB HBM3e(内存带宽+容量);小模型 Decode 用 A100 80GB(成本敏感)
- 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎子轴直接关联。v3.34 已锚入 NVIDIA Dynamo 1.0 PD 分离概念(4× TTFT)。本增量补充:vLLM 官方实测数据 + 部署拓扑细节 + 32K stall 问题量化——从概念到可部署的工程闭环。
- 建议归入节:§1.(1) 推理引擎子轴(Prefill-Decode 物理分离生产工程 · vLLM GB200 实测数据)+ §1.(2) 推理调度子轴邻接
- arXiv 号:无(cloudai.pt + spheron.network 工程博客);关注 NVIDIA 官方技术报告
- 可信度:★★★★(cloudai.pt + spheron.network 双源独立 + vLLM 官方 benchmark 数据)
增量 ⑤ SGLang vs vLLM Benchmark 2026-09 精修数字 + 三引擎格局定稿(NET-new 工程数据级 · ⭐⭐⭐⭐)
- 来源:jay/2026-09-16-llm-inference-engineering.md §2-§3(particula.tech + spheron.network · 2026-06/08)+ jay/2026-09-16T1105-jay-five-category-briefing.md + spark/2026-09-16-llm-infra-e1prep.md 增量 ④
- 要点:
- H100 并发测试标准化数字:总吞吐 ~16,200 vs ~12,500 = SGLang +29%;输出 token 吞吐 894 vs 413 = SGLang +117%;TTFT 79ms vs 103ms = SGLang 快 23%;ITL 6.0ms vs 7.1ms = SGLang 快 15%
- RadixAttention prefix-heavy 场景可达 6.4x 收益(vs PagedAttention 无共享前缀优化)
- DeepSeek V3 特定数据:EAGLE 投机解码 batch=1 时 1.8x decode 加速,batch=32 时 1.5x;MLA 优化后端 = FlashAttention3 + FlashInfer + FlashMLA + CutlassMLA;DeepSeek 官方明确推荐 SGLang
- vLLM V1(2026-09):简化调度器 + near-zero 开销 prefix caching + 干净 tensor parallelism + torch.compile 默认开启
- TensorRT-LLM 1.2:移除 AOT TensorRT 后端完全转向 PyTorch,降低部署复杂度
- TGI 已归档(2026-03 确认):HF 建议迁移至 vLLM/SGLang
- 关键决策变量(更新):前缀共享比例 >60% → SGLang;<60% → 两者差不多 5% 以内;延迟敏感 → TensorRT-LLM;模型更新频率(决定编译开销)是另一核心变量
- P-EAGLE(Red Hat 2026-09-03):单次 forward 生成 K 个 draft token,消除 EAGLE 自回归 drafting ceiling;B200 上 1.69× over EAGLE-3
- 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎子轴直接关联。v3.34 已锚入 SGLang vs vLLM 2026-09 数字澄清(通用负载差距 ≤4%;DeepSeek 场景 SGLang +29%)。本增量补充:H100 FP16 标准化并发测试数字(vs v3.34 的 DeepSeek 专项数字)+ P-EAGLE 并行多-token 推测新变体。
- 建议归入节:§1.(1) 推理引擎子轴(SGLang vs vLLM Benchmark 2026-09 精修数字 + P-EAGLE)+ §1.(5) 投机解码子轴(P-EAGLE 并行多-token 推测)
- arXiv 号:无(工程博客 benchmark 数据);P-EAGLE 来源为 Red Hat 技术博客
- 可信度:★★★★(particula.tech + spheron.network + Runpod + Spheron 多源独立验证)
增量 ⑥ MCP × A2A × AG-UI 协议栈 2026 现状 + 23,000+ MCP Server(NET-new 事件级 · ⭐⭐⭐⭐)
- 来源:jay/2026-09-16T1220-jay-csdn-highvalue-inference-stack-sep16.md §3(CSDN 2026-07/08;CSDN WAF 限制 snippet-only 评级上限 ⭐⭐⭐)+ jay/2026-09-16T1105-jay-five-category-briefing.md
- 要点:
- 2026 年 7 月关键里程碑:MCP 正式版发布(2026-07-28)+ A2A 1.0 GA 发布(2026-07)+ Microsoft / Salesforce / Snowflake / ServiceNow 联盟背书
- MCP Registry 已收录 23,000+ MCP Server(相比 2025 年 11 月约 2,000 个大幅增长,约 11.5×)
- 三层协议定位:
- 工具连接层 = MCP(Agent ↔ 工具/数据,JSON-RPC 2.0,Host-Client-Server)
- Agent 协作层 = A2A(Agent ↔ Agent,Agent Card + Task 状态机 + SSE)
- 前端交互层 = AG-UI(Agent ↔ 用户界面,SSE 事件流推送)
- 企业级系统组合范式:"MCP 接工具 + A2A 做编排 + AG-UI 做展示"
- MCP Sampling with Tools(2025-11 版本)模糊了工具与 Agent 边界——暗示 MCP+A2A 未来可能进一步融合
- 选型建议:单 Agent + 工具调用 → MCP;多 Agent 协作 → A2A;前端实时 → AG-UI;企业级 → 三者组合
- 与活文档现有脉络的关系:与 inference.md §1.(8) Agent 协作子轴直接关联。v3.34 已锚入 MCP(作为工具调用协议)。本增量补充:A2A 1.0 GA + AG-UI 三层组合范式正式确立——从单协议(MCP)到三层协议栈( MCP×A2A×AG-UI)的系统性扩展。
- 建议归入节:§1.(8) Agent 协作子轴(MCP × A2A × AG-UI 协议栈 2026 + 23,000+ MCP Server + 企业级组合范式)
- arXiv 号:无(协议规范文档 + 工程博客)
- 可信度:★★★★(协议版本具体 + 生态数据可核验 + CSDN snippet 评级上限 ⭐⭐⭐;CSDN WAF 521/403 限制原文未 fetch)
增量 ⑦ Orthrus"无损"被反驳性复现:BF16 下仅 45% 轨迹匹配(NET-new 方法学级 · ⭐⭐⭐⭐⭐)
- 来源:flyp/2026-09-16-0950-Orthrus-Lossless-Speculative-Decoding-Numerical-Precision-critical-read.md(09:50 CST · 164 行)+ paper_card 1368(2609.15504 · 2026-09-14 提交)+ spark/2026-09-16-llm-infra-e1prep.md 增量 ⑤
- 要点:
- 核心发现:Orthrus(Nguyen et al. 2026,arXiv:2605.12825,Oregon / Google DeepMind / Adobe)在 BF16 推理下仅 45% 轨迹完全匹配 AR 基线;独立训练的 checkpoint 同样仅 43%;FP32 下才恢复 100% 匹配
- 任务级评测盲区:lm-eval-harness 任务级分数无法检测到 45% vs 100% 的差异——说明现有评测范式对数值精度问题存在系统性盲区
- 方法论贡献:将"lossless"从口号变成可验证的操作性命题——必须显式声明 (a) 评估标准(exact trajectory match / task-level equivalence / KL of next-token distribution)和 (b) 数值精度(FP32 / BF16 / FP16)
- on-policy 蒸馏原则:AR 教师自生成贪心续写作为蒸馏语料,优于通用人类续写——该原则可推广到所有 AR + diffusion head 类架构(EAGLE-3、DFlash、Medusa)
- 实验设计:1,190 prompts × 12 domains × 3 精度档(FP32/BF16/FP16)
- Skoltech/AIRI 数值方法团队:Ilya Koziev / Leonid Sinev / Ivan Oseledets(dLLM 圈活跃工程师 + 张量/数值线性代数国际知名学者)
- 4 项待补查:① 作者与原 Orthrus 团队关系未核实 ② 代码/1,190 prompt 集未公开 ③ FP32 端到端速度数据缺失(若 FP32 下 Orthrus 加速比崩溃,则失去存在意义——这是最重要的遗漏)④ 12 个领域具体分布未披露
- 与活文档现有脉络的关系:与 inference.md §1.(5) 投机解码子轴直接关联。v3.34 已锚入 EAGLE-3、DFlash、Mercury、SDAR 等 dLLM 工作。本增量是首个对 dLLM"无损"声明的系统性反驳,方法论上推动 dLLM 评测规范升级("必须报告 BF16/FP16/FP32 三档 trajectory match rate")。
- 建议归入节:§1.(5) 投机解码子轴(Orthrus 反驳复现 · BF16 45%/43% 精确匹配 + on-policy 蒸馏 + 评测方法学贡献)+ §1.(10) 顶会部署子轴(trajectory match rate 作为无损评测新基线)
- arXiv 号:
arXiv:2609.15504= 1 件 NET-new inference 主轴 - 可信度:★★★★(实验设计清晰可复现 + 独立实现一致 45% vs 43% + 反驳措辞诚实;⚠️ 代码未公开 + FP32 速度数据缺失)
三、矛盾/待核实条目
待核实 ① Orthrus FP32 端到端速度(最重要遗漏)
- 问题描述:论文证明 FP32 下才 100% 匹配,但未给 FP32 下的端到端速度数据。若 FP32 下 Orthrus 加速比崩溃(如只剩 1.5×),则其存在意义存疑。
- 建议动作:本地复现 FP32 vs BF16 端到端速度对比(P0)
待核实 ② Orthrus 作者关系 + 代码公开
- 问题描述:Sinev 是 dLLM 圈活跃人物,与 Nguyen et al. 是否独立?代码和 prompt 集是否开源?
- 建议动作:核实 Skoltech/AIRI 官网 + GitHub 搜索(P0)
待核实 ③ LMCache GitHub 与 2026 新 GPU 架构兼容性
- 问题描述:LMCache GitHub 最新 release 是否支持 Blackwell/H200/B300 等 2026 年新 GPU 架构?
- 建议动作:核验 LMCache GitHub release 页面(P1)
待核实 ④ Perplexity CobbleDB 数据来源
- 问题描述:CobbleDB 节省 1 亿美元/年 + P50 31.4ms→5.60ms 数据来自 CEO 推文,无独立审计。
- 建议动作:核实 Perplexity 官方工程博客(P2)
四、可引用的 arXiv 号列表
| arXiv 号 | 标题 | 主分类 | 形态 | 锚定位置 |
|---|---|---|---|---|
| 2609.15504 | Orthrus: Lossless Speculative Decoding 数值精度反驳复现 | inference | critique | 本棒增量 ⑦ · §1.(5) 投机解码子轴 NET-new |
| 2510.09665 | LMCache: 企业级 KV Cache 缓存层 | inference | systems | 本棒增量 ① · §1.(3) KV Cache 子轴 NET-new |
| 2602.21548 | DualPath: Agentic LLM Inference 存储带宽瓶颈破解 | inference | method | 本棒增量 ② · §1.(3) KV Cache 子轴 NET-new |
| 2607.08057 | System-Aware KV Cache Optimization Survey(ACL 2026 Findings) | inference | survey | 本棒增量 ③ · §1.(3) KV Cache 子轴 NET-new(实质锚入) |
| 2502.07115 | Online Scheduling for LLM Inference with KV Cache Constraints(MIT+HKUST+Microsoft) | inference | theory | 本棒增量 ③ · §1.(2) 推理调度子轴 NET-new |
| 2603.09619 | Context Engineering: From Prompts to Corporate Multi-Agent Architecture | inference | framework | 本棒增量 ⑥邻接 · §1.(8) Agent 协作子轴 NET-new |
| 2606.06090 | Beyond Semantic Organization: Memory as Execution State Management(MemoryArena) | inference | benchmark | 本棒增量 ①邻接 · §1.(3) KV Cache 子轴邻接(记忆系统与 KV Cache 关系) |
| 2609.13285 | Grouped Value Attention (GVA) | llm-infra | method | v3.34 已锚入 §1.(3) |
| 2609.13141 | SAS: 端到端注意力稀疏化上下文排序 | inference | method | v3.34 已锚入 §1.(3) |
| 2608.01526 | An Internet for the KV Cache | inference | framework | v3.34 预备级 |
| 2607.05708 | Akashic MemAttention | inference | method | v3.34 已锚入 |
| 2606.19746 | SAC: CXL Disaggregated KV Cache | llm-infra | systems | v3.34 预备级 |
| 2608.03487 | RAG-Stack: Co-Optimizing RAG Serving | inference | method | v3.34 预备级 |
五、给今晚活文档接力的建议
今晚 inference 活文档(knowledge/inference.md)接力方向建议:
- §1.(3) KV Cache 子轴 补入新增三件套:LMCache(arXiv:2510.09665 · 跨节点传输基础设施)+ DualPath(arXiv:2602.21548 · Agentic 推理存储带宽瓶颈)+ ACL 2026 Findings(arXiv:2607.08057 实质锚入)
- §1.(2) 推理调度子轴 新增:Online Scheduling MC-SF 算法(arXiv:2502.07115 · MIT+HKUST+Microsoft)
- §1.(1) 推理引擎子轴 补入:Prefill-Decode 物理分离生产工程(vLLM GB200 26,200 prefill tok/GPU-s + 1.5x-2.5x 吞吐 + 32K stall 2-30x)+ SGLang vs vLLM 2026-09 标准化并发数字(H100 FP16 总吞吐 +29% / 输出 +117% / TTFT +23% / ITL +15%)+ P-EAGLE 并行多-token 推测
- §1.(5) 投机解码子轴 补入:Orthrus 反驳复现(arXiv:2609.15504 · BF16 45%/43% 精确匹配 + FP32 100% + on-policy 蒸馏 + 评测方法学贡献)
- §1.(8) Agent 协作子轴 补入:MCP × A2A × AG-UI 三层协议栈 2026(23,000+ MCP Server)+ 企业级组合范式
- §1.(10) 顶会部署子轴 补入:trajectory match rate 作为 dLLM 无损评测新基线指标
- 待核实项目:Orthrus FP32 端到端速度(P0);LMCache 2026 新 GPU 架构兼容性(P1);Perplexity CobbleDB 独立审计(P2)
六、本棒检查过的来源完整清单
work-queue.md(2026-09-16 22:00)
inference.md(v3.34,2026-09-16 05:00 升档)
inbox/tom/2026-09-15-inference-e1prep.md(昨夜基准)
inbox/tom/2026-09-16-rag-e1prep.md
inbox/tom/2026-09-16-0900-hf-daily-2026-09-16.md
inbox/tom/2026-09-16T0840-agent-rag-longcontext-radar.md
inbox/jay/2026-09-16T0937-jay-kvcache-agenticmemory-inference-briefing.md
inbox/jay/2026-09-16-llm-inference-engineering.md
inbox/jay/2026-09-16T1220-jay-csdn-highvalue-inference-stack-sep16.md
inbox/jay/2026-09-16T1620-jay-csdn-substack-inference-rag-highfreq-sep16.md(v2 重写)
inbox/jay/2026-09-16T1105-jay-five-category-briefing.md
inbox/spark/2026-09-16-llm-infra-e1prep.md(18:40 CST)
inbox/flyp/2026-09-16-0950-Orthrus-Lossless-Speculative-Decoding-Numerical-Precision-critical-read.md
inbox/stephen/2026-09-16-1245-stephen-coordination-check-noon.md
inbox/stephen/2026-09-16-ai-industry-e1prep.md
paper_cards/ Sep 14-16 入库卡:1360-1387( inference/llm-infra 相关:1368 Orthrus + 1374 GVA)
Tom · 2026-09-16 22:20 CST · E1 预消化 · inference · 7 条主增量(LMCache ⭐⭐⭐⭐⭐ + DualPath ⭐⭐⭐⭐⭐ + ACL 2026 KV Cache 综述 + Prefill-Decode Disaggregation ⭐⭐⭐⭐⭐ + SGLang vs vLLM Benchmarks ⭐⭐⭐⭐ + MCP × A2A × AG-UI ⭐⭐⭐⭐ + Orthrus 反驳复现 ⭐⭐⭐⭐⭐)+ 7 件涉及 arXiv 号