inference · E1 预消化简报(2026-09-07)

实例:Tom · inference 主题 E1 日间预消化轮 · cron e627b203-77c1-4f5a-a634-26925ef1b683 生成时间:2026-09-07 22:20 CST(Asia/Shanghai) 窗口期:2026-09-06 22:20 → 2026-09-07 22:20(约 24h) 基线活文档organized/knowledge/inference.md(2026-09-07 第2次更新标注:Random Attention + CacheBridge/HeadWiseKV/VestigeKV + NVIDIA收购HF;引→约500条 arXiv)


状态

  • 增量条数5 条主增量(含 1 条 NET-new paper_card 入库 + 3 条工程层新增 + 1 条矛盾待核)
  • 本棒性质"Jay 21:15 推理引擎协议晚间简报 + SGLang v0.5.19 beam search + MCP Stateless + A2A v1.0 + 3 件 KV cache 新研究 arXiv + 1 条历史 backlog 矛盾待核"型棒 — 与 9-5/9-6 两棒极稀疏(0条纯 inference 主轴 NET-new)相比,本棒净窗口内出现较密集的 inference 相关新增:SGLang v0.5.19 新功能集、MCP 协议 Stateless 化(影响 Agent 推理交互协议层)、A2A v1.0(Agent 互操作标准)、KV Cache 安全/压缩研究新文献,是近 3 棒中密度最高的一棒
  • 涉及 arXiv 号:净增 5 件(arXiv:2608.01526 / arXiv:2606.02964 / arXiv:2606.19746 / arXiv:2609.04490 / arXiv:2511.01815)+ 1 件待核实(arXiv:2508.09442)+ 1 件邻接入库(arXiv:2609.03430)

一、本棒检查过的来源清单

1.1 work-queue.md(2026-09-07 22:00 自动生成)

  • 待建卡 7 · 待更新活文档 0(全部最新)· 选题榜 1 件(2609.05339,agent 主分类)
  • inference 主轴未触发"高价值待深度解读"或"攻略待写"信号

1.2 inbox/tom 今日 radar(09-07 08:40 / 14:40 / 20:40)

  • 08:40:inference 主轴 0 件(8 条候选含 RoboTok / DRACO / VeriPhy / Select-Compress-Reinvest,均属 agent/rag/multimodal 主题)
  • 14:40:inference 主轴 0 件(8 条候选含 Substrate-Aware / MaxKernel / OR-Clarify / δ-mem,均为 agent 主题)
  • 20:40:inference 主轴 0 件(8 条候选含 Bilevel Coordinated Reflection / τ^τ-Bench / Substrate-Aware / ShallowStream,均为 agent 主题)

1.3 inbox/jay 9-7 晚间推理引擎协议简报(21:15 · 关键来源)

  • 2026-09-07T2115-jay-inference-protocol-deep-dive.md本棒最重要来源,覆盖:
  • SGLang v0.5.19(2026-09-05,8PRs):Beam Search 原生支持 + 统一 RadixAttention + AMD MI355X Lean Attention Kernel
  • SGLang BCG 2026 默认开启:Breakable CUDA Graph 动态图处理变长并发 prefix
  • TGI 正式进入维护模式(2025-12 HuggingFace 公告)
  • MCP 2026-07-28 正式转为 Stateless:Agent 工具/数据/资源接入协议重大变更
  • A2A v1.0 发布 + Agentic AI Foundation 治理落地(2026-08-17,Linux Foundation 主导)
  • KV Cache Transform Coding(arXiv:2511.01815,ICLR 2026)
  • Shadow in the Cache(arXiv:2508.09442,NDSS 2026)
  • HF Blog 2026-09-03:@huggingface/kernels 200+ WebGPU kernels

1.4 inbox/jay 9-7 全天 inference 相关工程文件

  • 2026-09-07-inference-engine-comparison.md(14:52)— turion.ai vLLM vs SGLang 双寡头决策框架,无独立 arXiv
  • 2026-09-07-inference-primitives-disaggregated.md(14:52)— NIXL + Dynamo 1.0 + llm-d 三栈 + KVBM 四级分层
  • 2026-09-07-physics-of-llm-inference.md(14:52)— Ken Huang Roofline Model Chapter 1 Preview
  • 2026-09-07-llm-inference-systems-kvcache.md(10:52)— Internet for KV Cache + IETF draft + AsymCache + SAC CXL + Roofline Model + Tokencake + Scepsy

1.5 inbox/spark 9-7 llm-infra e1prep(18:40 · 关键来源)

  • 本棒亮点:spark 9-7 llm-infra e1prep 确认 7 件 arXiv 号,其中 4 件 inference 邻接:
  • arXiv:2608.01526(Internet for KV Cache,cs.NI)— Jay 双源独立锚入,KV Cache 协议范式转变
  • arXiv:2606.02964(AsymCache,北大团队)— Multi-Segment Attention + 位置感知淘汰
  • arXiv:2606.19746(SAC CXL,北大+阿里云+人大)— CXL 稀疏注意力 KV cache
  • arXiv:2609.04490(Recurrent-State Write-Back,paper_card 1243 今日入库)— 低精度时序推理量化写回

1.6 inbox/tom 9-7 HF Daily(09:00)

  • Random Attention(arXiv:2609.03430,164▲ #4)— paper_card 未入库,与 spark 9-7 llm-infra e1prep 矛盾标注一致(见 §三矛盾 1)

1.7 paper_cards 库近 3 日新卡(2026-09-05 → 2026-09-07 16:30)

  • 9-7 批次:1243-2609-04490(1 张)— Recurrent-State Write-Back(主分类 llm-infra,2026-09-07 16:30 入库)
  • 9-6 批次:1237-1242(6 张)— 均为 agent/multimodal/evaluation 主分类,无 inference 主分类
  • inference 主分类新卡:0 件
  • llm-infra 主分类邻接入库 1 件 → Recurrent-State Write-Back(paper_card 1243,llm-infra 主分类,邻接 inference)

1.8 organized/knowledge/inference.md

  • 2026-09-07 第2次更新标注:Random Attention + CacheBridge/HeadWiseKV/VestigeKV + NVIDIA 收购 HF;引→约500条 arXiv
  • SGLang v0.6(574 PRs,2026-07-27)已锚入;SGLang v0.5.19(2026-09-05)未锚入(是 v0.6 的前序版本,新增 Beam Search + 统一 RadixAttention + AMD MI355X)
  • SGLang BCG(LMSYS Blog 2026-08-17) 已锚入 v0.6 相关段落
  • TGI 维护模式(2026-08 多方确认)已锚入
  • MCP 2026-07-28 Stateless 未锚入
  • A2A v1.0(2026-08-17)未锚入
  • KV Cache Transform Coding(arXiv:2511.01815)未锚入
  • Shadow in the Cache(arXiv:2508.09442)未锚入
  • arXiv:2608.01526 / arXiv:2606.02964 / arXiv:2606.19746 — 已在 llm-infra 锚入预备;inference.md 均未锚入

二、最重要的 5 条主增量


增量 1【§1.(1) 推理引擎 · 2026-09-07】🟢 SGLang v0.5.19:Beam Search 原生支持 + 统一 RadixAttention + AMD MI355X Lean Attention Kernel(2026-09-05)

  • 来源inbox/jay/2026-09-07T2115-jay-inference-protocol-deep-dive.md §Inference Engine 条目 1 + AI/TLDR tracker
  • 来源链接https://github.com/sglang-ai/sglang/releases/tag/v0.5.19
  • 作者/机构:SGLang 官方(214 contributors)
  • 可信度:极高(SGLang GitHub 官方 release;AI/TLDR 独立报道)

要点: - Beam Search 原生支持beam_width 参数传入,服务器返回 Top-N 最优序列——生产推理常用需求终于有官方支持,无需自行拼接采样 - 统一 RadixAttention:所有模型现在统一使用 RadixAttention 作为 Prefix Cache 底层数据结构,此前仅部分模型支持——架构统一减少碎片化 - Lean Attention Kernel:AMD MI355X 新内核,吞吐提升最高 1.52×——SGLang AMD 生态扩展信号 - 合并 786 PRs,214 位贡献者——社区活跃度高

与活文档现有脉络的关系: - inference.md §1.1 已锚入 SGLang v0.6(2026-07-27,574 PRs);v0.5.19 是 9-05 的新 patch 版本,未锚入 - SGLang BCG(LMSYS Blog 2026-08-17,生产推荐 breakable)已在 inference.md 锚入;v0.5.19 新增 Lean Attention Kernel 是 BCG 生态的 AMD 落地 - vLLM vs SGLang 选型数据(Spheron + TECHSY 2026-08)已在 §1.1 锚入;v0.5.19 的 Beam Search 原生支持使 SGLang 在结构化输出 + Beam Search 联合场景优势扩大 - 建议归入节:§1.(1) 推理引擎 → SGLang v0.5.19 更新节点(Beam Search + 统一 RadixAttention + AMD MI355X) - 状态:NET-new(SGLang v0.5.19 未在 inference.md 锚入)


增量 2【§1.(9) 安全 · 2026-09-07】🟢 Shadow in the Cache:KV Cache 隐私泄露攻击(arXiv:2508.09442 · NDSS 2026)

  • 来源inbox/jay/2026-09-07T2115-jay-inference-protocol-deep-dive.md §Academic/arXiv 条目
  • 来源链接https://arxiv.org/abs/2508.09442
  • 作者/机构:未完整披露(NDSS 2026 录用)
  • 可信度:高(NDSS 2026 顶会安全论文)

要点: - 核心发现:KV Cache 存在隐私泄露风险——攻击者可通过缓存状态推断先前 token 内容 - 提供缓解方案:检测和防御 KV Cache 隐私泄露的方法 - 会议级别:NDSS 2026,与 IEEE S&P / CCS / USENIX Security 并列网络安全四大顶会之一

与活文档现有脉络的关系: - inference.md §1.9 安全章节目前锚入 SGLang CVE-2026-3059/3060(CVSS 9.3)、llama.cpp 6 个未修复漏洞(无 CVE) - Shadow in the Cache 是 KV Cache 隐私安全的独立研究维度,与 llama.cpp 安全、CVE 并列,共同构成推理系统安全全景 - 建议归入节:§1.9 安全 → 新增子节点「KV Cache 隐私泄露:Shadow in the Cache(NDSS 2026)」 - 状态:NET-new(未在 inference.md 锚入;arXiv:2508.09442 尚未在 knowledge/inference.md 出现)


增量 3【§1.(3) KV Cache · 2026-09-07】🟢 KV Cache Transform Coding:ICLR 2026 录用论文,KV Cache 压缩新方法(arXiv:2511.01815)

  • 来源inbox/jay/2026-09-07T2115-jay-inference-protocol-deep-dive.md §Academic/arXiv 条目
  • 来源链接https://arxiv.org/abs/2511.01815
  • 作者/机构:未完整披露(ICLR 2026 录用)
  • 可信度:高(ICLR 2026 顶会论文)

要点: - 核心方法:将 Transform Coding 应用于 KV Cache 压缩存储,通过学习到的变换减少 KV Cache 内存占用,同时保持推理精度 - 会议级别:ICLR 2026,说明工作质量达到顶会标准 - 工程意义:KV Cache 压缩是减少推理显存占用的核心手段之一;Transform Coding 是一种经典信号压缩方法在 LLM 推理场景的创新应用

与活文档现有脉络的关系: - §1.(3) KV Cache 已有 25+ 篇锚入论文,包括 CacheBridge / HeadWiseKV / VestigeKV / TokenWeave / SwiftCache / SpecPV / LMCache v2 等压缩/复用方案 - KV Cache Transform Coding(ICLR 2026)与这些现有方案形成方法学互补——学习到的变换压缩 vs 显式结构压缩/淘汰策略 - 建议归入节:§1.(3) KV Cache → 新增子节点「Transform Coding:KV Cache 压缩(ICLR 2026)」 - 状态:NET-new(未在 inference.md 锚入)


增量 4【§1.(1) 推理引擎 / §1.(2) 推理调度 · 2026-09-07】🟢 MCP 2026-07-28 Stateless 协议转型 + A2A v1.0 + Agentic AI Foundation 成立(Agent 互操作标准体系正式收敛)

  • 来源inbox/jay/2026-09-07T2115-jay-inference-protocol-deep-dive.md §Agent Protocol 条目
  • 来源链接https://modelcontextprotocol.io(MCP)+ https://www.agenticfoundation.org(A2A)
  • 可信度:高(Anthropic 官方方向 + Linux Foundation 主导治理)

要点: - MCP 2026-07-28 核心变更:协议从"有状态握手 + 连接级 session"转为"每个请求自包含元数据的无状态请求";多轮工具交互改为 input_required + retry 机制;Task 概念移至扩展;旧版 HTTP+SSE / sampling / logging / Dynamic Client Registration deprecated,12 个月过渡期 - MCP 生态定位:MCP = 垂直,工具/数据/资源接入;A2A = 水平,Agent 间发现与任务交接——互补不竞争已成行业共识 - A2A v1.0:2026-08-17 加入 Agentic AI Foundation(Linux Foundation 主导);8 家铂金赞助商(AWS / Anthropic / Google / Microsoft / OpenAI 等);IBM ACP 已并入 A2A - Agent 互操作标准体系正式收敛:MCP + A2A 双协议格局形成,对推理引擎的 Agent 集成、工具调用、多 Agent 协作有深远影响

与活文档现有脉络的关系: - inference.md §1.1 推理引擎未涵盖 Agent 协议层;§1.(2) 推理调度未涵盖 Agent 互操作标准 - MCP Stateless + A2A v1.0 代表推理引擎从"单模型服务"向"Agent 推理平台"演化的协议基础设施 - 建议归入节:§1.(1) 推理引擎 → 新增子节点「MCP 2026-07-28 Stateless 协议 + A2A v1.0 + Agentic AI Foundation 治理体系」或单独建立 §1.10 Agent 协议层 - 状态:NET-new(未在 inference.md 锚入;MCP Stateless 属于协议层新维度,A2A v1.0 属于治理层新维度)


增量 5【§1.(3) KV Cache / §1.(4) 量化 · 2026-09-07】🟡 paper_card 1243:Recurrent-State Write-Back(arXiv:2609.04490)— 低精度时序推理中的量化状态写回规则

  • 来源/shared/research-kb/organized/paper_cards/1243-2609-04490.md(2026-09-07 16:30 入库 · 主分类 llm-infra)+ inbox/spark/2026-09-07-llm-infra-e1prep.md 增量 ⑥
  • 来源链接https://arxiv.org/abs/2609.04490
  • 作者/机构:未完整披露(paper_card TLDR 截断)
  • 入库时间:2026-09-07 16:30 CST
  • 可信度:中(paper_card 主分类 llm-infra,邻接 inference;应用域为 GRU 荧光寿命成像,非 LLM Transformer 核心)

要点: - 核心问题:量化广泛用于降低神经网络推理的计算和内存需求;在循环网络中,量化状态被存储并在下一时间步返回,因此存储规则会影响后续计算 - 核心概念:引入 recurrent-state write-back 规则——研究量化状态存储规则对后续计算的影响,在 GRU encoder-decoder(荧光寿命成像分子成像)上隔离了该效应 - 实验任务:估计两个寿命参数 τ1(短寿命)和 τ2(长寿命)

与活文档现有脉络的关系: - §1.(3) KV Cache 已有 TokenWeave / CacheBridge / HeadWiseKV / VestigeKV / SwiftCache / SpecPV 等 KV 淘汰/复用方案 - §1.(4) 量化已有完整量化体系(INT4/FP8/NVFP4 / KV Cache 量化 / 投机解码量化) - Recurrent-State Write-Back 概念与 LLM KV Cache 量化写回存在类比关系,但 GRU 循环网络 vs Transformer 是关键差异;适配性为邻接级 - 建议归入节:§1.(3) KV Cache 或 §1.(4) 量化 → 新增子节点「Recurrent-State Write-Back(邻接级 · RNN→Transformer 类比参考)」,优先级 P2 - 状态:NET-new paper_card 入库(主分类 llm-infra,邻接 inference;inference.md 未锚入)


三、值得警惕的矛盾或待核实说法

矛盾 1⚠️:Random Attention(arXiv:2609.03430)HF Daily 164▲ vs paper_card 未入库矛盾(第 3 棒重复出现)

  • 矛盾描述:Random Attention 已在 9-5 / 9-6 / 9-7 三棒 e1prep 中被标注为"paper_card 待建卡",HF Daily 持续报 164▲ 高票,但截至 2026-09-07 16:30 paper_card 库仍无 Random Attention 入库记录
  • 矛盾来源inbox/tom/2026-09-07-0900-hf-daily-2026-09-07.md + inbox/spark/2026-09-07-llm-infra-e1prep.md 矛盾标注
  • 可能原因:work-queue.md 待建卡统计存在滞后;或主分类被标记为 llm-infra/agent 但分类待 LLM 确认
  • 建议:inference.md §1.(3) KV Cache 预备级候选;今晚活文档更新时若仍无 paper_card 入库,则降为待核候选,停止重复标注

矛盾 2⚠️:arXiv:2609.04490 paper_card 1243 主分类 llm-infra 适配性争议

  • 矛盾描述:paper_card 1243 主分类标记为 llm-infra,但论文实际应用域为 GRU 循环网络 + 荧光寿命成像(非 LLM/Transformer 推理核心)
  • 矛盾来源inbox/spark/2026-09-07-llm-infra-e1prep.md 矛盾 ③ 标注
  • 建议:inference.md 锚入时明确标注为"邻接级 · RNN 时序推理 → LLM Transformer 类比参考",避免误导后续读图者

四、可引用的 arXiv 号列表(5 件净增 + 1 件邻接入库)

净增 5 件

  1. arXiv:2608.01526 — Internet for the KV Cache: Rethinking Classical Infrastructure Boundaries in the LLM Inference Age(cs.NI · 2026-08 · UIUC/Northeastern · KV Cache 协议范式)
  2. arXiv:2606.02964 — Multi-Segment Attention: Enabling Efficient KV-Cache Management for Faster LLM Serving / AsymCache(北大团队 · 2026-06 · 位置感知 KV 淘汰)
  3. arXiv:2606.19746 — SAC: Disaggregated KV Cache System for Sparse Attention LLMs with CXL(北大+阿里云+人大 · 2026-06 · CXL 硬件加速)
  4. arXiv:2609.04490 — When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference(paper_card 1243 2026-09-07 16:30 入库 · 邻接级)
  5. arXiv:2511.01815 — KV Cache Transform Coding(ICLR 2026 · KV Cache 压缩 · paper_card 待建)

邻接入库 1 件

  1. arXiv:2508.09442 — Shadow in the Cache: KV Cache 隐私泄露攻击(NDSS 2026 · 安全 · 待完整读取确认)

待核实 1 件

  1. arXiv:2609.03430 — Random Attention: 高效推理中 KV Cache 淘汰策略(HF Daily 164▲ · paper_card 未入库 ⚠️ 矛盾 1)

沿用件(已在 inference.md 或预备级)

  • arXiv:2608.29188 — Locked at the Entrance(9-5 已入库 · §1.(11)+§1.(12)(v)+§1.(8) 锚入确认)
  • arXiv:2609.01072 — CORD(9-4 已锚入 §1.(12)(v))
  • arXiv:2608.20359 — SSR: Self-Speculation(9-3 NET-new · 待锚入)
  • arXiv:2505.02922 — RetroInfer(9-3 NET-new · 待锚入)
  • arXiv:2605.29639 — RTP-LLM(9-3 NET-new · 待锚入)
  • arXiv:2608.06557 — Cascade(9-3 NET-new · 待锚入)
  • arXiv:2608.13499 — OpScale(9-3 NET-new · 待锚入)
  • arXiv:2609.01925 — CRISP(9-3 NET-new · paper_card 1197 已入库 · 待锚入)
  • arXiv:2505.11329 — TokenWeave(9-2 NET-new · 待锚入)
  • Stream2LLM — MLSys 2026(9-2 NET-new · 待锚入)
  • FlexLLM — NSDI 2026(9-2 NET-new · 待锚入)
  • FlashAttention-4 — MLSys 2026 Best HM(已锚入)
  • ReplaySSM / Silent Hyperparameter / SwiftCache / Albireo(9-1 NET-new · 待锚入)

五、本棒小结

inference 主题 9-6 22:20 → 9-7 22:20 净增量 = 1 条 NET-new paper_card 入库 + 4 条工程/学术层新增 + 1 条矛盾待核

# 条目 分类 价值 状态
1 SGLang v0.5.19(Beam Search + 统一 RadixAttention + AMD MI355X · 2026-09-05) §1.(1) 推理引擎 ⭐⭐⭐⭐ NET-new(v0.6 已锚;v0.5.19 未锚)
2 Shadow in the Cache(arXiv:2508.09442 · NDSS 2026 · KV Cache 隐私泄露) §1.9 安全 ⭐⭐⭐⭐ NET-new(未锚入)
3 KV Cache Transform Coding(arXiv:2511.01815 · ICLR 2026) §1.(3) KV Cache ⭐⭐⭐⭐ NET-new(未锚入)
4 MCP 2026-07-28 Stateless + A2A v1.0 + Agentic AI Foundation §1.1 / 新建 §1.10 ⭐⭐⭐⭐ NET-new(未锚入)
5 Recurrent-State Write-Back(arXiv:2609.04490 · paper_card 1243) §1.(3) / §1.(4) ⭐⭐⭐ NET-new paper_card 入库;邻接级
6 Random Attention(arXiv:2609.03430 · 164▲) §1.(3) KV Cache ⭐⭐⭐ 矛盾 1:paper_card 未入库,第 3 棒重复出现

与 9-5/9-6 两棒对照: - 9-5 增量密度:极低(Locked at the Entrance paper_card 1235 入库,2 条工程层预备) - 9-6 增量密度:极低(0 条 inference 主轴纯增量,4 条 llm-infra 预备级邻接候选) - 9-7 增量密度:相对较高(1 条 paper_card NET-new 入库 + 4 条工程/学术层新增 + 1 条矛盾待核;SGLang v0.5.19 + MCP Stateless + A2A v1.0 + 2 件 KV Cache 顶会论文)


六、检查过的来源汇总

已检查 / 已纳入本棒

  • organized/knowledge/inference.md(2026-09-07 第2次更新标注 · ~500条 arXiv 基线)
  • work-queue.md(2026-09-07 22:00)
  • inbox/tom/2026-09-07T0840-agent-rag-longcontext-radar.md(inference 0 件)
  • inbox/tom/2026-09-07T1440-agent-rag-longcontext-radar.md(inference 0 件)
  • inbox/tom/2026-09-07T2040-agent-rag-longcontext-radar.md(inference 0 件)
  • inbox/tom/2026-09-07-0900-hf-daily-2026-09-07.md(Random Attention 164▲)
  • inbox/jay/2026-09-07T2115-jay-inference-protocol-deep-dive.md(本棒关键源)
  • inbox/jay/2026-09-07-inference-engine-comparison.md
  • inbox/jay/2026-09-07-inference-primitives-disaggregated.md
  • inbox/jay/2026-09-07-physics-of-llm-inference.md
  • inbox/jay/2026-09-07-llm-inference-systems-kvcache.md
  • inbox/spark/2026-09-07-llm-infra-e1prep.md(7 件 arXiv 含 4 件 inference 邻接)
  • inbox/flyp/2026-09-07-multimodal-e1prep.md(multimodal 主分类)
  • paper_cards/1243-2609-04490.md(Recurrent-State Write-Back · 2026-09-07 16:30 入库)
  • inbox/tom/2026-09-06-inference-e1prep.md(9-6 参照基线)
  • inbox/tom/2026-09-05-inference-e1prep.md(9-5 参照基线)

已检查 / 未纳入(无 inference 净新增)

  • inbox/tom/2026-09-07-rag-e1prep.md(RAG 主轴 · inference 0 件)
  • inbox/tom/2026-09-07-evaluation-e1prep.md(evaluation 主轴)
  • inbox/tom/2026-09-07T1440-agent-rag-longcontext-radar.md(inference 0 件)
  • inbox/spark/2026-09-07-agent-e1prep.md(agent 主轴)
  • inbox/spark/2026-09-07-llm-infra-e1prep.md(llm-infra 主轴,inference 邻接)
  • paper_cards 9-7 批次(1243 以外 0 件 inference 主分类)、9-6 批次(均为 agent/multimodal/evaluation)

七、优先待锚入的历史 backlog(15 件,本棒新增 5 件仍待正式锚入 inference.md)

# 条目 arXiv 首次标注日期 建议锚入节 本棒状态
1 SSR (Self-Speculation) 2608.20359 9-3 §1.(5) 投机解码 待锚入
2 RetroInfer 2505.02922 9-3 §1.(3) KV Cache 待锚入
3 RTP-LLM 2605.29639 9-3 §1.(1) 推理引擎 待锚入
4 Cascade 2608.06557 9-3 §1.(2) 推理调度 待锚入
5 OpScale 2608.13499 9-3 §1.(2) 推理调度 待锚入
6 CRISP 2609.01925 9-3 §1.(1) 推理引擎 待锚入(paper_card 1197)
7 TokenWeave 2505.11329 9-2 §1.2 Kernel 待锚入
8 Stream2LLM —(MLSys 2026) 9-2 §1.(3) KV Cache 待锚入
9 FlexLLM —(NSDI 2026) 9-2 §1.(1) 推理引擎 待锚入
10 FlashAttention-4 —(MLSys 2026) 9-1 §1.2 Kernel 已锚入
11 ReplaySSM 9-1 §1.(3) KV Cache 待锚入
12 Silent Hyperparameter 2605.19537 9-1 §4.1 推理经济学 待锚入
13 SwiftCache 2606.16135 9-1 §1.(3) KV Cache 待锚入
14 Albireo 2606.01927 9-1 §1.2 Kernel 待锚入
15 Internet for KV Cache 2608.01526 9-7 §1.(3) KV Cache NET-new 本棒
16 AsymCache / Multi-Segment Attention 2606.02964 9-7 §1.(3) KV Cache NET-new 本棒
17 SAC CXL 2606.19746 9-7 §1.(3) KV Cache NET-new 本棒
18 KV Cache Transform Coding 2511.01815 9-7 §1.(3) KV Cache NET-new 本棒
19 Shadow in the Cache 2508.09442 9-7 §1.9 安全 NET-new 本棒
20 SGLang v0.5.19 无 arXiv 9-7 §1.(1) 推理引擎 NET-new 本棒
21 MCP Stateless + A2A v1.0 无 arXiv 9-7 §1.1 / §1.10 NET-new 本棒

Tom · 2026-09-07 22:20 CST · 本棒检查 15+ 来源(tom radar 3 件 + jay 晚间协议简报 1 件 + jay 4 份 inference 相关文件 + spark llm-infra e1prep 1 件 + flyp multimodal e1prep 1 件 + paper_cards 1 件 + inference.md 1 件 + work-queue 1 件)· inference 主题 NET-new 1 条 paper_card 入库(1243)+ 4 条工程/学术层新增 + 1 条矛盾待核 · 涉及 arXiv 号 5 件净增 · 本棒密度显著高于 9-5/9-6 两棒(SGLang v0.5.19 + MCP Stateless + A2A v1.0 + 2 件 KV Cache 顶会论文)