inference · E1 预消化简报(2026-09-07)
实例:Tom · inference 主题 E1 日间预消化轮 · cron e627b203-77c1-4f5a-a634-26925ef1b683
生成时间:2026-09-07 22:20 CST(Asia/Shanghai)
窗口期:2026-09-06 22:20 → 2026-09-07 22:20(约 24h)
基线活文档:organized/knowledge/inference.md(2026-09-07 第2次更新标注:Random Attention + CacheBridge/HeadWiseKV/VestigeKV + NVIDIA收购HF;引→约500条 arXiv)
状态
- 增量条数:5 条主增量(含 1 条 NET-new paper_card 入库 + 3 条工程层新增 + 1 条矛盾待核)
- 本棒性质:"Jay 21:15 推理引擎协议晚间简报 + SGLang v0.5.19 beam search + MCP Stateless + A2A v1.0 + 3 件 KV cache 新研究 arXiv + 1 条历史 backlog 矛盾待核"型棒 — 与 9-5/9-6 两棒极稀疏(0条纯 inference 主轴 NET-new)相比,本棒净窗口内出现较密集的 inference 相关新增:SGLang v0.5.19 新功能集、MCP 协议 Stateless 化(影响 Agent 推理交互协议层)、A2A v1.0(Agent 互操作标准)、KV Cache 安全/压缩研究新文献,是近 3 棒中密度最高的一棒
- 涉及 arXiv 号:净增 5 件(arXiv:2608.01526 / arXiv:2606.02964 / arXiv:2606.19746 / arXiv:2609.04490 / arXiv:2511.01815)+ 1 件待核实(arXiv:2508.09442)+ 1 件邻接入库(arXiv:2609.03430)
一、本棒检查过的来源清单
1.1 work-queue.md(2026-09-07 22:00 自动生成)
- 待建卡 7 · 待更新活文档 0(全部最新)· 选题榜 1 件(2609.05339,agent 主分类)
- inference 主轴未触发"高价值待深度解读"或"攻略待写"信号
1.2 inbox/tom 今日 radar(09-07 08:40 / 14:40 / 20:40)
- 08:40:inference 主轴 0 件(8 条候选含 RoboTok / DRACO / VeriPhy / Select-Compress-Reinvest,均属 agent/rag/multimodal 主题)
- 14:40:inference 主轴 0 件(8 条候选含 Substrate-Aware / MaxKernel / OR-Clarify / δ-mem,均为 agent 主题)
- 20:40:inference 主轴 0 件(8 条候选含 Bilevel Coordinated Reflection / τ^τ-Bench / Substrate-Aware / ShallowStream,均为 agent 主题)
1.3 inbox/jay 9-7 晚间推理引擎协议简报(21:15 · 关键来源)
2026-09-07T2115-jay-inference-protocol-deep-dive.md— 本棒最重要来源,覆盖:- SGLang v0.5.19(2026-09-05,8PRs):Beam Search 原生支持 + 统一 RadixAttention + AMD MI355X Lean Attention Kernel
- SGLang BCG 2026 默认开启:Breakable CUDA Graph 动态图处理变长并发 prefix
- TGI 正式进入维护模式(2025-12 HuggingFace 公告)
- MCP 2026-07-28 正式转为 Stateless:Agent 工具/数据/资源接入协议重大变更
- A2A v1.0 发布 + Agentic AI Foundation 治理落地(2026-08-17,Linux Foundation 主导)
- KV Cache Transform Coding(arXiv:2511.01815,ICLR 2026)
- Shadow in the Cache(arXiv:2508.09442,NDSS 2026)
- HF Blog 2026-09-03:@huggingface/kernels 200+ WebGPU kernels
1.4 inbox/jay 9-7 全天 inference 相关工程文件
2026-09-07-inference-engine-comparison.md(14:52)— turion.ai vLLM vs SGLang 双寡头决策框架,无独立 arXiv2026-09-07-inference-primitives-disaggregated.md(14:52)— NIXL + Dynamo 1.0 + llm-d 三栈 + KVBM 四级分层2026-09-07-physics-of-llm-inference.md(14:52)— Ken Huang Roofline Model Chapter 1 Preview2026-09-07-llm-inference-systems-kvcache.md(10:52)— Internet for KV Cache + IETF draft + AsymCache + SAC CXL + Roofline Model + Tokencake + Scepsy
1.5 inbox/spark 9-7 llm-infra e1prep(18:40 · 关键来源)
- 本棒亮点:spark 9-7 llm-infra e1prep 确认 7 件 arXiv 号,其中 4 件 inference 邻接:
- arXiv:2608.01526(Internet for KV Cache,cs.NI)— Jay 双源独立锚入,KV Cache 协议范式转变
- arXiv:2606.02964(AsymCache,北大团队)— Multi-Segment Attention + 位置感知淘汰
- arXiv:2606.19746(SAC CXL,北大+阿里云+人大)— CXL 稀疏注意力 KV cache
- arXiv:2609.04490(Recurrent-State Write-Back,paper_card 1243 今日入库)— 低精度时序推理量化写回
1.6 inbox/tom 9-7 HF Daily(09:00)
- Random Attention(arXiv:2609.03430,164▲ #4)— paper_card 未入库,与 spark 9-7 llm-infra e1prep 矛盾标注一致(见 §三矛盾 1)
1.7 paper_cards 库近 3 日新卡(2026-09-05 → 2026-09-07 16:30)
- 9-7 批次:1243-2609-04490(1 张)— Recurrent-State Write-Back(主分类 llm-infra,2026-09-07 16:30 入库)
- 9-6 批次:1237-1242(6 张)— 均为 agent/multimodal/evaluation 主分类,无 inference 主分类
- inference 主分类新卡:0 件
- llm-infra 主分类邻接入库 1 件 → Recurrent-State Write-Back(paper_card 1243,llm-infra 主分类,邻接 inference)
1.8 organized/knowledge/inference.md
- 2026-09-07 第2次更新标注:Random Attention + CacheBridge/HeadWiseKV/VestigeKV + NVIDIA 收购 HF;引→约500条 arXiv
- SGLang v0.6(574 PRs,2026-07-27)已锚入;SGLang v0.5.19(2026-09-05)未锚入(是 v0.6 的前序版本,新增 Beam Search + 统一 RadixAttention + AMD MI355X)
- SGLang BCG(LMSYS Blog 2026-08-17) 已锚入 v0.6 相关段落
- TGI 维护模式(2026-08 多方确认)已锚入
- MCP 2026-07-28 Stateless 未锚入
- A2A v1.0(2026-08-17)未锚入
- KV Cache Transform Coding(arXiv:2511.01815)未锚入
- Shadow in the Cache(arXiv:2508.09442)未锚入
- arXiv:2608.01526 / arXiv:2606.02964 / arXiv:2606.19746 — 已在 llm-infra 锚入预备;inference.md 均未锚入
二、最重要的 5 条主增量
增量 1【§1.(1) 推理引擎 · 2026-09-07】🟢 SGLang v0.5.19:Beam Search 原生支持 + 统一 RadixAttention + AMD MI355X Lean Attention Kernel(2026-09-05)
- 来源:
inbox/jay/2026-09-07T2115-jay-inference-protocol-deep-dive.md§Inference Engine 条目 1 + AI/TLDR tracker - 来源链接:
https://github.com/sglang-ai/sglang/releases/tag/v0.5.19 - 作者/机构:SGLang 官方(214 contributors)
- 可信度:极高(SGLang GitHub 官方 release;AI/TLDR 独立报道)
要点:
- Beam Search 原生支持:beam_width 参数传入,服务器返回 Top-N 最优序列——生产推理常用需求终于有官方支持,无需自行拼接采样
- 统一 RadixAttention:所有模型现在统一使用 RadixAttention 作为 Prefix Cache 底层数据结构,此前仅部分模型支持——架构统一减少碎片化
- Lean Attention Kernel:AMD MI355X 新内核,吞吐提升最高 1.52×——SGLang AMD 生态扩展信号
- 合并 786 PRs,214 位贡献者——社区活跃度高
与活文档现有脉络的关系:
- inference.md §1.1 已锚入 SGLang v0.6(2026-07-27,574 PRs);v0.5.19 是 9-05 的新 patch 版本,未锚入
- SGLang BCG(LMSYS Blog 2026-08-17,生产推荐 breakable)已在 inference.md 锚入;v0.5.19 新增 Lean Attention Kernel 是 BCG 生态的 AMD 落地
- vLLM vs SGLang 选型数据(Spheron + TECHSY 2026-08)已在 §1.1 锚入;v0.5.19 的 Beam Search 原生支持使 SGLang 在结构化输出 + Beam Search 联合场景优势扩大
- 建议归入节:§1.(1) 推理引擎 → SGLang v0.5.19 更新节点(Beam Search + 统一 RadixAttention + AMD MI355X)
- 状态:NET-new(SGLang v0.5.19 未在 inference.md 锚入)
增量 2【§1.(9) 安全 · 2026-09-07】🟢 Shadow in the Cache:KV Cache 隐私泄露攻击(arXiv:2508.09442 · NDSS 2026)
- 来源:
inbox/jay/2026-09-07T2115-jay-inference-protocol-deep-dive.md§Academic/arXiv 条目 - 来源链接:
https://arxiv.org/abs/2508.09442 - 作者/机构:未完整披露(NDSS 2026 录用)
- 可信度:高(NDSS 2026 顶会安全论文)
要点: - 核心发现:KV Cache 存在隐私泄露风险——攻击者可通过缓存状态推断先前 token 内容 - 提供缓解方案:检测和防御 KV Cache 隐私泄露的方法 - 会议级别:NDSS 2026,与 IEEE S&P / CCS / USENIX Security 并列网络安全四大顶会之一
与活文档现有脉络的关系: - inference.md §1.9 安全章节目前锚入 SGLang CVE-2026-3059/3060(CVSS 9.3)、llama.cpp 6 个未修复漏洞(无 CVE) - Shadow in the Cache 是 KV Cache 隐私安全的独立研究维度,与 llama.cpp 安全、CVE 并列,共同构成推理系统安全全景 - 建议归入节:§1.9 安全 → 新增子节点「KV Cache 隐私泄露:Shadow in the Cache(NDSS 2026)」 - 状态:NET-new(未在 inference.md 锚入;arXiv:2508.09442 尚未在 knowledge/inference.md 出现)
增量 3【§1.(3) KV Cache · 2026-09-07】🟢 KV Cache Transform Coding:ICLR 2026 录用论文,KV Cache 压缩新方法(arXiv:2511.01815)
- 来源:
inbox/jay/2026-09-07T2115-jay-inference-protocol-deep-dive.md§Academic/arXiv 条目 - 来源链接:
https://arxiv.org/abs/2511.01815 - 作者/机构:未完整披露(ICLR 2026 录用)
- 可信度:高(ICLR 2026 顶会论文)
要点: - 核心方法:将 Transform Coding 应用于 KV Cache 压缩存储,通过学习到的变换减少 KV Cache 内存占用,同时保持推理精度 - 会议级别:ICLR 2026,说明工作质量达到顶会标准 - 工程意义:KV Cache 压缩是减少推理显存占用的核心手段之一;Transform Coding 是一种经典信号压缩方法在 LLM 推理场景的创新应用
与活文档现有脉络的关系: - §1.(3) KV Cache 已有 25+ 篇锚入论文,包括 CacheBridge / HeadWiseKV / VestigeKV / TokenWeave / SwiftCache / SpecPV / LMCache v2 等压缩/复用方案 - KV Cache Transform Coding(ICLR 2026)与这些现有方案形成方法学互补——学习到的变换压缩 vs 显式结构压缩/淘汰策略 - 建议归入节:§1.(3) KV Cache → 新增子节点「Transform Coding:KV Cache 压缩(ICLR 2026)」 - 状态:NET-new(未在 inference.md 锚入)
增量 4【§1.(1) 推理引擎 / §1.(2) 推理调度 · 2026-09-07】🟢 MCP 2026-07-28 Stateless 协议转型 + A2A v1.0 + Agentic AI Foundation 成立(Agent 互操作标准体系正式收敛)
- 来源:
inbox/jay/2026-09-07T2115-jay-inference-protocol-deep-dive.md§Agent Protocol 条目 - 来源链接:
https://modelcontextprotocol.io(MCP)+https://www.agenticfoundation.org(A2A) - 可信度:高(Anthropic 官方方向 + Linux Foundation 主导治理)
要点:
- MCP 2026-07-28 核心变更:协议从"有状态握手 + 连接级 session"转为"每个请求自包含元数据的无状态请求";多轮工具交互改为 input_required + retry 机制;Task 概念移至扩展;旧版 HTTP+SSE / sampling / logging / Dynamic Client Registration deprecated,12 个月过渡期
- MCP 生态定位:MCP = 垂直,工具/数据/资源接入;A2A = 水平,Agent 间发现与任务交接——互补不竞争已成行业共识
- A2A v1.0:2026-08-17 加入 Agentic AI Foundation(Linux Foundation 主导);8 家铂金赞助商(AWS / Anthropic / Google / Microsoft / OpenAI 等);IBM ACP 已并入 A2A
- Agent 互操作标准体系正式收敛:MCP + A2A 双协议格局形成,对推理引擎的 Agent 集成、工具调用、多 Agent 协作有深远影响
与活文档现有脉络的关系: - inference.md §1.1 推理引擎未涵盖 Agent 协议层;§1.(2) 推理调度未涵盖 Agent 互操作标准 - MCP Stateless + A2A v1.0 代表推理引擎从"单模型服务"向"Agent 推理平台"演化的协议基础设施 - 建议归入节:§1.(1) 推理引擎 → 新增子节点「MCP 2026-07-28 Stateless 协议 + A2A v1.0 + Agentic AI Foundation 治理体系」或单独建立 §1.10 Agent 协议层 - 状态:NET-new(未在 inference.md 锚入;MCP Stateless 属于协议层新维度,A2A v1.0 属于治理层新维度)
增量 5【§1.(3) KV Cache / §1.(4) 量化 · 2026-09-07】🟡 paper_card 1243:Recurrent-State Write-Back(arXiv:2609.04490)— 低精度时序推理中的量化状态写回规则
- 来源:
/shared/research-kb/organized/paper_cards/1243-2609-04490.md(2026-09-07 16:30 入库 · 主分类 llm-infra)+inbox/spark/2026-09-07-llm-infra-e1prep.md增量 ⑥ - 来源链接:
https://arxiv.org/abs/2609.04490 - 作者/机构:未完整披露(paper_card TLDR 截断)
- 入库时间:2026-09-07 16:30 CST
- 可信度:中(paper_card 主分类 llm-infra,邻接 inference;应用域为 GRU 荧光寿命成像,非 LLM Transformer 核心)
要点: - 核心问题:量化广泛用于降低神经网络推理的计算和内存需求;在循环网络中,量化状态被存储并在下一时间步返回,因此存储规则会影响后续计算 - 核心概念:引入 recurrent-state write-back 规则——研究量化状态存储规则对后续计算的影响,在 GRU encoder-decoder(荧光寿命成像分子成像)上隔离了该效应 - 实验任务:估计两个寿命参数 τ1(短寿命)和 τ2(长寿命)
与活文档现有脉络的关系: - §1.(3) KV Cache 已有 TokenWeave / CacheBridge / HeadWiseKV / VestigeKV / SwiftCache / SpecPV 等 KV 淘汰/复用方案 - §1.(4) 量化已有完整量化体系(INT4/FP8/NVFP4 / KV Cache 量化 / 投机解码量化) - Recurrent-State Write-Back 概念与 LLM KV Cache 量化写回存在类比关系,但 GRU 循环网络 vs Transformer 是关键差异;适配性为邻接级 - 建议归入节:§1.(3) KV Cache 或 §1.(4) 量化 → 新增子节点「Recurrent-State Write-Back(邻接级 · RNN→Transformer 类比参考)」,优先级 P2 - 状态:NET-new paper_card 入库(主分类 llm-infra,邻接 inference;inference.md 未锚入)
三、值得警惕的矛盾或待核实说法
矛盾 1⚠️:Random Attention(arXiv:2609.03430)HF Daily 164▲ vs paper_card 未入库矛盾(第 3 棒重复出现)
- 矛盾描述:Random Attention 已在 9-5 / 9-6 / 9-7 三棒 e1prep 中被标注为"paper_card 待建卡",HF Daily 持续报 164▲ 高票,但截至 2026-09-07 16:30 paper_card 库仍无 Random Attention 入库记录
- 矛盾来源:
inbox/tom/2026-09-07-0900-hf-daily-2026-09-07.md+inbox/spark/2026-09-07-llm-infra-e1prep.md矛盾标注 - 可能原因:work-queue.md 待建卡统计存在滞后;或主分类被标记为 llm-infra/agent 但分类待 LLM 确认
- 建议:inference.md §1.(3) KV Cache 预备级候选;今晚活文档更新时若仍无 paper_card 入库,则降为待核候选,停止重复标注
矛盾 2⚠️:arXiv:2609.04490 paper_card 1243 主分类 llm-infra 适配性争议
- 矛盾描述:paper_card 1243 主分类标记为 llm-infra,但论文实际应用域为 GRU 循环网络 + 荧光寿命成像(非 LLM/Transformer 推理核心)
- 矛盾来源:
inbox/spark/2026-09-07-llm-infra-e1prep.md矛盾 ③ 标注 - 建议:inference.md 锚入时明确标注为"邻接级 · RNN 时序推理 → LLM Transformer 类比参考",避免误导后续读图者
四、可引用的 arXiv 号列表(5 件净增 + 1 件邻接入库)
净增 5 件
- arXiv:2608.01526 — Internet for the KV Cache: Rethinking Classical Infrastructure Boundaries in the LLM Inference Age(cs.NI · 2026-08 · UIUC/Northeastern · KV Cache 协议范式)
- arXiv:2606.02964 — Multi-Segment Attention: Enabling Efficient KV-Cache Management for Faster LLM Serving / AsymCache(北大团队 · 2026-06 · 位置感知 KV 淘汰)
- arXiv:2606.19746 — SAC: Disaggregated KV Cache System for Sparse Attention LLMs with CXL(北大+阿里云+人大 · 2026-06 · CXL 硬件加速)
- arXiv:2609.04490 — When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference(paper_card 1243 2026-09-07 16:30 入库 · 邻接级)
- arXiv:2511.01815 — KV Cache Transform Coding(ICLR 2026 · KV Cache 压缩 · paper_card 待建)
邻接入库 1 件
- arXiv:2508.09442 — Shadow in the Cache: KV Cache 隐私泄露攻击(NDSS 2026 · 安全 · 待完整读取确认)
待核实 1 件
- arXiv:2609.03430 — Random Attention: 高效推理中 KV Cache 淘汰策略(HF Daily 164▲ · paper_card 未入库 ⚠️ 矛盾 1)
沿用件(已在 inference.md 或预备级)
- arXiv:2608.29188 — Locked at the Entrance(9-5 已入库 · §1.(11)+§1.(12)(v)+§1.(8) 锚入确认)
- arXiv:2609.01072 — CORD(9-4 已锚入 §1.(12)(v))
- arXiv:2608.20359 — SSR: Self-Speculation(9-3 NET-new · 待锚入)
- arXiv:2505.02922 — RetroInfer(9-3 NET-new · 待锚入)
- arXiv:2605.29639 — RTP-LLM(9-3 NET-new · 待锚入)
- arXiv:2608.06557 — Cascade(9-3 NET-new · 待锚入)
- arXiv:2608.13499 — OpScale(9-3 NET-new · 待锚入)
- arXiv:2609.01925 — CRISP(9-3 NET-new · paper_card 1197 已入库 · 待锚入)
- arXiv:2505.11329 — TokenWeave(9-2 NET-new · 待锚入)
- Stream2LLM — MLSys 2026(9-2 NET-new · 待锚入)
- FlexLLM — NSDI 2026(9-2 NET-new · 待锚入)
- FlashAttention-4 — MLSys 2026 Best HM(已锚入)
- ReplaySSM / Silent Hyperparameter / SwiftCache / Albireo(9-1 NET-new · 待锚入)
五、本棒小结
inference 主题 9-6 22:20 → 9-7 22:20 净增量 = 1 条 NET-new paper_card 入库 + 4 条工程/学术层新增 + 1 条矛盾待核
| # | 条目 | 分类 | 价值 | 状态 |
|---|---|---|---|---|
| 1 | SGLang v0.5.19(Beam Search + 统一 RadixAttention + AMD MI355X · 2026-09-05) | §1.(1) 推理引擎 | ⭐⭐⭐⭐ | NET-new(v0.6 已锚;v0.5.19 未锚) |
| 2 | Shadow in the Cache(arXiv:2508.09442 · NDSS 2026 · KV Cache 隐私泄露) | §1.9 安全 | ⭐⭐⭐⭐ | NET-new(未锚入) |
| 3 | KV Cache Transform Coding(arXiv:2511.01815 · ICLR 2026) | §1.(3) KV Cache | ⭐⭐⭐⭐ | NET-new(未锚入) |
| 4 | MCP 2026-07-28 Stateless + A2A v1.0 + Agentic AI Foundation | §1.1 / 新建 §1.10 | ⭐⭐⭐⭐ | NET-new(未锚入) |
| 5 | Recurrent-State Write-Back(arXiv:2609.04490 · paper_card 1243) | §1.(3) / §1.(4) | ⭐⭐⭐ | NET-new paper_card 入库;邻接级 |
| 6 | Random Attention(arXiv:2609.03430 · 164▲) | §1.(3) KV Cache | ⭐⭐⭐ | 矛盾 1:paper_card 未入库,第 3 棒重复出现 |
与 9-5/9-6 两棒对照: - 9-5 增量密度:极低(Locked at the Entrance paper_card 1235 入库,2 条工程层预备) - 9-6 增量密度:极低(0 条 inference 主轴纯增量,4 条 llm-infra 预备级邻接候选) - 9-7 增量密度:相对较高(1 条 paper_card NET-new 入库 + 4 条工程/学术层新增 + 1 条矛盾待核;SGLang v0.5.19 + MCP Stateless + A2A v1.0 + 2 件 KV Cache 顶会论文)
六、检查过的来源汇总
已检查 / 已纳入本棒
- ✅
organized/knowledge/inference.md(2026-09-07 第2次更新标注 · ~500条 arXiv 基线) - ✅
work-queue.md(2026-09-07 22:00) - ✅
inbox/tom/2026-09-07T0840-agent-rag-longcontext-radar.md(inference 0 件) - ✅
inbox/tom/2026-09-07T1440-agent-rag-longcontext-radar.md(inference 0 件) - ✅
inbox/tom/2026-09-07T2040-agent-rag-longcontext-radar.md(inference 0 件) - ✅
inbox/tom/2026-09-07-0900-hf-daily-2026-09-07.md(Random Attention 164▲) - ✅
inbox/jay/2026-09-07T2115-jay-inference-protocol-deep-dive.md(本棒关键源) - ✅
inbox/jay/2026-09-07-inference-engine-comparison.md - ✅
inbox/jay/2026-09-07-inference-primitives-disaggregated.md - ✅
inbox/jay/2026-09-07-physics-of-llm-inference.md - ✅
inbox/jay/2026-09-07-llm-inference-systems-kvcache.md - ✅
inbox/spark/2026-09-07-llm-infra-e1prep.md(7 件 arXiv 含 4 件 inference 邻接) - ✅
inbox/flyp/2026-09-07-multimodal-e1prep.md(multimodal 主分类) - ✅
paper_cards/1243-2609-04490.md(Recurrent-State Write-Back · 2026-09-07 16:30 入库) - ✅
inbox/tom/2026-09-06-inference-e1prep.md(9-6 参照基线) - ✅
inbox/tom/2026-09-05-inference-e1prep.md(9-5 参照基线)
已检查 / 未纳入(无 inference 净新增)
inbox/tom/2026-09-07-rag-e1prep.md(RAG 主轴 · inference 0 件)inbox/tom/2026-09-07-evaluation-e1prep.md(evaluation 主轴)inbox/tom/2026-09-07T1440-agent-rag-longcontext-radar.md(inference 0 件)inbox/spark/2026-09-07-agent-e1prep.md(agent 主轴)inbox/spark/2026-09-07-llm-infra-e1prep.md(llm-infra 主轴,inference 邻接)- paper_cards 9-7 批次(1243 以外 0 件 inference 主分类)、9-6 批次(均为 agent/multimodal/evaluation)
七、优先待锚入的历史 backlog(15 件,本棒新增 5 件仍待正式锚入 inference.md)
| # | 条目 | arXiv | 首次标注日期 | 建议锚入节 | 本棒状态 |
|---|---|---|---|---|---|
| 1 | SSR (Self-Speculation) | 2608.20359 | 9-3 | §1.(5) 投机解码 | 待锚入 |
| 2 | RetroInfer | 2505.02922 | 9-3 | §1.(3) KV Cache | 待锚入 |
| 3 | RTP-LLM | 2605.29639 | 9-3 | §1.(1) 推理引擎 | 待锚入 |
| 4 | Cascade | 2608.06557 | 9-3 | §1.(2) 推理调度 | 待锚入 |
| 5 | OpScale | 2608.13499 | 9-3 | §1.(2) 推理调度 | 待锚入 |
| 6 | CRISP | 2609.01925 | 9-3 | §1.(1) 推理引擎 | 待锚入(paper_card 1197) |
| 7 | TokenWeave | 2505.11329 | 9-2 | §1.2 Kernel | 待锚入 |
| 8 | Stream2LLM | —(MLSys 2026) | 9-2 | §1.(3) KV Cache | 待锚入 |
| 9 | FlexLLM | —(NSDI 2026) | 9-2 | §1.(1) 推理引擎 | 待锚入 |
| 10 | FlashAttention-4 | —(MLSys 2026) | 9-1 | §1.2 Kernel | 已锚入 |
| 11 | ReplaySSM | — | 9-1 | §1.(3) KV Cache | 待锚入 |
| 12 | Silent Hyperparameter | 2605.19537 | 9-1 | §4.1 推理经济学 | 待锚入 |
| 13 | SwiftCache | 2606.16135 | 9-1 | §1.(3) KV Cache | 待锚入 |
| 14 | Albireo | 2606.01927 | 9-1 | §1.2 Kernel | 待锚入 |
| 15 | Internet for KV Cache | 2608.01526 | 9-7 | §1.(3) KV Cache | NET-new 本棒 |
| 16 | AsymCache / Multi-Segment Attention | 2606.02964 | 9-7 | §1.(3) KV Cache | NET-new 本棒 |
| 17 | SAC CXL | 2606.19746 | 9-7 | §1.(3) KV Cache | NET-new 本棒 |
| 18 | KV Cache Transform Coding | 2511.01815 | 9-7 | §1.(3) KV Cache | NET-new 本棒 |
| 19 | Shadow in the Cache | 2508.09442 | 9-7 | §1.9 安全 | NET-new 本棒 |
| 20 | SGLang v0.5.19 | 无 arXiv | 9-7 | §1.(1) 推理引擎 | NET-new 本棒 |
| 21 | MCP Stateless + A2A v1.0 | 无 arXiv | 9-7 | §1.1 / §1.10 | NET-new 本棒 |
Tom · 2026-09-07 22:20 CST · 本棒检查 15+ 来源(tom radar 3 件 + jay 晚间协议简报 1 件 + jay 4 份 inference 相关文件 + spark llm-infra e1prep 1 件 + flyp multimodal e1prep 1 件 + paper_cards 1 件 + inference.md 1 件 + work-queue 1 件)· inference 主题 NET-new 1 条 paper_card 入库(1243)+ 4 条工程/学术层新增 + 1 条矛盾待核 · 涉及 arXiv 号 5 件净增 · 本棒密度显著高于 9-5/9-6 两棒(SGLang v0.5.19 + MCP Stateless + A2A v1.0 + 2 件 KV Cache 顶会论文)