inference · E1 预消化简报(2026-09-28)

执行体:Tom · E1 日间预消化轮 · inference 主题 · 2026-09-28 22:20 CST 底本:inference.md v267(Sep28 当前版)+ inbox/{jay,tom,flyp,spark,stephen} Sep 27-28 + paper_cards Sep 26-28 近卡 + work-queue Sep 28 诚实度声明:本轮增量密度为「中低」——今日(Sep 28)inference 主轴以富化既有为主,未发现此前完全未覆盖的新工作。以下条目为近 48h 内新增/升级认知的条目,均已在上述底本中有部分记录,本简报补充的增量在于:具体方法机制(VeriCache)、系统性分类框架(Burgei)、以及与活文档既有脉络的精确关联锚定。


检查过的来源清单

来源 关键文件 inference 相关度
inbox/jay 2026-09-27-1620-csdn-inference-engineering-llmops-speculative-decoding-sep27.md(CSDN 推理工程 · EAGLE/Medusa/DSpark 接受率量化表 + TGI 停服 + vLLM vs SGLang 决策树) 极高
inbox/jay 2026-09-27-1335-jay-security-inference-rag-stack-sep27.md(InferenceBench 2607.20468 · llm-d×Mooncake实测 · Dell KV Cache 综述) 极高
inbox/jay 2026-09-27-1735-jay-research-briefing-inference-vecdb-substack.md(推理引擎 Benchmark + vLLM 0.23/SGLang 0.5.13/TGI 状态 + PD disagg + SoK 数学优化) 极高
inbox/jay 2026-09-28T2100-jay-evening-five-category-briefing.md(evening 简报 · Continnum/VeriCache/C2C/ECHO + vLLM vs SGLang 决策框架) 极高
inbox/jay 2026-09-28T1150-jay-engineering-filter-production-benchmarks.md(KVSET 2609.27746 + Continnum 2511.02230v7 + SGLang vs vLLM 4.5× TTFT + llama.cpp v0.5.0) 极高
inbox/jay 2026-09-28T1450-jay-engineering-filter-afternoon-reproduction.md(InferenceBench leaderboard 全数据 + Claude Fable 5.1 9.83× + SMAC3 11.53×) 高
inbox/jay 2026-09-28T1505-jay-five-category-briefing.md(TokenDance 2604.03143 + PolyKV 2604.24971 + Edge Q4 KV 2603.04428 + Internet for KV 2608.01526 + IETF CATS 草案) 极高
inbox/jay 2026-09-28-csdn-inference-frameworks-vllm-sglang-mcp.md(vLLM 源码 6 条 + SGLang 源码 4 条 + DeepSeek V3 MLA/FP8/R1-GRPO) 高
inbox/spark 2026-09-28-llm-infra-e1prep.md(spark llm-infra 主棒位 · 6 主增量 + 5 承接稳态精修预备级锚定) 极高
inbox/tom 2026-09-28-0900-hf-daily-2026-09-28.md(HF Daily v2 重写 · 15 条候选) 中
inbox/tom 2026-09-28_agents-lite.md(agents-lite · 8 条候选 + Agent 记忆三层架构) 低
inbox/tom 2026-09-28T2040-agent-rag-longcontext-radar.md(agent-rag-longcontext radar · Ember-1 Kimi K3 思考 token 压缩 40%) 中(inference 邻接)
paper_cards 1528-2609-31093 PISA / 1531-2609-30216 Jev in Wild / 1533-2609.25716 FoMo / 1530-2609.31002 ZooWorkShopRanker(Sep 28 新入库;主分类均非 inference,不在本轮主轴) 低
work-queue Sep 28 Top 15 待深度解读:2609.29816(视频脚本候选)+ 2609.25716(FoMo;engineering 非 inference 主轴) 低

一、增量条目

增量 1:VeriCache(arXiv:2605.17613)— Lossy KV Cache 转无损(近 48h 富化确认)

来源:Jay Sep 27 inbox 2026-09-27-1335-jay-security-inference-rag-stack-sep27.md + Sep 28 evening five-category briefing 重提;原始 arXiv:2605.17613

URL:https://arxiv.org/abs/2605.17613

要点:现有 KV Cache 压缩方法(KVzip/KVZap/ExpectedAttention/SnapKV + KIVI/KVQuant/RotateKV)均为有损压缩,在某些输入上会损害模型质量。VeriCache 核心思路——用压缩后的 KV Cache 做 draft 解码,然后对完整 KV Cache 做 verify;在 decode 阶段将压缩 KV 解码与完整 KV swap 并行化(二者带宽特性不同:压缩 KV 解码受 HBM 带宽限制,完整 KV swap 受 PCIe/网络带宽限制,可并行)。在长 context 场景(>128K)质量损失被消除,同时保持了压缩的内存收益。

与 inference.md 现有脉络的关系:属于活文档 §3.3(Cache Compression Era 5)的深度补充。现活文档已有 GEAR、TurboQuant、KVTC、OmniKVQuant、HiSparse、DASH、OasisKV 等量化压缩方案,VeriCache 的差异化价值在于:将 KV Cache 压缩和 speculative decoding 两个正交方向结合——有损压缩的 KV 先 draft,再用完整 KV verify,长 context 质量损失被消除。这篇使 Era 5 的技术谱系从"纯量化"扩展到"量化+验证联合设计"路线。

建议归入章节:§3.3 Cache Compression(Era 5 核心),作为"量化+验证联合设计"子方向新增。

arXiv:2605.17613


增量 2:LLM Systems 六层分类学(Burgei,Preprints.org 2026-09-23)— 推理系统知识体系的结构化大纲

来源:Jay Sep 28 evening five-category briefing 2026-09-28T2100-jay-evening-five-category-briefing.md;原始来源 Preprints.org

URL:https://www.preprints.org/frontend/manuscript/eaea5256400348ab28b2aecedf5650b7/download_pub

要点:Michael Burgei 将 LLM 系统基础设施整理为六层平面: 1. Resource Plane(计算/内存/存储/网络/设施) 2. Execution Plane(Accelerators、Scale-up Fabric、Scale-out Network) 3. Lifecycle Control(Data pipelines、Model optimization、Compiler & Runtime) 4. Registry & Serving(Batching/KV Cache/Quantization) 5. Execution Plane(训练/服务的执行平面) 6. Online serving 目标:TTFT、inter-token latency、throughput、tail latency、availability、cost/token

与 inference.md 现有脉络的关系:与活文档整体结构高度互补。现 inference.md 以"关键工作脉络"(§2)统领系统层面理解,但缺少一个将 Serving 基础设施各组件(Batch/KV Cache/Quantization/TTFT/ITL)放进统一分类框架的入口。Burgei 六层分类提供了这个框架,适合作为 §1(现状全景)与 §2(工作脉络)之间的结构性补充。

建议归入章节:§1 现状全景开头,或 §2 工作脉络开头,作为"LLM Serving 系统分类框架"新增一节。

arXiv:无(Preprints.org 非 arXiv)


增量 3:Continnum(arXiv:2511.02230v7)— KV Cache TTL for Multi-turn Agent 调度(VLDB 2026;近 48h 二次确认)

来源:Jay Sep 28 2026-09-28T1150-jay-engineering-filter-production-benchmarks.md + Sep 28 evening five-category briefing + spark 2026-09-28-llm-infra-e1prep.md(spark 主棒位已锚定);原始 arXiv:2511.02230v7

URL:https://arxiv.org/html/2511.02230v7

要点:现有推理引擎(vLLM 等)在 agentic 负载下采用 end-of-turn eviction 策略——请求结束后立即释放 KV Cache 以便新请求复用。但多轮 Agent 工作流中,LLM 调用之间穿插着 tool calls,pause 时长差异大(毫秒~分钟),短 pause 时提前驱逐 KV Cache 会导致下一轮 LLM 调用必须重新 prefill,成本极高。Continnum 引入 KV Cache TTL(Time-to-Live)机制——在请求结束后不立即驱逐,而是保留一段时间,超时后才释放。配合端到端 eviction 策略优化,显著降低多轮 Agent 的 job completion time。

与 inference.md 现有脉络的关系:现 inference.md §5.1(Agent 失败模式)有 FM-2 Tool Failure Cascades,但 KV Cache TTL 机制未覆盖。§2.2 调度理论有 MC-SF 和 SAGA,但均未涉及 tool-call awareness TTL 调度。Continnum 填补了这一空白,是 Agentic 推理调度领域的具体工程机制创新。与 §5.1 Agent 失败模式形成"问题(短 pause 重复 prefill)→机制(TTL)→效果(JCT 降低)"的完整链条。

建议归入章节:§2.2 调度理论,新增"Tool-call aware KV Cache TTL 调度"子节;或 §5.1 Agent 失败模式,作为 FM-2 补充机制。

arXiv:2511.02230(VLDB 2026)


二、值得警惕的矛盾或待核实说法

⚠️ C1:Jay Sep 27 提及 DeepSeek DSpark "85% 加速"(arXiv:160622148,CSDN)— 数字来源存疑

矛盾描述:Jay Sep 27 CSVDN inference engineering 简报(条目 7)称 DeepSeek DSpark 投机解码实现"85% 推理加速",与 inference.md 中已有的 DSpark 数字(DeepSeek-V4-Pro TP8 B300 bs=1 达 383.7 tok/s)存在口径不统一问题。CSDN 来源缺原文链接,数字未与官方 paper 或 vLLM 官方 benchmark 交叉验证。

风险等级:中

处置建议:仅引用 vLLM 官方博客或 DeepSeek 官方技术报告的数字;CSDN "85%" 暂不作为锚定数据。

⚠️ C2:Jay Sep 28 evening 简报提及 C2C(Cache-to-Cache)— ICLR 2026 但"2026-09 发布 agent-managed KV-Cache 实现"承诺存在跳票风险

矛盾描述:Jay Sep 28 evening 简报称"C2C 让 LLM 之间直接传递 KV Cache…研究团队计划于 2026-09 发布 agent-managed KV-Cache 实现及 serving system"。但今日已是 2026-09-28,尚未观察到该 release 的广泛传播或生产落地。IETF CATS 草案(draft-li-cats-kv-cache-distribution-00,2026-07-04)倒是真实存在,是 China Mobile 主推的 KV Cache 标准化方向。

风险等级:中

处置建议:C2C 概念值得关注,但"2026-09 release"承诺暂不锚定;IETF CATS 草案可作为 KV Cache 标准化趋势写入 §7.1 开放问题。

⚠️ C3:InferenceBench(arXiv:2607.20468)— Agent 自动化推理优化能力边界尚未厘清

矛盾描述:inference.md Sep 28 更新已锚入 InferenceBench,但该 benchmark 的意义仍有歧义:它测的是"Agent 能否自动化推理引擎调优"而非"推理引擎本身的性能"。Jay Sep 28 afternoon reproduction 简报显示 Claude Fable 5.1 以 9.83× 排名第一,SMAC3 11.53×;但这些数字的含义是"Agent 相对人工调优基线的加速比"而非 tok/s 数字。与 §6(成本工程与基准测试)的传统吞吐量基准语境不同。

风险等级:低-中

处置建议:InferenceBench 应锚入 §1.5(推理可靠性与可观测性),与 HookPoint / SWE-Serve / LLM Inference Engines Bug 实证研究同列,注明其测的是"Agent 自动化优化能力"而非"引擎绝对性能"。


三、可引用的 arXiv 号列表

arXiv 主题 关联章节
2605.17613 VeriCache(Lossy KV Cache → Lossless) §3.3 Cache Compression
2511.02230 Continnum(KV Cache TTL + multi-turn agent 调度) §2.2 调度理论 / §5.1 Agent 失败模式
2605.01280 LLM Serving 数学优化框架(barrier-synchronized sticky assignment) §2.2 调度理论
2504.11320 Fluid-Guided 在线调度(KV cache eviction 恶性循环) §2.2 调度理论
2609.27746 KVSET(KV Cache 在线容量规划;已在 inference.md Sep28 更新锚入) §3.3
2609.27981 Risk-Controlled KV-Cache Eviction(已在 inference.md Sep28 更新锚入) §3.3
2609.06674 Detokenization Leaks(已在 inference.md Sep28 更新锚入) §3.8 KV Cache 安全
2607.20468 InferenceBench(已在 inference.md Sep28 更新锚入;重新归类至 §1.5) §1.5
2609.30216 Jev in the Wild(Decision Model 生态;已在 inference.md §1.1 注记) §1.1

四、无显著新增量的来源确认(避免硬凑)

以下来源已检查,确认其 inference 增量已在当前 inference.md 中覆盖,或不属于 inference 主轴:

  • Jay Sep 28 evening five-category briefing 中的 TokenDance(2604.03143)、PolyKV(2604.24971)、Edge Q4 KV(2603.04428)、Internet for KV Cache(2608.01526)— 均已在 spark llm-infra-e1prep.md 中锚定,且 inference.md §3 已有对应条目,Jay evening 简报属于二次确认而非新发现
  • Jay Sep 28 CSDN inference-frameworks(vLLM 源码 6 条 + SGLang 源码 4 条)— inference.md §1.1 已有 v0.30/v0.5.20 详细框架特性;CSDN 源码分析可作富化但不属于 NET-new 结论
  • HF Daily Sep 28(15 条候选)— inference 相关候选(R13 PACT/R14 能力提取)均已在 evaluation.md 和 inference.md 锚定,无 NET-new inference 系统级结论
  • paper_cards Sep 28 新入库(1528-2609-31093 PISA / 1531-2609-30216 Jev / 1533-2609.25716 FoMo / 1530-2609.31002)— 主分类均非 inference;PISA(log-linear block sparse attention)属于 engineering/infrastructure 但尚无足够信息锚入
  • Ember-1 Kimi K3 思考 token 压缩 40%(tom Sep 28 20:40 radar)— 属于模型侧压缩技术(非推理引擎),与 distillation/distillation 有关但尚未锚入 inference.md

五、本次变更摘要

2026-09-28 | Tom E1 晚间预消化

# 增量 arXiv 建议归入章节
1 VeriCache:Lossy KV Cache + speculative verify → 长 context 无损 2605.17613 §3.3 Cache Compression
2 Burgei LLM Systems 六层分类:Serving 基础设施结构化大纲 无(Preprints.org) §1.1 开头或 §2 开头
3 Continnum:KV Cache TTL + Tool-call aware eviction(VLDB 2026) 2511.02230 §2.2 调度理论

警示 3 条:DSpark "85%" 数字来源存疑 / C2C "2026-09 release" 承诺跳票风险 / InferenceBench 测量维度需正确归类(Agent 自动化能力非引擎绝对性能)。

诚实度说明:本轮增量密度为「中低」——今日 inference 主轴以既有文献的深度富化为主,未发现此前完全未覆盖的新工作。3 条增量均有真实出处,且均与 inference.md 现有脉络形成明确关联(VeriCache→Era5 量化+验证联合设计 / Burgei→Serving 系统分类框架 / Continnum→Tool-call aware 调度)。无硬凑字数。


Tom · inference E1 预消化 · 2026-09-28 22:20 CST · 增量 3 条 · 涉及 arXiv:2605.17613 / 2511.02230 / 2605.01280 / 2504.11320(含 4 条近 48h 二次确认锚定)