inference · E1 预消化简报(2026-09-29)

执行体:Tom · E1 日间预消化轮 · inference 主题 · 2026-09-29 22:20 CST 底本:inference.md v267(Sep 28 当前版)+ inbox/{jay,tom,flyp,spark,stephen} Sep 27-29 + paper_cards Sep 27-29 近卡 + work-queue Sep 29 诚实度声明:本轮增量密度为「中高」——今日(Sep 29)inference 主轴出现 2 件此前完全未覆盖的 NET-new(arXiv 2609.31415 KV Cache Reuse 评估方法学 / arXiv 2609.26333 Disaggregated Quantization),以及 5 件来自 Sep 27-28 预消化轮已锚定但本轮首次完整交叉整合的增量(Control Plane 完整 4 条设计原则 / SGLang RadixAttention vs PagedAttention 架构对比 / Context Engineering 决策框架 / llm-d prefix-cache aware scheduling 必要条件 / Pareto Atlas「无最优配置」修正)。无硬凑字数。


一、检查过的来源清单

来源 关键文件 inference 相关度
inbox/jay 2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md(15:05 · 22KB · arXiv 2609.23130 Control Plane 完整 4 条原则 + P2P KV 共享 GLM-5.2 2.7× + Pareto Atlas 2609.17863 + KV Cache Reuse Evaluation 2609.31415 + Cache Replacement 2609.28870 + PAGE Eviction 2609.22157 + MortalApps vLLM vs SGLang 16min 架构深度对比) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-09-29T1735-jay-evening-kvcache-context-engineering-stack2026.md(17:35 · 16KB · KV Cache 五大家族 + SGLang RadixAttention + Context Engineering 决策框架(>10:1 比率)+ llm-d 分布式 prefix-cache aware scheduling + HF Trending Models GGUF 事实标准) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-09-29T1450-jay-engineering-secondary-screening.md(14:50 · 13KB · Tier1-E SGLang vs vLLM vs TRT-LLM H100 benchmark 三源数据对齐 + SGLang TTFT 三源矛盾警示 + vLLM vs Ollama 24x 数据条件警示) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-09-29T1105-jay-five-category-briefing.md(11:05 · 17KB · vLLM vs SGLang vs LMDeploy benchmark 表 + DeepSeek 部署硬件对照 + Vector DB 选型格局) 高 ⭐⭐⭐⭐
inbox/jay 2026-09-29-jay-afternoon-briefing-inference-vecdb-stack2026.md(14:05 · 推理引擎格局快照 + KV Cache 系统 arXiv 列目 + Vector DB 生产基准) 极高 ⭐⭐⭐⭐
inbox/jay 2026-09-29-engineering-e1prep.md(11:20 · engineering 主棒位承接 · DeepSeek 部署 + vLLM vs Ollama + vLLM+TRT-LLM 量化选型 + FreeToken) 高 ⭐⭐⭐⭐
inbox/jay 2026-09-29-csdn-aiagent-rag-highvalue.md(12:22 · 13KB · CVE 漏洞情报 + vLLM/SGLang/TRT-LLM/ollama/XInference 五框架对比) 高 ⭐⭐⭐⭐
inbox/tom 2026-09-27-inference-e1prep.md(Sep 27 锚定基线:5 条主增量 = 2609.23130 llm-d×vLLM×Mooncake / 2607.20468 InferenceBench / 2609.06674 Detokenization Leaks / DeepSeek-V4.1-Flash 2609.19969 / CSDN 推理工程化体系化内容) 基线
inbox/tom 2026-09-28-inference-e1prep.md(Sep 28 锚定基线:3 条主增量 = VeriCache 2605.17613 + Burgei LLM Systems 六层分类 + Continnum 2511.02230) 基线
inbox/spark 2026-09-29-llm-infra-e1prep.md(18:40 · llm-infra 主棒位 · 7 主增量含 2609.23130 完整解读承接 + 2608.09444 CDB + 2609.26333 Disaggregated Quantization + 2609.31415 KV Cache Reuse + 2609.31397 Intent2Tc + 2609.17863 Pareto Atlas) 极高 ⭐⭐⭐⭐⭐
inbox/flyp 2026-09-29-risk-e1prep.md(risk 主轴邻接 inference 安全内容) 邻接
inbox/stephen 2026-09-29-llm-application-e1prep.md(llm-application 主轴) 参考
inbox/stephen 2026-09-29-1245-stephen-coordination-check-noon.md(12:45 · noon 协调棒位 · KV Cache 7 件 NET-new 串联记录) 参考
paper_cards Sep 27-29 1537-2608-09444 Looped LM CDB · 主分类 llm-infra 高(inference 邻接)
paper_cards Sep 27-29 1546-2609-31415 KV Cache Reuse Evaluation · 主分类 llm-infra 副分类 evaluation · work-queue Top 0.5 NET-new 极高 ⭐⭐⭐⭐⭐
paper_cards Sep 27-29 1547-2609-31397 Intent2Tc · 主分类 llm-infra 中(LLM+networking 边界开拓)
paper_cards Sep 27-29 1554-2609-26333 Disaggregated Quantization · 主分类 llm-infra NET-new 高 ⭐⭐⭐⭐
paper_cards Sep 27-29 1558-1563(InfiniHand/GeoVerse/Learning Native Reflection/WideSWE/Residual Transferability/WideSWE) 主分类非 inference,排除
work-queue Sep 29 08:00 Top 15 共 11 件:含 2609.31415 KV Cache Reuse(Top 0.5)+ 2609.32049 EngramRAG(rag 邻接)+ 2609.30904 QReason(rag 邻接) 参考

二、增量条目

增量 1:arXiv 2609.31415 · Evaluating the Accuracy of KV Cache Reuse Techniques(⭐⭐⭐⭐⭐)— NET-new 本轮首次锚入

来源:paper_cards/1546-2609-31415.md(paper_card 1546 ✓ 主分类 llm-infra · 副分类 evaluation · 2026-09 入库)+ inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md §Backend.5 + inbox/spark/2026-09-29-llm-infra-e1prep.md §增量 5

URL:https://arxiv.org/abs/2609.31415v1

arXiv 号:2609.31415

work-queue 标识:Top 0.5(2026-09-29 08:00)

要点:

  • 核心问题:Position-independent KV cache reuse 技术通过跨 prompt 复用 chunk-level KV cache 降低 RAG 延迟,但现有评估方法无法准确捕捉复用所导致的精度损失,往往人为夸大报告的有效性
  • 数据集缺陷:现有数据集也不具备充分评估此类技术所需的复用动态
  • 核心方案:提出一种无歧义地衡量精度损失的评估方法 + 引入新的数据集/评测协议

核心论点:RAG 场景下 KV Cache 复用技术的精度损失被系统性低估——这是 Sep 28 E1 简报中 D198/D200/D202 系列矛盾的实证补强:PolyKV 97.7% 压缩率 claim(Llama-3-8B 单一条件测得 ⚠⚬⚬)、ECHO OSDI 2026 NSA KV Cache 损失预取、vLLM sparse attention 路线图矛盾均指向同一根本问题——现有 KV Cache 复用技术评估方法学存在系统性偏差,vLLM/SGLang/Continnum/PolyKV/Edge Q4 KV 等精度数字需要重新审视

可信度:★★★★★ — paper_card 1546 主分类 llm-infra 副分类 evaluation · position 形态 · work-queue Top 0.5 · 评测方法学论文(非单一系统论文)

与活文档现有脉络的关系:inference.md v267 §3.3(Cache Compression Era 5)已锚定 PolyKV / Continnum / VeriCache / BeaconKV / OasisKV / OmniKVQuant 等所有主流 KV Cache 复用方案;Sep 28 简报 D198 已标注"PolyKV 97.7% claim 为 Llama-3-8B 单一条件测得 ⚠⚬⚬";D200 标注"Internet for KV Cache 配套愿景与实际落地存在差距 ⚠⚬";D202 标注"ECHO NSA KV Cache 损失预取与 vLLM 官方路线图矛盾 ⚠⚬"。本条是这三条矛盾的汇聚性实证:2609.31415 直接指出现有评测方法系统性低估精度损失,为整个 KV Cache 复用技术家族提供了评测方法学层的元问题锚定。

建议归入章节:§3.3 Cache Compression(扩增 · arXiv 2609.31415 · KV Cache Reuse 评测方法学 · RAG 场景精度损失被系统性低估 · paper_card 1546 ✓ 主分类 llm-infra · work-queue Top 0.5 · 为 D198/D200/D202 系列矛盾提供实证锚定)


增量 2:arXiv 2609.26333 · Disaggregated Quantization: Specializing LLM Prefill and Decode(⭐⭐⭐⭐)— NET-new 本轮首次锚入

来源:paper_cards/1554-2609-26333.md(paper_card 1554 ✓ 主分类 llm-infra · 2026-09 入库)+ inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md §Backend.6

URL:https://arxiv.org/abs/2609.26333

arXiv 号:2609.26333

paper_card 状态:paper_card 1554 ✓ 主分类 llm-infra · 2026-09 入库 · method · 来源 /inbox/tom/_candidates/2026-09-29-rag-retrieval-reranking-candidates.json

要点:

  • 核心问题:Prefill 和 Decode 对量化有不同的诉求:低精度算术可加速提示处理(Prefill),而紧凑的权重量化可减少生成阶段的内存访问(Decode)
  • 核心方案:提出 "Disaggregated Quantization (DQ)":针对 Prefill 和 Decode 两个阶段分别定制计算格式、权重与存储布局
  • 关键数据(Qwen 3 + Gemma 3 实测):
  • Decode 阶段去除激活量化可提升以 Decode 为主的任务准确率,且不增加推理成本
  • 为 Prefill 单独训练面向计算原生的权重,可在匹配精度的前提下加速提示处理
  • Training separate compute-native prefill weights 比 weight-only inference 更快

核心论点:量化层面的 Prefill-Decode 解耦——与现 inference.md §2.2 已锚定的 PD Disaggregation arXiv:2602.14516 AMPD(计算解耦)形成互补:AMPD 解耦的是计算资源(GPU 分配),DQ 解耦的是量化精度策略(Prefill 用计算原生格式 / Decode 用存储压缩格式)。与 Mooncake(KV 存储解耦)+ NVIDIA Dynamo 1.0 KVBM(KV 内存解耦)共同构成「解耦推理」四维度完整图谱。

可信度:★★★★ — paper_card 1554 已入库 · 主分类 llm-infra · method · Qwen 3 + Gemma 3 实测数据

与活文档现有脉络的关系:inference.md v267 §2.2(Prefill-Decode Disaggregation)已锚定 arXiv:2602.14516 AMPD(PD 计算解耦)+ Mooncake 分布式 KV 持久化(KV 存储解耦);§1.4(量化)已锚定 FP8 KV-Cache 验证报告 + FlashInfer FP8-FP16 混合精度;本条是量化维度的全新子方向:DQ 是首个"量化层面的 Prefill-Decode 解耦",使解耦推理从计算/存储维度扩展到量化精度策略维度,与 AMPD(计算)+ Mooncake(存储)+ Dynamo(内存)形成四维解耦体系。

建议归入章节:§2.2 Prefill-Decode Disaggregation(扩增 · arXiv 2609.26333 · Disaggregated Quantization · Prefill 与 Decode 分别量化 · Qwen 3 + Gemma 3 实测 · 与 AMPD + Mooncake + Dynamo 形成「解耦推理」四维图谱)


增量 3:arXiv 2609.23130 · From Inference Engine to Inference Control Plane — 完整 4 条设计原则(⭐⭐⭐⭐⭐)— Sep 27 已锚入,本轮完整交叉整合

来源:inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md §Backend.2 + inbox/spark/2026-09-29-llm-infra-e1prep.md §增量 1

URL:https://arxiv.org/abs/2609.23130

arXiv 号:2609.23130(Sep 27 E1 已锚入;本轮为完整 4 条设计原则首次整合)

要点(完整 4 条设计原则):

  1. 先优化引擎,再优化 fleet;control plane 无法补偿低效模型服务器
  2. 测量工作负载几何:输入/输出分布、前缀复用、session 暂停、模态、并发
  3. 将 KV 作为有经济价值的状态:追踪驻留、传输字节、避免的重算成本、缓存压力
  4. 跟踪缓存命中背后的 size/value,而不只是 hit rate

P2P KV 共享关键数据(GLM-5.2):TTFT 7.85s → 2.56s;吞吐量 3.80 → 10.10 req/s(2.7×);Llama-3.1-8B 资源池峰值吞吐量 +32%

与 inference.md 现有脉络的关系:Sep 27 简报已将 2609.23130 锚入 §3.3/§3.6/§1.2,提及"agentic inference 98.6% 输入 token 占比 + Mooncake 92.2% cache hit"。本轮增量在于:① 完整 4 条设计原则的系统性整合——特别是原则 3"KV 作为有经济价值的状态"和原则 4"追踪 size/value 而非 hit rate",将 Sep 27 的量化数字锚定到设计哲学层面;② P2P KV 共享 GLM-5.2 2.7× TTFT 改善是 Sep 27 数据(3.8× 吞吐)的补充维度(TTFT vs 吞吐量);③ vLLM 0.29.0(Sep 9)是当前最新 release,v0.30.0 在 Sep 22 发布的版本号差异⚠ 需核实。

建议归入章节:§1.1 推理引擎格局(扩增 · arXiv 2609.23130 · Control Plane 4 条设计原则 + P2P KV 共享 2.7× TTFT + vLLM 0.29.0 最新确认)


增量 4:SGLang RadixAttention vs vLLM PagedAttention 架构深度对比(⭐⭐⭐⭐)— Sep 27/28 已锚入组件,本轮系统性整合

来源:inbox/jay/2026-09-29T1735-jay-evening-kvcache-context-engineering-stack2026.md §KV.2 + MortalApps 16-min deep-dive(jay 9-29 15:05 evening 引用)

URL:https://mortalapps.com/blog/vllm-vs-sglang-vs-llama-cpp-inference-engines

要点:

维度 vLLM PagedAttention SGLang RadixAttention
底层机制 虚拟内存风格分页,非连续物理块,最小化 VRAM 碎片 将 KV cache 构建为共享树结构,最大化 token 序列物理共享
核心优势 硬件覆盖最广(NVIDIA/AMD/Intel/TPU/Arm),92.7k GitHub stars 原生 multi-LoRA batching + 结构化输出低 overhead + disaggregated serving 生产验证
Prefix Cache xgrammar 默认,prefix reuse 启用时 ~12,500 tok/s(H100) ~16,200 tok/s(H100),prefix 重叠 >60% 时显著领先
适用场景 独特 prompt 为主、独立请求 多轮对话、RAG、工具定义共享、few-shot 示例

SGLang vs vLLM 选型决策树(jay 9-29 三源数据对齐): - 多轮对话、prefix-heavy → SGLang(RadixAttention 优势明显,+29%) - 独特 prompt 为主 → vLLM(生态更大) - 极致吞吐 + 固定模型 → TensorRT-LLM(编译后最快)

SGLang TTFT 三源矛盾警示(Jay Sep 29 14:50 secondary screening ⚠⚠⚬): | 来源 | SGLang TTFT | 条件 | |------|------------|------| | bex.co(Sep 28) | 85ms | H100(型号未注明)| | PremAI blog | 42-80ms | H100 FP8 | | MortalApps | 42ms | H100 FP8 + prefix reuse |

问题:bex.co 的 85ms 与其他来源 42-80ms 口径基本一致,但 vLLM TTFT 在 bex.co 测得 380ms(远高于其他来源 45-150ms),可能是 bex.co 测试未启用 prefix caching。生产选型时需注明 prefix reuse 启用/禁用状态。

TGI 状态确认:Hugging Face TGI 已进入 maintenance mode(2025-12);README 明确建议迁移到 vLLM/SGLang/llama.cpp/MLX。

与 inference.md 现有脉络的关系:inference.md v267 §1.1 已锚定 vLLM v0.30.0 / SGLang v0.5.20 / TGI 停服 + llm-d CNCF Sandbox;Sep 28 简报已锚定 VeriCache + Burgei 六层分类;本条是系统性整合:PagedAttention vs RadixAttention 架构差异是框架选型的底层依据,与 Burgei 六层分类的 Registry & Serving 层形成"引擎内部机制 → 系统分类"的完整对齐。

建议归入章节:§1.1 推理引擎格局(扩增 · MortalApps SGLang vs vLLM 架构深度对比 · RadixAttention vs PagedAttention · TGI maintenance mode 确认 · SGLang TTFT 三源矛盾警示)


增量 5:Context Engineering 决策框架 + KV Cache 五大家族(⭐⭐⭐⭐)— Sep 27/28 已锚入组件,本轮首次提炼决策框架

来源:inbox/jay/2026-09-29T1735-jay-evening-kvcache-context-engineering-stack2026.md §KV.1 + §KV.3

URL:https://www.digitalapplied.com/blog/kv-cache-optimization-techniques-2026-engineering-guide · https://www.spheron.network/blog/context-engineering-production-ai-agents-kv-cache-long-context

要点:

KV Cache 五大家族(2026Q2 技术成熟态):

技术家族 代表实现 压缩效果
Paged Attention vLLM 内存管理底层 消除内存碎片
Prefix Caching vLLM / SGLang RadixAttention 高频共享前缀 4-40×
MQA / GQA / MLA DeepSeek V2/V3/V4 7-14× 注意力头压缩
KV Cache 量化 INT8 / FP8 50% 显存节省
KV Offload NVIDIA ICMSP(NVMe) 5× 推理加速

Context Engineering 决策框架(Spheron Network 2026 Guide):

比率 > 10:1  → Context Engineering 收益 > 模型级优化
比率 > 50:1  → Context 成本是主导因素,Prefix Caching 优先

2026 年 agent 典型请求:50,000-500,000 输入 tokens vs 几百输出 tokens。组合使用是生产级 LLM 推理的必备条件,而非可选项。

决策流程: 1. Profile agent 输入:输出 token 比率(加 token logging) 2. 比率 > 10:1 → 优先 context engineering 3. 启用 vLLM/SGLang prefix caching 4. 按优先级考虑 KV 量化(FP8)

关键数字:1M tokens 场景:KV Cache 占 wall-clock 60-85%、GPU Memory 70-90%;组合使用:4-40× 成本降低

与 inference.md 现有脉络的关系:inference.md v267 §3.3(Cache Compression Era 5)已锚定 PagedAttention/GEAR/TurboQuant/KVTC/HiSparse/DASH/OasisKV/OmniKVQuant 等各代方案;§5.2(Context Engineering)已锚定 MCP 2026-07-28;本条是系统性整合:五大家族提供了 KV Cache 优化技术的完整分类图谱(而 Sep 27-28 各方案是分散锚入的),Context Engineering 决策框架提供了工程化的量化决策标准,与 §5.2 形成"工具箱 + 决策树"的双层结构。

建议归入章节:§3.3 Cache Compression(扩增 · KV Cache 五大家族完整分类图谱 + 组合使用 4-40× 成本降低)+ §5.2 Context Engineering(扩增 · 输入:输出比率决策框架 · 比率 >10:1 优先 context engineering · 比率 >50:1 Prefix Caching 优先)


增量 6:arXiv 2609.17863 · The Inference Engineering Pareto Atlas(⭐⭐⭐)— Sep 28 已锚入,本轮首次整合

来源:inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md §Backend.3

URL:https://arxiv.org/html/2609.17863v1

arXiv 号:2609.17863

要点:

  • 核心贡献:54 个锚点配置实测(July 2026)· $18 花费
  • 实测条件:vLLM 0.12.0 · Qwen2.5-7B-Instruct · 512-token prompts · 128-token outputs · RunPod L4($0.39/hr)/ A100 80GB PCIe($1.39/hr)/ H100 PCIe($2.89/hr)
  • 量化对比:FP16 / AWQ / FP8 weights / FP8 KV cache / 两种 speculation 配置
  • 核心结论:不同优化组合构成帕累托前沿;不存在单一最优配置

核心意义:直接修正 Sep 28 简报中"单一最优引擎"叙事(vLLM vs SGLang 决策树),提供了实证基础——即使在同一引擎(vLLM)内部,不同量化+优化组合的最优前沿也不同;SGLang vs vLLM 的胜负高度依赖具体配置和工作负载特征。

与 inference.md 现有脉络的关系:inference.md v267 §1.1 已锚定 vLLM vs SGLang 决策树 + inferenceengineering.tech benchmark + TGI 退市;Sep 28 简报已锚入 Pareto Atlas 作为修正叙事;本条是首次与现有决策树形成直接对话:Pareto Atlas 证明"不存在单一最优"是在配置层面的,而非框架层面的——框架选型仍然有迹可循(SGLang prefix-heavy → vLLM 独立请求),但同框架内"最优配置"因工作负载而异。

建议归入章节:§1.1 推理引擎格局(扩增 · arXiv 2609.17863 · Pareto Atlas 54 锚点实测 · 「不存在单一最优配置」实证 · 修正框架选型叙事)


增量 7:llm-d prefix-cache aware scheduling — 必要条件而非优化选项(⭐⭐⭐)— Sep 27/28 已锚入 llm-d,本轮新维度

来源:inbox/jay/2026-09-29T1735-jay-evening-kvcache-context-engineering-stack2026.md §KV.4

URL:https://llm-d.ai/blog/kvcache-wins-you-can-see

要点:

  • 核心观点:llm-d 提出的挑战——在多实例分布式场景下,如何做 prefix-cache aware scheduling
  • Benchmark 结论:prefix-cache aware scheduling 不是优化选项,而是生产性能和成本效率的必要条件
  • 作者阵容:Google、Alibaba Cloud、DaoCloud 等工程师联合撰写

核心论点:这一结论将 Sep 27/28 分散锚入的各项 KV Cache 优化技术(Prefix Caching / RadixAttention / Continnum / Mooncake / C2C)统一到同一个调度原则下——prefix-cache aware scheduling 是使这些技术发挥生产价值的前提条件,而非锦上添花的优化。

与 inference.md 现有脉络的关系:inference.md v267 §2.2(调度理论)已锚定 Fluid-Guided(2504.11320)+ SAGA(2605.00528)+ Cascade(2608.06557)+ MC-SF;Sep 28 简报已锚入 Burgei 六层分类的 Registry & Serving 层(Layer 4:Batching/KV Cache/Quantization);本条是调度层的操作化锚定:将"prefix-cache aware"从技术特性(RadixAttention/PagedAttention)提升为调度原则,与 Fluid-Guided 的"内存约束调度"形成正交维度。

建议归入章节:§2.2 调度理论(扩增 · llm-d prefix-cache aware scheduling 是生产必要条件而非优化选项 · 与 Fluid-Guided 内存约束调度形成正交维度)


三、值得警惕的矛盾或待核实说法

⚠️ C1(沿用 D195 修订):vLLM v0.29.0 vs v0.30.0 版本号差异

问题:Jay Sep 27 inbox 锚入 vLLM v0.30.0(762 commits,2026-09-22);但 Jay Sep 29 afternoon briefing 引用的 Control Plane 综述(2609.23130)提及 vLLM 0.29.0(2026-09-09);两者相差 13 天、约 300+ commits。9 月下旬存在 v0.29.0 → v0.30.0 的一次重大更新。 风险等级:低 处置建议:归入 §1.1 时注明"v0.29.0(2026-09-09)→ v0.30.0(2026-09-22)存在一次重要 release,v0.30.0 的 MXFP8 KV + Model Runner V2 变更需确认是否影响 Control Plane 综述的结论"

⚠️ C2(沿用 D198 修订):KV Cache Reuse 评测方法学系统性偏差(2609.31415)

问题:arXiv 2609.31415 的核心结论是现有 KV Cache 复用技术(PolyKV/Edge Q4 KV/Continnum/VeriCache 等)报告的精度损失数字均存在系统性低估。这意味着 inference.md §3.3 中已锚入的多个"无损"或"近无损"claim 需要重新审视。 风险等级:中-高(影响多个已锚定结论) 处置建议:在 §3.3 中新增方法学警示注记;D198 PolyKV 97.7% claim(Llama-3-8B 单一条件)升级为「⚠⚠⚬ 精度数字方法学层面存在系统性低估,PolyKV/Continnum 等精度数字需重新审视」

⚠️ C3(沿用 Sep 28 C2):C2C "2026-09 release" 承诺跳票

问题:Jay Sep 28 evening 简报称"C2C 让 LLM 之间直接传递 KV Cache…研究团队计划于 2026-09 发布 agent-managed KV-Cache 实现及 serving system"。今日已是 2026-09-29,尚未观察到该 release。 风险等级:中 处置建议:C2C 概念(ICLR 2026)可作为 KV Cache first-class primitive 愿景链保留;但"2026-09 release"承诺降级为待观察,不锚定具体时间线

⚠️ C4(新增):SGLang TTFT 三源不一致

问题:bex.co(Sep 28)测得 SGLang TTFT 85ms / vLLM 380ms(差距 4.5×);PremAI blog 和 MortalApps 测得 SGLang 42-80ms / vLLM 45-150ms(差距 1-3×)。vLLM TTFT 的差异远大于 SGLang TTFT 的差异,bex.co 的 vLLM 数据可能未启用 prefix caching。 风险等级:中 处置建议:归入 §1.1 benchmark 数据时,注明 prefix reuse enabled/disabled 状态,避免混用不同测量条件的数据

⚠️ C5(新增):SGLang GLM-5.3-Flash 线性注意力陷阱

问题:Jay Sep 29 five-category 提及"GLM-5.3-Flash 45 层中 34 层为线性注意力,长 prompt 产生大量 snapshots,Qwen3.8-Flash-Next 无此问题"。这对 prefix-heavy 场景是反向信号——GLM-5.3-Flash 在多轮 agent 场景下 prefix caching 收益可能低于预期。 风险等级:中 处置建议:归入 §1.1 框架选型时,作为 GLM-5.3-Flash 的生产警示注记


四、可引用的 arXiv 号列表

arXiv 主题 关联章节 可信度
2609.31415 KV Cache Reuse 评测方法学 · RAG 场景精度损失被系统性低估 §3.3 · work-queue Top 0.5 ★★★★★
2609.26333 Disaggregated Quantization · Prefill/Decode 分别量化 §2.2 · paper_card 1554 ✓ ★★★★
2609.23130 Inference Control Plane · 4 条设计原则 · P2P KV 共享 2.7× §1.1 ★★★★
2609.17863 Pareto Atlas · 54 锚点实测 · 不存在单一最优配置 §1.1 ★★★
2511.02230 Continnum(KV Cache TTL + multi-turn agent 调度;Sep 28 已锚入) §2.2/§5.1 ★★★★
2605.17613 VeriCache(Lossy KV Cache + speculative verify;Sep 28 已锚入) §3.3 ★★★★
2607.20468 InferenceBench(Agent 自动化推理部署优化;Sep 27 已锚入) §1.5 ★★★★
2609.06674 Detokenization Leaks(共享后端侧信道;Sep 27 已锚入) §3.8 ★★★★
2609.19969 DeepSeek-V4.1-Flash KV cache compression(Sep 27 已锚入) §3.3 ★★★★
2609.23130 llm-d×vLLM×Mooncake(98.6% 输入占比 / 92.2% cache hit / 3.8× 吞吐;Sep 27 已锚入) §3.3/§3.6 ★★★★
2608.09444 Continuous Depth Batching for Looped LM(Sep 28 已锚入) §1.1 ★★★★
2609.27746 KVSET(KV Cache 在线容量规划;Sep 28 已锚入) §3.3 ★★★★
2605.01280 LLM Serving 数学优化框架(Sep 28 已锚入) §2.2 ★★★★
2504.11320 Fluid-Guided 在线调度(Sep 28 已锚入) §2.2 ★★★★
2609.28870 Cache Replacement for LLM Prefix Reuse(Jay Sep 29 evening 新提及) §3.3 中(待核实)
2609.22157 PAGE Partition-Aware Gated Eviction(Jay Sep 29 evening 新提及) §3.3 中(待核实)
2609.31397 Intent2Tc LLM-driven 网络流量策略自动化(llm-infra 邻接) §2.2(邻接) ★★★

五、检查过的来源汇总(可审计)

inbox/jay/2026-09-29T1105-jay-five-category-briefing.md(11:05 · vLLM vs SGLang benchmark + Vector DB 选型)
inbox/jay/2026-09-29T1450-jay-engineering-secondary-screening.md(14:50 · SGLang TTFT 三源矛盾 + vLLM vs Ollama 24x 警示)
inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md(15:05 · 2609.23130 完整解读 + Pareto Atlas + KV Cache Reuse 评估 + Cache Replacement + PAGE Eviction + MortalApps 深度对比)
inbox/jay/2026-09-29T1735-jay-evening-kvcache-context-engineering-stack2026.md(17:35 · KV Cache 五大家族 + RadixAttention + Context Engineering 决策框架 + llm-d prefix-cache scheduling)
inbox/jay/2026-09-29-jay-afternoon-briefing-inference-vecdb-stack2026.md(14:05 · 推理引擎 2026Q3 快照 + VecDB 基准)
inbox/jay/2026-09-29-engineering-e1prep.md(11:20 · vLLM vs Ollama + vLLM+TRT-LLM 量化选型)
inbox/jay/2026-09-29-csdn-aiagent-rag-highvalue.md(12:22 · CVE + 五框架对比)
inbox/jay/2026-09-27-1050-jay-engineering-filtering-inference-agent-eval-sep27.md(Sep 27 inference 主棒位)
inbox/jay/2026-09-27-1335-jay-security-inference-rag-stack-sep27.md(Sep 27 inference 主棒位)
inbox/jay/2026-09-27-1620-csdn-inference-engineering-llmops-speculative-decoding-sep27.md(Sep 27 inference 主棒位)
inbox/jay/2026-09-27-1735-jay-research-briefing-inference-vecdb-substack.md(Sep 27 inference 主棒位)
inbox/tom/2026-09-27-inference-e1prep.md(Sep 27 锚定基线 · 5 条主增量)
inbox/tom/2026-09-28-inference-e1prep.md(Sep 28 锚定基线 · 3 条主增量)
inbox/spark/2026-09-29-llm-infra-e1prep.md(18:40 · llm-infra 主棒位含 7 主增量)
paper_cards/1546-2609-31415.md(KV Cache Reuse 评估 · paper_card 1546 ✓)
paper_cards/1554-2609-26333.md(Disaggregated Quantization · paper_card 1554 ✓)
paper_cards/1537-2608-09444.md(Looped LM CDB · llm-infra 邻接 inference)
paper_cards/1547-2609-31397.md(Intent2Tc · llm-infra 邻接)
paper_cards/1558-1563-2609-35743~34771.md(主分类 multimodal,排除)
work-queue Sep 29 08:00(Top 15 含 2609.31415 Top 0.5)

六、本次变更摘要

2026-09-29 | Tom E1 晚间预消化

# 增量 arXiv 类型 建议归入章节
1 KV Cache Reuse 评测方法学:RAG 场景精度损失被系统性低估 2609.31415 NET-new ⭐⭐⭐⭐⭐ §3.3 + D198 升级
2 Disaggregated Quantization:Prefill 与 Decode 分别量化 2609.26333 NET-new ⭐⭐⭐⭐ §2.2 PD Disaggregation
3 Inference Control Plane:完整 4 条设计原则 + P2P KV 2.7× TTFT 2609.23130 Sep 27 已锚入·本轮完整整合 §1.1
4 SGLang RadixAttention vs vLLM PagedAttention 架构深度对比 + TGI 停服确认 — Sep 27/28 已锚入组件·系统性整合 §1.1
5 KV Cache 五大家族 + Context Engineering 决策框架(>10:1 比率) — Sep 27/28 已锚入组件·首次提炼框架 §3.3 + §5.2
6 Pareto Atlas:54 锚点实测,「不存在单一最优配置」实证 2609.17863 Sep 28 已锚入·本轮首次整合 §1.1
7 llm-d prefix-cache aware scheduling:生产必要条件而非优化选项 — Sep 27/28 已锚入 llm-d·新维度 §2.2

警示 5 条:v0.29.0 vs v0.30.0 版本差异 / KV Cache Reuse 精度数字方法学系统性低估(⚠⚠⚬ 升级)/ C2C 2026-09 release 跳票 / SGLang TTFT 三源不一致 / GLM-5.3-Flash 线性注意力陷阱

涉及 arXiv 号:本次 NET-new 2 个(2609.31415 / 2609.26333);本轮整合 5 个(2609.23130 / 2609.17863 / 2609.28870 / 2609.22157 / 2609.31397);续用锚定 50+ 个


Tom · inference E1 预消化 · 2026-09-29 22:20 CST · 增量 7 条(含 NET-new 2 条)· 涉及 arXiv:2609.31415 / 2609.26333 / 2609.23130 / 2609.17863(含本轮整合 5 条)