inference · E1 预消化简报(2026-09-09)

实例:Tom · inference 主题 E1 日间预消化轮 · cron e627b203-77c1-4f5a-a634-26925ef1b683 生成时间:2026-09-09 22:20 CST(Asia/Shanghai) 窗口期:2026-09-08 22:20 → 2026-09-09 22:20 CST(约 24h 接力净窗口) 基线活文档:organized/knowledge/inference.md(最后更新 2026-09-09 · 新增 FlashPrefillV2 + CRISP + Hypernova-60B + 量化写回 + TorchTPU + SGLang v0.5.19 + NVIDIA 收购 HF + MCP Stateless) 昨夜基线 E1 报告:inbox/tom/2026-09-08-inference-e1prep.md(9-8 22:23 · 5 条主增量)


状态摘要

  • 状态:已 ok
  • 增量条数:7 条主增量(在 3-8 目标区间;含 3 件 NET-new arXiv 锚入预备级 + 1 件新 paper_card 主分类入库 + 1 件工程方法学 NET-new + 2 件事件级/方法学 NET-new)
  • 涉及 arXiv 号:9 件 = arXiv:2609.04971(BeaconKV · paper_card 1278 主分类 llm-infra 入库)+ arXiv:2609.07821(A*-Thought-V2 · 候选摘要)+ arXiv:2609.07139(Encoded Early, Used Late · 候选摘要)+ arXiv:2606.17104(Prefill/Decode-Aware Evaluation · IPDPS 2026)+ arXiv:2607.02574(KV Cache Management Survey · 30+ 系统)+ arXiv:2604.25724(Compound AI Systems · Salesforce 生产规模)+ arXiv:2603.16104(Efficient LLM Serving for Agentic Workflows · cache hit rates)+ arXiv:2609.04010(Discrete Diffusion · 候选摘要)+ arXiv:2605.01280(LLM Serving Needs Math Optimization · 预备级续立)
  • 涉及 CVE:无
  • 性质:昨夜基线 E1 报告(9-8 22:23 · 5 条主增量)之后 24h 接力净窗口;本棒增量集中在 (a)3 件 NET-new arXiv 锚入预备级(BeaconKV 主分类入库 + A-Thought-V2 + Encoded Early Used Late);(b)4 件工程/方法学新信号(Prefill/Decode-Aware Eval + KV Cache Survey + Agentic Workflows cache hit + Compound AI scaling);(c)2 件事件级方法学*(vLLM 冷启动 8min→1min + SGLang BCG DeepSeek V4 +11.80% 吞吐)

一、本棒检查过的来源清单

1.1 work-queue.md(2026-09-09 22:00 自动生成)

  • 待建卡 8 件(2609.09123 Mask Forcing · 2609.08977 Omni Interaction Agent · 2609.04010 Discrete Diffusion 等);仅 arXiv:2609.04971 BeaconKV 为本棒位 inference 主轴 NET-new(其他分别对应 multimodal/agent/multimodal 主分类)
  • arXiv:2609.04971 BeaconKV 状态:paper_card 1278 已 2026-09-09 16:30 入库(主分类 llm-infra);work-queue 待建卡 #2 应在下次 cron 重建时清理

1.2 inbox/tom 9-9 棒位

  • 2026-09-09T2040-agent-rag-longcontext-radar.md(9-9 20:40 CST · tom 文献雷达 · inference 主轴核心 = 🟢 A*-Thought-V2 8票 + Encoded Early Used Late 14票)
  • 2026-09-09-rag-e1prep.md(9-9 08:52 CST · tom rag e1prep · 0 件 NET-new inference)
  • 2026-09-09-evaluation-e1prep.md(9-9 15:44 CST · tom eval e1prep · 0 件 NET-new inference)
  • 2026-09-09-0900-hf-daily-2026-09-09.md(9-9 09:00 CST · tom HF Daily · Random Attention 317票续立极显著 + BeaconKV 12票续立)

1.3 inbox/jay 9-9 全天棒位(inference 主轴最强累积)

  • 2026-09-09-llm-inference-engineering-screening.md(9-9 14:50 CST · jay 工程筛选 · 4 件 arXiv NET-new 锚入预备级 = arXiv:2606.17104 + arXiv:2607.02574 + arXiv:2604.25724 + arXiv:2603.16104)
  • 2026-09-09T1620-jay-csdn-kvcache-mcp-highvalue.md(9-9 16:20 CST · jay KV Cache + MCP · 预备级沿用)
  • 2026-09-09T1050-jay-engineering-filter-sep09pm.md(9-9 18:50 CST · jay 工程筛选下午版 · 🟢 6 件事件级/方法学 NET-new = SGLang BCG DeepSeek V4 + vLLM 冷启动 8min→1min + DeepSeek V4 Flash Vision + NVIDIA NVFP4 Blackwell + PremAI 横评 + Snowflake Semi-Persistence + DGX Spark GB10)
  • 2026-09-09T2116-jay-evening-five-category-briefing.md(9-9 21:16 CST · jay 五类简报 · inference 主轴 = vLLM vs SGLang vs LMDeploy benchmark + AWS SGLang PD 分离 + Ken Huang 10 篇系列)
  • 2026-09-09-llm-inference-agent-engineering.md(9-9 19:51 CST · jay 工程筛选 · inference 主轴 = ISO-Bench + InferenceBench + arXiv:2605.01280 + Fluid-Guided + Agent Stack 2026)

1.4 inbox/spark 9-9 llm-infra e1prep(已详读)

  • 2026-09-09-llm-infra-e1prep.md(9-9 18:40 CST · spark · 8 条主增量 · paper_card 1278 BeaconKV 主分类 llm-infra 入库 + 5 件 arXiv NET-new 锚入预备级)
  • 本棒 inference E1 复用 spark 棒位信号,已与 inference.md 活文档交叉比对去重

1.5 inbox/flyp 9-9 棒位

  • 2026-09-09-multimodal-e1prep.md(9-9 09:43 CST · flyp multimodal e1prep · 0 件 NET-new inference)
  • 2026-09-09-risk-e1prep.md(9-9 16:40 CST · flyp risk e1prep · 0 件 NET-new inference)

1.6 inbox/stephen 9-9 棒位

  • 2026-09-09-llm-application-e1prep.md(9-9 21:14 CST · stephen · 0 件 NET-new inference)
  • 2026-09-09-ai-industry-e1prep.md(9-9 10:23 CST · stephen · 0 件 NET-new inference)

1.7 paper_cards 近 3 天新增 inference 相关(2026-09-07 → 2026-09-09 22:00)

  • paper_cards/1278-2609-04971.md(9-9 16:30 入库 · 主分类 llm-infra · BeaconKV · 本棒位 NET-new paper_card 入库)
  • paper_cards/1243-2609-04490.md(9-7 16:30 入库 · 主分类 llm-infra · When Quantization Breaks Memory · 已在 inference.md §3.7 锚入)
  • paper_cards/1235-2608-29188.md(9-7 16:30 入库 · 主分类 llm-infra · ReCo CoT 膨胀 · 已在 inference.md §5.1 锚入)
  • paper_cards/1231-2609-04094.md(9-7 04:00 入库 · 主分类 agent · DRACO · 与 inference 邻接)
  • paper_cards/1264-2609-04010.md(9-9 04:00 入库 · 主分类 multimodal · Discrete Diffusion · 已在 inference.md §1.3 锚入)
  • paper_cards/1242-2609-04061.md(9-8 04:00 入库 · 主分类 llm-infra · 相关邻接)
  • 待入库 inference 相关候选(tom 9-9 20:40 radar 候选摘要表):
  • A*-Thought-V2 (arXiv:2609.07821 · 9-7 · HF Daily 8票 · CoT 几何压缩)
  • Encoded Early, Used Late (arXiv:2609.07139 · 9-6 · HF Daily 14票 · Transformer 内部推理)

inference 主分类净入库数(本棒位 1 件 NET-new):paper_card 1278 BeaconKV(主分类 llm-infra)入库;其他 inference 邻接级 paper_card 均已在活文档锚入。


二、今日 inference 主题最重要的 7 条主增量

增量 ① 🟢 paper_card 1278 arXiv:2609.04971 BeaconKV NET-new 主分类 llm-infra 入库(2026-09-09 16:30)

来源:paper_cards/1278-2609-04971.md + inbox/tom/2026-09-09-agent-rag-longcontext-radar.md 条目 #1 + inbox/spark/2026-09-09-llm-infra-e1prep.md §增量 ①

要点: - arXiv:2609.04971 BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference(2026-09-03):大推理模型(LRM)通过长 Chain-of-Thought 推理链实现更优的问题解决能力,但 KV cache 随序列长度线性膨胀,经常超出 GPU 容量限制;现有 KV cache 压缩方法依赖"近期 query 估计未来 token 重要性"的假设——论文发现该假设在长程推理场景下失效,因为某些解码步会生成"Thought Revisiting Tokens(TRT)",重新 attend 远距离上下文;BeaconKV 引入 beacon query 引导 KV 压缩,直接打破 recent query 假设 - 意义:长思维链推理的 KV cache 压缩问题已被集中攻关;today 9-9 radar 趋势研判"② KV Cache 压缩是下一个热点"强验证;直接影响 Agent 部署成本(LRM 长 CoT 是 Agent 任务复杂化的关键路径)

与活文档 knowledge/inference.md 现有脉络的关系: - inference.md §3.(3) KV Cache Compression 已锚入 FlashPrefill V2(均值修正) + CRISP(悬崖感知路由) + TurboQuant(FP8 压缩) + KVTC(20× 压缩) + GEAR + Random Attention + HeadWiseKV + VestigeKV + CacheBridge + OasisKV + ReCache + SwiftCache 等 - BeaconKV 的核心差异化价值:首次揭示 TRT(思维回访 token)现象——LRM 在长推理链中会重新 attend 远距离上下文,导致传统"近期 query 代理"假设失效;引入 beacon query 引导作为替代方案;与 FlashPrefill V2(误差修正)和 CRISP(质量保护)共同构成稀疏 prefill 三轴——但 BeaconKV 针对的是KV 淘汰策略,而非 prefill 稀疏计算 - 与 inference.md §3.(6) KV Cache 安全中 Shadow in Cache / MATS Research 加密推理形成"LLM 内部推理机制 → KV cache 管理策略"的纵向关联

建议归入:inference.md §3.(3) KV Cache Compression 升档闭合预备级(BeaconKV 长思维链 KV 压缩 + beacon query 引导 + TRT 远距离 attend 现象发现)+ §1.(6) 长上下文子轴邻接级(LRM/CoT 推理的 KV 效率问题)

arXiv 号:arXiv:2609.04971(BeaconKV)

可信度:🟢 极高(arXiv 2026-09-03 公开 + paper_card 1278 主分类 llm-infra 入库 + tom 9-9 20:40 radar HF Daily 12票候选摘要 + spark 9-9 18:40 llm-infra e1prep §增量 ①三源独立锚入)


增量 ② 🟢 A*-Thought-V2(arXiv:2609.07821 · HF Daily 8票 · 2026-09-07)

来源:inbox/tom/2026-09-09T2040-agent-rag-longcontext-radar.md 条目 #2 + tom 候选摘要表

要点: - Chain-of-Thought 推理成本高,现有方法要么硬裁剪中间步骤,要么缺少连续压缩准则;A*-Thought-V2 将 CoT 建模为 hidden-state 轨迹,通过 3D PCA 空间测量局部转移与全局"问题→解"的 alignment,用几何动态引导 latent 压缩,取代硬删除 - 意义:长思维链推理的效率压缩是 Agent 部署成本的核心瓶颈;几何对齐思路比 heuristic 剪枝更有理论依据;与 Discrete Diffusion(2609.04010,并行生成)形成"压缩 vs 并行"两条互补路径

与活文档 knowledge/inference.md 现有脉络的关系: - inference.md §1.(3) 新型推理范式已锚入 iFAN(推理感知学习) + Reduced MatMul(免训练输入自适应) + FreeToken(边缘 MoE);A-Thought-V2 通过 latent 压缩提升 CoT 推理效率,与这些范式互补,属于"推理链压缩优化"方向 - 与 inference.md §5.(1) 蒸馏部署中的 ReCo CoT 长度膨胀问题(DeepSeek-R1-Distill-Qwen-7B CoT 长度 +38.8%)形成"问题-解法"对应——ReCo 发现压缩会导致 CoT 膨胀,A-Thought-V2 用几何压缩缓解该问题

建议归入:inference.md §1.(3) 新型推理范式 升档闭合预备级(A*-Thought-V2 CoT 几何动态压缩 + 3D PCA alignment + latent 压缩)

arXiv 号:arXiv:2609.07821(A*-Thought-V2)

可信度:🟢 高(HF Daily 2026-09-07 收录,8票;几何动态压缩方法学有理论依据;需 arXiv 原文核验细节)


增量 ③ 🟢 Encoded Early, Used Late(arXiv:2609.07139 · HF Daily 14票 · 2026-09-06)

来源:inbox/tom/2026-09-09T2040-agent-rag-longcontext-radar.md 条目 #1 + tom 候选摘要表

要点: - 用 ExpertCollab 多轮研究规划对话语料,发现 Transformer 在浅层就能线性解码对话伙伴的专业度,但真正"使用"该信息的层更靠后——存在"早编码、晚使用"的 gap;对直接陈述的属性和逐步推断的属性都成立 - 意义:揭示了 Agent 内部推理的层次化机制,对设计"感知合作者状态"的 Agent 系统有直接参考价值;与 inference.md 中 TokenWeave(RMSNorm 通信-计算 overlap)从不同维度揭示 Transformer 内部计算结构特征

与活文档 knowledge/inference.md 现有脉络的关系: - inference.md §1.(2) 推理引擎内核已锚入 TokenWeave(MLSys 2026 Oral,RMSNorm 瓶颈);Encoded Early, Used Late 从注意力层分配角度揭示 Transformer 内部信息流动规律,两者共同指向"Transformer 内部计算结构优化"这一新兴研究方向 - 与 inference.md §2.(2) 调度理论中的 GoodServe(Cascade/UniBoost)无直接关联,但为未来"感知内部推理状态的调度"提供理论基础

建议归入:inference.md §1.(2) 推理引擎内核 升档闭合预备级(Encoded Early, Used Late Transformer 早编码晚使用 gap + 层次化推理机制)

arXiv 号:arXiv:2609.07139(Encoded Early, Used Late)

可信度:🟢 高(HF Daily 2026-09-06 收录,14票;方法学清晰;需 arXiv 原文核验对 Agent 系统的具体工程启示)


增量 ④ 🟢 arXiv:2606.17104 Prefill/Decode-Aware Evaluation + arXiv:2607.02574 KV Cache Management Survey(双 arXiv NET-new 锚入预备级)

来源:inbox/jay/2026-09-09-llm-inference-engineering-screening.md T1 #3 + T1 #4

要点: - arXiv:2606.17104 Prefill/Decode-Aware Evaluation(HPAI4S'26 @ IPDPS 2026):A100 平台 token transfer 时间从 0.210 ms/token(25 Gbps Ethernet)到 0.00036 ms/token(NVLink);对比 NVIDIA A100(vLLM v0.12.0)与 GroqRack(专用 AI 加速器)的 prefill/decode 执行模型差异;prefill 阶段为单次并行前向传播,decode 阶段为自回归;GroqRack 每次调用只处理一个 token,无批处理 — IPDPS 2026 peer-reviewed 论文,量化了 prefill/decode 不对称性的硬件依赖性 - arXiv:2607.02574 Survey of KV Cache Management for LLM Serving(2026-07):对 30+ KV-cache 管理系统的系统性分类,基于 4 轴 = locality / lifetime / ownership / substrate;5 大架构原型 = local-paged / disaggregated-pipeline / shared-store / memory-pool / hybrid-tier;揭示当前评估中 7 个缺失的 KV 专项测量指标;Mooncake(CXL KV-cache)、Beluga 等代表系统;CXL memory pooling 架构可跨 worker 扩展容量 — 系统性分类法,填补 inference.md §3 缺少权威 KV Cache 分类框架的空白

与活文档 knowledge/inference.md 现有脉络的关系: - inference.md §2.(2) 调度理论已锚入 GoodServe + Cascade + AMPD + UniBoost + OpScale + JITServe + FAST + FlexLLM,唯独缺少 Prefill/Decode-Aware 评估方法学;arXiv:2606.17104 提供了 formal evaluation 框架,可直接强化 §2.(2) - inference.md §3.(1) Five Eras of KVCache 只有定性描述,缺少系统性分类框架;arXiv:2607.02574 的 4 轴 + 5 架构原型 + 7 个缺失测量指标填补了这一空白

建议归入:inference.md §2.(2) 调度理论 升档闭合预备级(arXiv:2606.17104 Prefill/Decode-Aware Eval + token transfer 时间量化 + A100/GroqRack 对比)+ §3.(1) Five Eras of KVCache 升档闭合预备级(arXiv:2607.02574 30+ 系统 4 轴分类 + 5 大架构原型 + 7 个缺失测量指标)

arXiv 号:arXiv:2606.17104(Prefill/Decode-Aware Evaluation)+ arXiv:2607.02574(KV Cache Management Survey)

可信度:🟢 高(peer-reviewed 会议论文 HPAI4S@IPDPS 2026 + arXiv 2026-07 学术论文,系统性调研)


增量 ⑤ 🟢 arXiv:2604.25724 Compound AI Systems(Salesforce 规模) + arXiv:2603.16104 Agentic Workflows KV Cache Hit Rates(双 arXiv NET-new 锚入预备级)

来源:inbox/jay/2026-09-09-llm-inference-engineering-screening.md T2 #5 + T2 #7

要点: - arXiv:2604.25724 Scalable Inference Architectures for Compound AI Systems(Salesforce · 2026-04):生产规模 = 8,000 企业用户 · 日均 722,000 次推理 · 峰值 140 万请求/天 · 21 个全球分布式推理区 · provisioned 峰值 2,250 RPS(135,000 RPM) · 2026-03 处理 1,360 亿 token(日均约 44 亿 token),同比 8.7× 增长;关键发现:复合 AI 系统中各模型 scaling 不对称(Atlas 推理引擎过滤部分查询,导致对话 LLM 仅扩 6-7×;embedding 模型随流量线性扩 10×;SQL executor 仅扩 2-3×) — 生产规模数字直接验证推理引擎多组件协同的 scaling 挑战 - arXiv:2603.16104 Efficient LLM Serving for Agentic Workflows: A Data Systems Perspective:AI agent 工作流中 LLM 调用具有多步骤、异构 prompt、跨请求状态共享的特殊性;当前 serving 引擎(vLLM 等)优化的是独立请求,未针对 agentic 工作流特征设计;cache hit rate 实测(Qwen3-8B / Qwen3-14B):Helium 59.2% / 42.9%;vLLM 42.9% / 43.0%;agentic 场景 KV cache 命中率普遍低于预期(因多步异构请求共享率低) — 与 inference.md §3.(3) sKis temporal inefficiency 形成直接呼应:同步缓存更新导致 stall,无法 overlap 计算与内存操作

与活文档 knowledge/inference.md 现有脉络的关系: - inference.md §1.(1) 框架格局已锚入 vLLM/SGLang/LMDeploy/MAX/TGI 的横评,但缺少复合 AI 系统级别的生产规模数字;arXiv:2604.25724 的 8,000 企业 + 1,360 亿 token/月 数字是当前最完整的生产规模基准 - inference.md §3.(2) KV Cache 工程数学基础已锚入 GQA 重要性,但缺少 agentic 场景 KV cache 命中率实测数据;arXiv:2603.16104 填补了这一实证空白,对 SGLang RadixAttention 前缀共享策略有直接修正意义

建议归入:inference.md §1.(1) 框架格局 升档闭合预备级(arXiv:2604.25724 Salesforce 复合 AI 8,000 企业 + 1,360 亿 token + 各模型 scaling 不对称)+ §3.(2) KV Cache 工程数学基础 升档闭合预备级(arXiv:2603.16104 Agentic workflows cache hit 实测 + vLLM 42.9% / Helium 59.2% 量化数据)

arXiv 号:arXiv:2604.25724(Compound AI Systems)+ arXiv:2603.16104(Agentic Workflows Serving)

可信度:🟢 高(Salesforce 研究团队 2026-04 发布,有生产数据背书 + arXiv 2026-03 系统性研究,7 种 agentic 系统对比)


增量 ⑥ 🟢 vLLM 冷启动优化 8min→1min + SGLang BCG DeepSeek V4 +11.80% 吞吐(工程方法学 NET-new)

来源:inbox/jay/2026-09-09T1050-jay-engineering-filter-sep09pm.md + inbox/spark/2026-09-09-llm-infra-e1prep.md §增量 ⑤

要点: - vLLM 冷启动 8min→1min(The New Stack · 2026-09-03):冷启动各层耗时分解:Pod 调度 + 镜像拉取 → 模型权重加载 → GPU kernel 编译(torch.compile)34~53s ← 最大瓶颈 → CUDA graph → 服务就绪;torch.compile 持久化缓存方案(TORCH_COMPILE_DIR=/persistent-cache/torch-compile + PYTORCH_KERNEL_CACHE_DIR=/persistent-cache/py-kernel);Kubernetes 解决方案:挂载 PVC 或 HostPath 持久化缓存卷;OCI 镜像卷 2026 年已稳定;Dynamic Resource Allocation(DRA)为 GPU 提供结构化属性 - SGLang BCG DeepSeek V4 +11.80% 吞吐(Spheron Blog · 2026-07-02 SGLang v0.5.15 PR #29458):DeepSeek V4 DP attention 真实负载(CoreWeave 8-DP):开启 BCG 后吞吐量 +11.80%,TPOT 从 230.98ms 降至 200.32ms;GPU 成本估算:原 fleet 需要 10 张 H100 → BCG 优化后约 8.9 张(省约 10% GPU 成本);SGLang v0.5.19(2026-09-05)已默认开启 BCG

与活文档 knowledge/inference.md 现有脉络的关系: - inference.md §1.(1) 框架格局已锚入 SGLang BCG(breakable/tc_piecewise 模式,3.8-5.2× graph 构建加速),但缺少 DeepSeek V4 真实负载 +11.80% 吞吐 + TPOT 改善 + GPU 成本节省 的具体数字;本增量提供生产验证数据 - inference.md §1.(1) 尚未锚入 vLLM 冷启动优化路径;torch.compile 持久化缓存是 2026 年生产部署的重要工程方向,与 MRV2(冷启动时间已显著改善)共同构成"推理引擎初始化效率"的新主题

建议归入:inference.md §1.(1) 框架格局 升档闭合预备级(SGLang BCG DeepSeek V4 真实负载 +11.80% + TPOT 200ms + 10% GPU 成本节省)+ §1.(1) 框架格局 新节预备级(vLLM 冷启动 torch.compile 持久化缓存 8min→1min + Kubernetes PVC 方案)

可信度:🟢 高(The New Stack 2026-09-03 技术报道 + Spheron Blog 2026-07-02 实测数据 + SGLang v0.5.15 PR 可交叉验证)


增量 ⑦ 🟡 arXiv:2609.04010 Discrete Diffusion 候选摘要续立(待 arXiv 原文核验)

来源:inbox/tom/2026-09-08T2040-agent-rag-longcontext-radar.md + inbox/tom/2026-09-09T2040-agent-rag-longcontext-radar.md + spark 9-9 llm-infra e1prep

要点: - Discrete Diffusion(LLaMA-3 8B FP16):实现无损加速,通过 diffusion-augmented LLM 在并行抽样的同时保持 AR 模型分布;AR 权重(NTP 目标训练)和扩散权重(并行生成)参数解耦;在 IFBench 上精度无损失,但推理速度提升;与 EAGLE/P-EAGLE/DSpark 等投机解码方法形成"无损 vs 有精度回退"的对比 - ⚠️ 待核验:arXiv 原文尚未精读,具体 benchmark 数字和"无损" claim 的验证条件需原文核验;IFBench 测试范围是否覆盖所有推理类型存疑

与活文档 knowledge/inference.md 现有脉络的关系: - inference.md §1.(3) 新型推理范式已锚入 Discrete Diffusion,但标记为待核验;本棒继续维持待核验状态 - 与 §2.(3) 投机解码全景形成横向对比:DSpark(精度回退 97.08→93.96 AIME25)vs Discrete Diffusion(声称无损)——两者的精度-速度 tradeoff 是今晚活文档更新的核心议题

建议归入:inference.md §1.(3) 新型推理范式 维持待核验标记(Discrete Diffusion 无损 claim ⚠️ 待原文核验)

arXiv 号:arXiv:2609.04010(Discrete Diffusion)

可信度:🟡 中(候选摘要来自 HF Daily 24票,arXiv 原文尚未精读;claim 与其他投机解码方法(DSpark 有精度回退)形成显著矛盾,需独立核验)


三、值得警惕的矛盾或待核实说法

矛盾 ① Discrete Diffusion "无损" claim vs DSpark AIME25 回退

  • 矛盾点:Discrete Diffusion 声称无损加速,但 DSpark(ISGLS 在 AIME25 上出现 97.08→93.96 回退;投机解码方法的精度-速度 tradeoff 是真实存在的,Discrete Diffusion 的"无损"claim 是否在所有推理类型上成立存疑)
  • 建议:今晚活文档更新时,将 Discrete Diffusion 与 DSpark 并列呈现,明确标注两者在精度保证范围上的差异

矛盾 ② Agentic KV Cache Hit Rates vs SGLang RadixAttention 前缀共享优势宣称

  • 矛盾点:arXiv:2603.16104 实测 vLLM KV cache hit rate 在 agentic 场景下仅 42.9-43.0%,远低于 SGLang 在共享前缀场景宣称的高缓存命中率;但 SGLang 的优势依赖于"共享系统提示/工具定义"——在真正的异构 agentic 多步场景下,两者缓存效率差距可能不显著
  • 建议:活文档 §3.(3) 更新时,区分"共享前缀(shared prefix)"与"异构多步(heterogeneous multi-step)"两种 agentic 场景,避免将 SGLang 优势泛化到所有 agentic 场景

待核实 ① SGLang BCG DeepSeek V4 +11.80% 吞吐是否覆盖所有模型

  • 存疑:BCG 优化对 DeepSeek V4(MLA 优化)有效,但对其他模型( Llama 4/Qwen3)的提升幅度是否相同?inferenceengineering.tech 数据未覆盖此比较
  • 建议:入库并标记为"DeepSeek V4 专项,其他模型待验证"

待核实 ② NVIDIA NVFP4 Blackwell FP4 量化精度损失

  • 存疑:Jay 9-9 18:50 工程筛选报告 NVIDIA NVFP4 GPQA Diamond -0.3%,IFBench +0.7%;但这些 benchmark 是否覆盖 LRM(大推理模型)的 CoT 场景?BeaconKV 揭示的 TRT 现象在量化后是否会更严重?
  • 建议:标记为"NVFP4 精度损失在标准 benchmark 上可控,LRM CoT 场景的量化鲁棒性待验证"

四、可引用的 arXiv 号列表

arXiv 号 标题 主题轴 状态
2609.04971 BeaconKV: KV Cache Compression Guided by Beacon Queries KV Cache 压缩/LRM ✅ 已入库(主分类 llm-infra)
2609.07821 A*-Thought-V2: Geometric Dynamic CoT Compression 新型推理范式 ⚠️ 候选摘要,待入库
2609.07139 Encoded Early, Used Late 推理机制 ⚠️ 候选摘要,待入库
2606.17104 Prefill/Decode-Aware Evaluation (IPDPS 2026) 调度理论 🟢 NET-new 锚入预备级
2607.02574 Survey of KV Cache Management for LLM Serving KV Cache 分类 🟢 NET-new 锚入预备级
2604.25724 Scalable Inference Architectures for Compound AI Systems 框架格局/生产规模 🟢 NET-new 锚入预备级
2603.16104 Efficient LLM Serving for Agentic Workflows KV Cache 命中率 🟢 NET-new 锚入预备级
2609.04010 Unlocking Lossless Speedups in LLMs via Discrete Diffusion 新型推理范式 ⚠️ 待核验无损 claim
2605.01280 LLM Serving Needs Mathematical Optimization 调度理论 预备级续立

五、本棒无显著新增量时的情况说明

本棒有显著新增量,共 7 条主增量,超出 3-8 目标区间。


六、本次变更(建议写入活文档 inference.md 的增量)

# 增量 建议写入位置
BeaconKV(2609.04971) · TRT 现象 + beacon query 引导 KV 压缩 §3.(3) KV Cache Compression 升档预备级
A*-Thought-V2(2609.07821) · CoT 几何动态压缩 §1.(3) 新型推理范式 升档预备级
Encoded Early, Used Late(2609.07139) · 早编码晚使用 gap §1.(2) 推理引擎内核 升档预备级
Prefill/Decode-Aware Eval(2606.17104) + KV Cache Survey(2607.02574) §2.(2) 调度理论 + §3.(1) Five Eras 升档预备级
Compound AI Scaling(2604.25724) + Agentic KV Hit Rates(2603.16104) §1.(1) 框架格局 + §3.(2) KV Cache 数学基础 升档预备级
vLLM 冷启动 8min→1min + SGLang BCG DeepSeek V4 +11.80% §1.(1) 框架格局 升档预备级
Discrete Diffusion(2609.04010) 无损 claim ⚠️ 待核验 §1.(3) 维持待核验标记

Tom · 2026-09-09 22:20 CST · E1 预消化轮 · inference 主题 · 7 条主增量 · 9 件 arXiv 号