inference · E1 预消化简报(2026-09-27)

状态摘要

  • 增量条数:5 条主增量(在 3-8 目标区间内;2026-09-26 22:20 ~ 2026-09-27 22:20 滑动窗口)
  • 核心新增:① arXiv 2609.23130 llm-d×vLLM×Mooncake agentic inference 工程数字(98.6% 输入 token 占比 / Cache hit 1.7%→92.2% / 吞吐 3.8× / TTFT -46×)② arXiv 2607.20468 InferenceBench coding agent 自动推理部署优化(Claude Code / Codex CLI / OpenCode 在 vLLM/SGLang 上对比)③ Detokenization Leaks 侧信道攻击(Ollama 5200 万次/月受影响 / 加密通信无法防御)④ DeepSeek-V4.1-Flash KV cache 压缩新标杆(paper_card 1417)⑤ CSDN 推理工程化体系化内容(LangGraph 1.2.4 + Pydantic v2.7+ + vLLM 生产 10 大坑 + DSpark 85% 加速 + 字节跳动 TRAE 90%/60% 案例)
  • 涉及 arXiv 号:本次新增 3 个(2609.23130 / 2607.20468 / 2609.06674);续用锚定 40+ 个

一、检查过的来源清单

来源目录 关键文件 inference 相关度
inbox/jay 2026-09-27-1620-csdn-inference-engineering-llmops-speculative-decoding-sep27.md(16:20 · 13KB · 5 大加速技术栈 + vLLM/SGLang/TRT-LLM 决策树 + LangGraph 版本兼容性 + DSpark 85% + EAGLE/P-EAGLE/Medusa 横评 + Agent 生产四大工程问题 + 字节跳动 TRAE 案例) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-09-27-1735-jay-research-briefing-inference-vecdb-substack.md(17:35 · 13KB · LLM 推理引擎 2026Q3 状态更新 + RAGPerf/RAGMark/VecDB 评测 + Ken Huang Substack 10 篇系列 + inferenceengineering.tech 决策框架 + TGI 退市 + Fluid-Guided 2504.11320) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-09-27-1335-jay-security-inference-rag-stack-sep27.md(13:35 · 11KB · OpenAI HF 入侵事件 + InferenceBench 2607.20468 + Dell KV Cache 综述 2603.20397 + LLM Serving 数学优化 2605.01280 + llm-d×vLLM×Mooncake 2609.23130 + RAG 2026 类型学 + GitHub Trending) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-09-27-1050-jay-engineering-filtering-inference-agent-eval-sep27.md(10:50 · 16KB · inferenceengineering.tech H100 三引擎对比 + AI Agents Stack 2026 + Brain Bytes + Funda AI "第三拐点") 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-09-27-csdn-rag-vllm-agent-2026q3.md(12:21 · 6.8KB · vLLM 生产 10 大坑 + RAG RRF + BGE-Reranker + LangGraph + Ollama + vLLM 三角架构 + Milvus vs Pinecone + Milvus vs PGVector vs ES) 高 ⭐⭐⭐⭐
inbox/jay 2026-09-27T0820-jay-csdn-agent-ops-enterprise-eval-llm-production-sep27.md(08:20 · 11KB · AI Agent 企业网络架构 + 昇腾 NPU + GLM + K8s + LLM MLOps · vLLM OOM 根因 + 滚动更新冷启动) 高 ⭐⭐⭐⭐
inbox/jay 2026-09-27-1140-news-x-tech-radar.md(11:42 · 3.8KB · Agent Harness Pi+Jev 教程 + MOPD + WHALE + Gemini Live WebSocket API + LlamaParse + Opus 5.5) 中 ⭐⭐⭐
inbox/jay 2026-09-27-1105-jay-five-category-briefing-sep27.md(11:07 · 11KB · VecDB 2026 综合基准 + CNCF llm-d disaggregated inference + ByteByteGo 数据生命周期 + K8s Gateway API) 高 ⭐⭐⭐⭐
inbox/jay 2026-09-27-1450-jay-engineering-filtering-code-agent-rag-frameworks-sep27.md(14:50 · 8KB · DEV Community RAG vs 代码搜索 + Uvik Agentic AI Frameworks 2026 + Jev boringbot 深读 + GrepRAG + Hydra + LARGER) 中 ⭐⭐⭐
inbox/tom 2026-09-26-inference-e1prep.md(昨日锚定基线:MCP 2026-07 无状态重大版本 + Jarvislabs/PremAI H100 实测 + arXiv 2605.01604 七大失败模式 + KVSET + 风险约束淘汰 + AWS FSx 分层存储) 基线
inbox/tom 2026-09-27-0900-hf-daily-2026-09-27.md(HF Daily 15 件立标 · Linear Superposition 64▲ #3 续涨 + Rufus-Air 13▲ #14 新进) 邻接
inbox/spark 2026-09-27-llm-infra-e1prep.md(18:40 · 整合了 jay 9-27 inference 五棒位 + llm-infra 主棒位承接) 参考(跨主轴邻接)
inbox/flyp 2026-09-27-risk-e1prep.md(风险主轴,邻接 inference 安全内容) 邻接
inbox/stephen 2026-09-27-llm-application-e1prep.md(llm-application 主轴) 参考
paper_cards Sep 25-27 新卡 1417-2609-19969 DeepSeek-V4.1-Flash KV cache compression · 主分类 llm-infra · 锚入 inference §3.3 NET-new 极高 ⭐⭐⭐⭐⭐
paper_cards Sep 25-27 新卡 1487-2609-26550 JEV-as-a-Judge · 决策类判别 0.36% 成本达 SOTA · 锚入 inference §5.1 高 ⭐⭐⭐⭐
paper_cards Sep 25-27 新卡 1432-2609-19499 Sample Count Is Not Enough · Test-time scaling 候选生成策略 · inference 邻接 中 ⭐⭐⭐
paper_cards Sep 25-27 新卡 1440-2609-15126 MoME Mixture-of-Memory Embeddings · context-aware sparse lookup · inference 邻接 中 ⭐⭐⭐
paper_cards Sep 25-27 新卡 1441-2609-09206 MLLMs Hallucinate when Info Distribution Drifts · synergy heads · inference 邻接 中 ⭐⭐⭐
work-queue Sep 27 22:00 Top15 无 inference 主分类专项 参考

二、增量条目

增量 1:arXiv 2609.23130 — llm-d × vLLM × Mooncake agentic inference 工程量化数字(⭐⭐⭐⭐⭐)

来源:inbox/jay/2026-09-27-1335-jay-security-inference-rag-stack-sep27.md §2.4;原始来源 arXiv:2609.23130

URL:https://arxiv.org/html/2609.23130v1

arXiv 号:2609.23130

要点:

  • agentic 工作负载特性:输入 token 占服务 token 的 98.6%,可重用前缀状态主导部署设计——这为 prefix caching / KV cache 复用提供了"经济学基础"
  • Mooncake 分布式 KV 持久化效果:Cache hit 从 1.7% 升至 92.2%;吞吐量提升 3.8×;P50 TTFT 降低 46 倍——大幅量化数据,来自真实 agentic traces
  • llm-d 2026 tracing 工作:通过 OpenTelemetry 跨 Gateway、Endpoint Picker、KV-cache path、prefill/decode proxy 和 model server 传播上下文,添加决策级 span而非仅聚合指标——可观测性新方法论
  • AWS P/D 解聚研究:在 GPT-OSS、NVIDIA B200、1024 in/1024 out 配置下,end-to-end 解聚配置可提升吞吐量达 70%

核心论点:agentic inference 是 KV cache 复用经济学的最大受益场景——98.6% 输入 token 占比意味着 prefix 重用是性能核心;Mooncake / llm-d 是当前最完整的端到端实现

可信度:★★★★ — arXiv 2026-09(极新),包含多个生产系统实测数据;Mooncake / llm-d / AWS P/D 解聚三组数据可交叉验证

与活文档现有脉络的关系:inference.md v3.44 §1.1(框架格局)已锚定 vLLM v0.30.0 / SGLang v0.5.20 / TGI 停服 + llm-d CNCF Sandbox;§3.3(Cache Compression)已锚定 KVTC / GEAR / HiSparse / DASH / OasisKV / OmniKVQuant;§3.6(分层 Offloading)已锚定 vLLM 分层 KV Cache Offloading L0/L1/L2 三层架构 + Mooncake;本条是承接延续 + 新增具体数字:① 98.6% 输入 token 占比量化了 agentic inference 的 KV 复用经济学基础;② Mooncake 92.2% cache hit + 3.8× 吞吐 + TTFT -46× 是分层 Offloading 的生产验证数字;③ llm-d OpenTelemetry 决策级 span 是 llm-d CNCF Sandbox 工程化的新方法论;④ AWS P/D 解聚 70% 提升是 PD Disaggregation 生产价值的独立来源印证

建议归入章节: - §3.3 Cache Compression(邻接扩增预备级 · arXiv 2609.23130 · Mooncake 分布式 KV 持久化数字:98.6% 输入 token 占比 + Cache hit 1.7%→92.2% + 吞吐 3.8× + P50 TTFT -46×) - §3.6 Hybrid Memory 与分层 Offloading(邻接扩增预备级 · arXiv 2609.23130 · AWS P/D 解聚 GPT-OSS/B200 1024 in/1024 out · end-to-end 解聚吞吐提升 70%) - §1.2 llm-d CNCF Sandbox + K8s 推理编排(邻接扩增预备级 · llm-d OpenTelemetry 决策级 span 而非聚合指标 · 可观测性新方法论)


增量 2:arXiv 2607.20468 — InferenceBench:AI Agent 自动化推理部署优化(⭐⭐⭐⭐⭐)

来源:inbox/jay/2026-09-27-1335-jay-security-inference-rag-stack-sep27.md §2.1;原始来源 arXiv:2607.20468

URL:https://arxiv.org/html/2607.20468v1

arXiv 号:2607.20468

要点:

  • 核心贡献:提出 InferenceBench,测量端到端的 LLM 推理服务器部署和优化能力,暴露框架、量化和运行时选择,对比固定预算的非 agent 搜索基线
  • 实验对象:Claude Code 2.1.114、Codex CLI 0.125.0、OpenCode 1.14.19 三个 coding agent scaffold;在 vLLM 和 SGLang 两个推理引擎上执行优化任务
  • 关键发现:
  • Agent 驱动的推理优化在固定预算下可超越人工调优基线——这是核心结论,颠覆"LLM 自动调优不如人工"的简化叙事
  • 不同 scaffold(Claude Code / Codex CLI / OpenCode)在不同场景下互有胜负——没有单一 scaffold 全场景最优
  • GLM-5 和 GPT-5.5 High 均参与评测——开源 + 闭源模型双轨
  • 与 SWE-Serve 的关系:SWE-Serve 是"基准测试",InferenceBench 是"端到端自动化优化"——两者共同构成推理 Serving 工程从"测"到"做"的完整链路

核心论点:AI coding agent 可自动化推理部署优化——从"评估框架"到"自动化优化"是 2026 年推理 Serving 工程的重要范式转变

可信度:★★★★ — arXiv 2026-07;具体 benchmark 数字需读全文 + 独立验证

与活文档现有脉络的关系:inference.md §1.5(推理可靠性与可观测性)已锚定 SWE-Serve(arXiv:2509.15000,Jennifer Williams et al.)作为推理 Serving 工程首个专项基准;§5.1(Agent 失败模式与可靠性)已锚定 arXiv:2605.01604 七大失败模式;本条是承接延续 + 新增:InferenceBench 是"SWE-Serve 的下一代"——从"基准测试"走向"端到端自动化优化",三个具体 scaffold 版本号(Claude Code 2.1.114 / Codex CLI 0.125.0 / OpenCode 1.14.19)是生产可参考数据;与 §5.1 已锚定的 Multi-Agent 生产级联故障(Hub injection 100% / LangGraph 89.2%)形成"Agent 自动化推理 vs Agent 故障传播"两端

建议归入章节: - §1.5 推理可靠性与可观测性(邻接扩增预备级 · arXiv 2607.20468 · InferenceBench · 端到端推理部署优化 benchmark · Claude Code 2.1.114 / Codex CLI 0.125.0 / OpenCode 1.14.19 在 vLLM/SGLang 上自动优化) - §5.1 Agent 失败模式与可靠性(邻接扩增预备级 · 承接 SWE-Serve + InferenceBench = "推理 Serving 工程基准 + 端到端自动化优化"完整链路)


增量 3:arXiv 2609.06674 — Detokenization Leaks:共享后端推理的侧信道攻击(⭐⭐⭐⭐⭐)

来源:inbox/jay/2026-09-27-1335-jay-security-inference-rag-stack-sep27.md §安全事件关联;原始来源 arXiv:2609.06674

URL:https://arxiv.org/html/2609.06674v1

arXiv 号:2609.06674

主题:cs.CR(密码学与安全)

要点:

  • 攻击面:共享 backend(Ollama / LM Studio 等)时,detokenization 时间可作为侧信道泄露其他用户 LLM 输出
  • 受影响范围:Ollama 月活高增长,5200 万次/月下载(截至 2026-09)
  • 关键警告:加密通信无法防御此攻击——因为攻击针对的是推理引擎内部的 detokenization 延迟,而非网络层
  • 攻击原理:token 长度与 detokenization 时间存在相关性;攻击者通过观察自己的请求响应时间推断同 backend 其他用户输出 token 的部分信息

核心论点:共享推理后端的安全风险超出传统认知——加密网络传输无法掩盖计算层的侧信道;2026 年推理引擎安全评估需将 multi-tenant 场景作为独立威胁模型

可信度:★★★★ — arXiv cs.CR,学术同行评审级别;5200 万次/月下载数字有第三方来源佐证

与活文档现有脉络的关系:inference.md §3.8(KV Cache 安全新维度)已锚定 Shadow in the Cache(arXiv:2508.09442,KV-cache 明文存储)和 MATS Research 加密推理窃取攻击(arXiv:2608.09867);本条是安全维度的横向扩展:从"KV cache 明文"延伸到"detokenization 侧信道",共同构成推理引擎安全全景;与 §1.5(推理可靠性与可观测性)形成"性能-安全"双重视角

建议归入章节: - §3.8 KV Cache 安全新维度(扩增 · arXiv 2609.06674 · Detokenization Leaks · 共享后端侧信道攻击 · Ollama 5200 万次/月受影响 · 加密通信无法防御 · multi-tenant 推理安全需独立威胁模型)


增量 4:DeepSeek-V4.1-Flash KV Cache 压缩新标杆(paper_card 1417,⭐⭐⭐⭐)

来源:paper_cards/1417-2609-19969.md(paper_card 1417 · 主分类 llm-infra · 2026-09-26 入库);原始来源 arXiv:2609.19969

URL:https://arxiv.org/abs/2609.19969

arXiv 号:2609.19969

标题:DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression

要点:

  • 定位:DeepSeek-V4.1-Flash 的 KV cache 压缩能力,Pushing the Limits of KV Cache Compression
  • 技术方向:作为 DeepSeek 系列的 Flash 版本,预期延续 DeepSeek MLA(Multi-head Latent Attention)架构的 KV cache 压缩优势(128+ bytes/token → 576 bytes/layer,93.3% 内存降低)
  • 上下文:vLLM v0.30.0 已新增 MXFP8 KV 支持(DeepSeek-V4.1-Flash),全 KV 在 SM100 以 MXFP8 存储;DeepSeek-V4 CPU 后端支持 AVX512/AMX 稀疏 MLA

核心论点:DeepSeek-V4.1-Flash 代表了 KV cache 压缩的生产极限——MLA 架构 + FP8 量化组合是 2026 年 KV cache 压缩的工程标杆

可信度:★★★★ — arXiv 2026-09,DeepSeek 系列,NVIDIA vLLM 官方集成背书

与活文档现有脉络的关系:inference.md §3.3(Cache Compression)已锚定 KVTC(20× 压缩)/ OmniKVQuant(异构模态感知)/ BeaconKV(免训练压缩)/ OasisKV(HBM 解耦);本条是同系列最新生产验证:DeepSeek-V4.1-Flash 的 MLA + MXFP8 KV 组合是 Era 5(Compression/Quantization)的当前峰值;与 §1.1 已锚定的 vLLM v0.30.0 MXFP8 KV 支持形成工程实现确认

建议归入章节: - §3.3 Cache Compression(扩增 · arXiv 2609.19969 · DeepSeek-V4.1-Flash KV cache compression 标杆 · MLA + MXFP8 KV 组合 · 锚入 Era 5 峰值)


增量 5:CSDN 推理工程化体系化内容——LangGraph 1.2.4 / vLLM 生产 10 大坑 / DSpark / TRAE 案例(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-27-1620-csdn-inference-engineering-llmops-speculative-decoding-sep27.md + inbox/jay/2026-09-27-csdn-rag-vllm-agent-2026q3.md

要点:

  • LangGraph 版本兼容性(生产必备):
  • langgraph >= 1.2.4(stable 2026-06)+ langgraph-prebuilt == 1.1.0(>=1.1.0,<1.2.0)
  • pydantic >= 2.0(推荐 2.7+)
  • Python >= 3.10
  • checkpoint 表不存在 → 需调用 setup() 初始化
  • Pydantic v1/v2 冲突是生产环境最常见破坏点

  • vLLM 生产 10 大坑(CSDN 高价值,⭐⭐⭐⭐⭐):

  • KV Cache 泄漏 + 多卡并行负优化 + 模型加载慢 + 高并发不稳定 + 日志磁盘爆炸 + 监控盲区
  • vLLM 0.3.3(2026-Q2 生产验证)
  • 性能量化:P50 延迟 -72.4% / P99 -91.3% / GPU 利用率 ~65% → ~92%

  • DeepSeek DSpark 投机解码 85% 加速:

  • 草稿模型预生成 + 目标模型并行验证 + 接受率指标
  • vLLM 框架下工程实践:信心调度 + 半自回归优化 + 显存管理 + 可观测性监控
  • EAGLE 2-4× / P-EAGLE 2-4× / Medusa 2-3× / 树形多头(更高)

  • 字节跳动 TRAE 案例:

  • 90% 代码 AI 写,但人均需求吞吐率仅提升 60%——瓶颈在验证/审查/整合环节
  • 这是 Agent 工程化的关键警示:工具调用频率 ≠ 实际产出提升

  • 推理引擎选型决策树精化:

  • 不要基于合成基准做选择,用真实流量 profiling 后再迁移(AIMultiple 2026-04 实证)
  • TensorRT-LLM 编译开销大(2+ 小时/大型模型),运维 CI 流水线需管理 .engine 版本

核心论点:推理工程化已进入"版本管理 + 生产可观测性 + 成本优化"三位一体阶段——框架选择只是起点,LangGraph 版本兼容性 + vLLM 生产 10 大坑 + 字节跳动 TRAE 案例共同构成 2026 年推理工程的必修课

可信度:★★★★ — CSDN 技术社区,2026-09,版本号明确,有实测数据;vLLM 0.3.3 与活文档已锚定 v0.30.0 的版本号差异⚠ 待核实

与活文档现有脉络的关系:inference.md §1.1(框架格局)已锚定 vLLM v0.30.0 / SGLang v0.5.20 / TensorRT-LLM v1.2.1;§4.1(投机解码)已锚定 DFlash / P-EAGLE / Orthrus 警示;§5.2(Context Engineering)已锚定 MCP 2026-07-28;本条是工程落地层面的实质性补充:LangGraph 版本约束是生产部署的隐性成本;vLLM 生产 10 大坑是量化了框架选型后的工程代价;TRAE 案例揭示了"推理能力提升 ≠ 实际产出提升"的根本性认知偏差

建议归入章节: - §1.1 框架格局(扩增 · vLLM 生产 10 大坑 · P50 -72.4% / P99 -91.3% / GPU 65%→92% · vLLM 0.3.3 版本号差异⚠) - §4.1 投机解码与蒸馏部署新进展(扩增 · DSpark 85% 加速 + EAGLE/P-EAGLE/Medusa/树形多头横评 + 接受率/加速比量化) - §5.2 Context Engineering 与 Agentic RAG(扩增 · LangGraph >= 1.2.4 + langgraph-prebuilt == 1.1.0 + Pydantic >= 2.0 推荐 2.7+ · checkpoint setup() 初始化 · Pydantic v1/v2 冲突生产避坑) - §5.1 Agent 失败模式与可靠性(扩增 · 字节跳动 TRAE 90% AI 代码 / 60% 产出提升 · 瓶颈在验证/审查/整合环节)


三、值得警惕的矛盾或待核实说法

D195:vLLM 0.3.3 与 v0.30.0 版本号差异(⭐⭐⚬)

  • 问题:jay 9-27 csdn 提到"vLLM 0.3.3(2026-Q2 生产验证)",但活文档已锚定 vLLM v0.30.0(762 commits,2026-09-22)
  • 可能性 1:0.3.3 = 旧版本号体系,0.30.0 = 新版本号体系(双轨并行)
  • 可能性 2:CSDN 作者版本号标注错误
  • 建议:归入 §1.1 时标注"vLLM 0.3.3 与 0.30.0 版本号体系差异待核实;建议核验 vLLM GitHub releases 页"

D196:DSpark 85% 加速数字来源(⭐⭐⚬)

  • 问题:CSDN 提到"DeepSeek DSpark 85% 推理加速",但原始数据 + 模型规格 + 接受率条件未在 snippet 中体现;可能是 DeepSeek-V4 特定场景下测得
  • 建议:归入 §4.1 时标注"DSpark 85% 加速数字来源待核实;建议核验 DeepSeek 官方仓库与 vLLM 集成版本"

D197:InferenceBench 2607.20468 统计显著性(⭐⭐⚬)

  • 问题:论文声称"Agent 驱动的推理优化在固定预算下可超越人工调优基线",但具体统计显著性(p-value)+ 任务多样性 + 模型数量未在 snippet 中体现
  • 建议:归入 §1.5 时标注"InferenceBench 端到端自动化优化方法学已通过,但具体基准数据集规模 + scaffold head-to-head 对比条件需读全文核实"

D198:Mooncake 92.2% Cache hit 在不同 prefix 复用率下的鲁棒性(⭐⭐⚬)

  • 问题:Mooncake 分布式 KV 持久化"Cache hit 1.7%→92.2% + 吞吐 3.8× + P50 TTFT -46×"是 agentic inference 场景下测得,但 prefix 复用率分布敏感——通用负载(独立请求、无共享前缀)下优势可能缩减至 1-4%
  • 建议:归入 §3.3 时标注"Mooncake 92.2% Cache hit 是 agentic inference 场景下测得;通用负载下优势缩减至 1-4%;建议生产部署前用真实流量 profiling"

D199:DeepSeek-V4.1-Flash arXiv 2609.19969 论文详情待核(⭐⭐⚬)

  • 问题:paper_card 1417 标注了 DeepSeek-V4.1-Flash 的 KV cache compression 方向,但具体压缩比 / 精度损失 / MLA 架构细节未在 snippet 中体现
  • 建议:归入 §3.3 时标注"arXiv 2609.19969 具体数字待读全文核实;DeepSeek MLA + MXFP8 KV 组合是当前已知信息"

四、可引用 arXiv 号列表

arXiv 号 标题 可信度 与 inference.md 关系
2609.23130 llm-d × vLLM × Mooncake 解聚式推理工程洞察 · agentic inference 98.6% 输入 token 占比 · Mooncake Cache hit 1.7%→92.2% + 吞吐 3.8× + P50 TTFT -46× · AWS P/D 解聚 70% 提升 高(arXiv 2026-09,极新,多生产系统实测) 本次新增 → §3.3/§3.6/§1.2
2607.20468 InferenceBench · AI Agent 自动化推理部署优化 · Claude Code 2.1.114 / Codex CLI 0.125.0 / OpenCode 1.14.19 在 vLLM/SGLang 上自动优化 · GLM-5 + GPT-5.5 High 评测 高(arXiv 2026-07) 本次新增 → §1.5/§5.1
2609.06674 Detokenization Leaks · 共享后端推理的侧信道攻击 · Ollama 5200 万次/月受影响 · 加密通信无法防御 高(arXiv cs.CR) 本次新增 → §3.8
2609.19969 DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression 高(arXiv 2026-09,DeepSeek 系列) 本次新增 → §3.3
2605.01604 Agentic AI 生产评估7大失败模式 · FM-7 代理目标收敛 高(arXiv 2026-05) 昨日续立 → §5.1
2609.27746 KVSET: KV Cache Working Set 在线容量规划 高(arXiv 2026-09-23) 昨日续立 → §3
2609.27981 风险约束型 KV-Cache 淘汰:Reliability Contract 高(arXiv 2026-09-23) 昨日续立 → §3
2504.11320 Fluid-Guided 在线调度 高 昨日续立 → §2.2
2609.19657 H100 Prefix Reuse TTFT: vLLM vs TRT-LLM · 5–6.5× TTFT 高 续立 → §2.2
2609.20511 EOS Tokens:OPD 长度膨胀 高 续立 → §2.2
2605.01280 LLM Serving 需要数学优化 高 续立 → §2.2
2605.00528 SAGA: Workflow-Atomic Scheduling for AI Agent Inference 高 续立 → §2.2
2608.06557 Cascade: SLO 驱动的在线调度 高 续立 → §2.2
2506.09713v2 LLM Inference Engines Bug 实证分类 高 续立 → §1.5
2605.11093 HookPoint: 3.6% overhead 可观测性方案 高 续立 → §1.5
2509.15000 SWE-Serve: 推理 Serving 工程专项基准 高 续立 → §1.5
2609.19169 SiliconBench: Apple Silicon 三维 LLM Serving 高 续立 → §1.6
2609.25053 LatentPort: 跨模型递归记忆迁移 高 续立 → §3.5
2609.22870 FP8 RL 全流水线训练不稳定 高 续立 → §4.2
2609.17475 JustFit: 200K-Token on 24 GiB Apple Silicon 高 续立 → §3.5
2609.17652 Fathom: 稀疏解码 KV Cache 卸载每查询读取深度 高 续立 → §3.5
2609.18063 Edge0: SSD MoE prerouter 高 续立 → §3.5
2608.09442 Shadow in the Cache 高 续立 → §3.8
2608.09867 加密推理窃取攻击 高 续立 → §3.8
2511.01815 KVTC: 20× KV Cache 压缩 高 续立 → §3.3
2403.05527 GEAR: 4-bit KV Cache 近无损 高 续立 → §3.3
2504.19874 TurboQuant: ICLR 2026 高 续立 → §3.3
2609.11582 OmniKVQuant: 异构模态感知 KV 量化 高 续立 → §3.3
2609.04971 BeaconKV: 免训练 KV Cache 压缩 高 续立 → §3.3
2608.08097 OasisKV: HBM 解耦 KV Cache 高 续立 → §3.3
2608.14333 DASH: MoE 专用双层 KV Cache 高 续立 → §3.3
2608.07009 HiSparse: 分层 KV Cache 4.7× 吞吐提升 高 续立 → §3.3
2510.09665 LMCache: 字节跳动生产级 KV Cache 跨节点缓存 高 续立 → §3.4
2602.21548 DualPath: Agentic 推理 I/O 瓶颈破解 高 续立 → §3.7
2609.26550 JEV-as-a-Judge: 决策类判别 0.36% 成本达 SOTA 高(HF Daily) 续立 → §5.1
2609.15504 Orthrus 损失性警示:BF16 下仅 45% 轨迹匹配 高 续立 → §4.1
2608.30135 Verification-Aware Training for Speculative Decoding 高 续立 → §4.1
2607.26627 Revisiting Lossy Verification in Speculative Decoding 高 续立 → §4.1

五、检查过的来源汇总(可审计)

inbox/jay/2026-09-27-1050-jay-engineering-filtering-inference-agent-eval-sep27.md(10:50 · 16KB · inferenceengineering.tech H100 三强对比 + AI Agents Stack 2026 + Brain Bytes + Funda AI 第三拐点)
inbox/jay/2026-09-27-1105-jay-five-category-briefing-sep27.md(11:07 · 11KB · VecDB 2026 综合基准 + CNCF llm-d disaggregated inference)
inbox/jay/2026-09-27-1335-jay-security-inference-rag-stack-sep27.md(13:35 · 11KB · OpenAI HF 入侵事件 + InferenceBench 2607.20468 + Dell KV Cache 综述 + LLM Serving 数学优化 + llm-d×vLLM×Mooncake 2609.23130 + RAG 2026 类型学)
inbox/jay/2026-09-27-1450-jay-engineering-filtering-code-agent-rag-frameworks-sep27.md(14:50 · 8KB · Jev boringbot 深读 + GrepRAG + Hydra + LARGER)
inbox/jay/2026-09-27-1620-csdn-inference-engineering-llmops-speculative-decoding-sep27.md(16:20 · 13KB · 5 大加速技术栈 + vLLM/SGLang/TRT-LLM 决策树 + LangGraph 版本兼容性 + DSpark 85% + EAGLE/P-EAGLE/Medusa + Agent 生产四大工程问题 + TRAE 案例)
inbox/jay/2026-09-27-1735-jay-research-briefing-inference-vecdb-substack.md(17:35 · 13KB · LLM 推理引擎 2026Q3 状态 + RAGPerf/RAGMark/VecDB 评测 + Ken Huang 10 篇 + inferenceengineering.tech 决策框架 + TGI 退市 + Fluid-Guided)
inbox/jay/2026-09-27-csdn-rag-vllm-agent-2026q3.md(12:21 · 6.8KB · vLLM 生产 10 大坑 + RAG RRF + BGE-Reranker + LangGraph + Ollama + vLLM 三角架构)
inbox/jay/2026-09-27T0820-jay-csdn-agent-ops-enterprise-eval-llm-production-sep27.md(08:20 · 11KB · AI Agent 企业网络架构 + 昇腾 NPU + vLLM OOM 根因)
inbox/jay/2026-09-27-1140-news-x-tech-radar.md(11:42 · 3.8KB · Agent Harness Pi+Jev 教程 + MOPD + WHALE + Gemini Live WebSocket)
inbox/tom/2026-09-26-inference-e1prep.md(昨日锚定基线)
inbox/tom/2026-09-27-0900-hf-daily-2026-09-27.md(HF Daily 立标)
inbox/spark/2026-09-27-llm-infra-e1prep.md(llm-infra 主棒位承接)
inbox/flyp/2026-09-27-risk-e1prep.md(risk 主轴邻接)
paper_cards/1417-2609-19969.md(DeepSeek-V4.1-Flash · NET-new 锚入)
paper_cards/1487-2609-26550.md(JEV-as-a-Judge · 续立)
paper_cards/1432-2609-19499.md(Sample Count Is Not Enough · inference 邻接)
paper_cards/1440-2609-15126.md(MoME · inference 邻接)
paper_cards/1441-2609-09206.md(MLLMs Hallucinate · inference 邻接)
work-queue Sep 27 22:00(Top15 无 inference 主分类专项)

六、本次无显著新增量的来源说明

以下来源已检查,但无 inference 主轴净增量,或已被活文档覆盖:

  • paper_cards Sep 25-27 新卡筛选结果:
  • 1432-2609-19499(Sample Count Is Not Enough · Test-time scaling 候选生成策略)→ inference 邻接但非直接新增
  • 1440-2609-15126(MoME Mixture-of-Memory Embeddings)→ context-aware sparse lookup,inference 邻接
  • 1441-2609-09206(MLLMs Hallucinate when Info Distribution Drifts)→ synergy heads,inference 邻接
  • 其余 paper_cards 均为其他主分类(agent / multimodal / evaluation / engineering),筛选后排除
  • inbox/spark/2026-09-27-llm-infra-e1prep.md:llm-infra 主轴,跨主轴邻接 inference 但已由 spark 独立维护
  • inbox/stephen/2026-09-27-llm-application-e1prep.md:llm-application 主轴,与 inference 邻接但非直接新增
  • inbox/flyp/2026-09-27-risk-e1prep.md:risk 主轴,邻接 inference 安全内容但由 flyp 独立维护

七、建议今晚 E2 活文档更新优先级

优先级 内容 动作
🔴 最高 arXiv 2609.23130 llm-d×vLLM×Mooncake agentic inference 工程数字(98.6% 输入占比 / 92.2% cache hit / 3.8× 吞吐 / TTFT -46×) 写入 §3.3/§3.6/§1.2
🔴 最高 arXiv 2609.06674 Detokenization Leaks 侧信道攻击(Ollama 5200 万次/月 · 加密通信无法防御) 写入 §3.8
🔴 最高 arXiv 2607.20468 InferenceBench coding agent 自动推理部署优化 写入 §1.5/§5.1
🟡 中 DeepSeek-V4.1-Flash arXiv 2609.19969 KV cache 压缩新标杆 写入 §3.3
🟡 中 LangGraph 1.2.4 + Pydantic v2.7+ 版本兼容性生产避坑 写入 §5.2
🟡 中 vLLM 生产 10 大坑(P50 -72.4% / P99 -91.3% / GPU 65%→92%) 写入 §1.1
🟡 中 DSpark 85% 加速 + EAGLE/P-EAGLE/Medusa 横评 写入 §4.1
🟡 中 字节跳动 TRAE 90% AI 代码 / 60% 产出提升案例 写入 §5.1
🟢 低 D195-D199 矛盾/待核实标注(vLLM 版本号差异 / DSpark 85% 来源 / InferenceBench 统计显著性 / Mooncake cache hit 鲁棒性 / DeepSeek-V4.1-Flash 详情) §附录标注

本报告由 Tom 实例自动生成 · 2026-09-27 22:20 CST 增量条目:5 条(arXiv 2609.23130 llm-d×vLLM×Mooncake / arXiv 2607.20468 InferenceBench / arXiv 2609.06674 Detokenization Leaks / DeepSeek-V4.1-Flash 2609.19969 / CSDN 推理工程化体系化内容) 涉及 arXiv 号:3+40+(本次新增:2609.23130 / 2607.20468 / 2609.06674;续用锚定 40+ 个)