inference · E1 预消化简报(2026-09-27)
状态摘要
- 增量条数:5 条主增量(在 3-8 目标区间内;2026-09-26 22:20 ~ 2026-09-27 22:20 滑动窗口)
- 核心新增:① arXiv 2609.23130 llm-d×vLLM×Mooncake agentic inference 工程数字(98.6% 输入 token 占比 / Cache hit 1.7%→92.2% / 吞吐 3.8× / TTFT -46×)② arXiv 2607.20468 InferenceBench coding agent 自动推理部署优化(Claude Code / Codex CLI / OpenCode 在 vLLM/SGLang 上对比)③ Detokenization Leaks 侧信道攻击(Ollama 5200 万次/月受影响 / 加密通信无法防御)④ DeepSeek-V4.1-Flash KV cache 压缩新标杆(paper_card 1417)⑤ CSDN 推理工程化体系化内容(LangGraph 1.2.4 + Pydantic v2.7+ + vLLM 生产 10 大坑 + DSpark 85% 加速 + 字节跳动 TRAE 90%/60% 案例)
- 涉及 arXiv 号:本次新增 3 个(2609.23130 / 2607.20468 / 2609.06674);续用锚定 40+ 个
一、检查过的来源清单
| 来源目录 | 关键文件 | inference 相关度 |
|---|---|---|
| inbox/jay | 2026-09-27-1620-csdn-inference-engineering-llmops-speculative-decoding-sep27.md(16:20 · 13KB · 5 大加速技术栈 + vLLM/SGLang/TRT-LLM 决策树 + LangGraph 版本兼容性 + DSpark 85% + EAGLE/P-EAGLE/Medusa 横评 + Agent 生产四大工程问题 + 字节跳动 TRAE 案例) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-09-27-1735-jay-research-briefing-inference-vecdb-substack.md(17:35 · 13KB · LLM 推理引擎 2026Q3 状态更新 + RAGPerf/RAGMark/VecDB 评测 + Ken Huang Substack 10 篇系列 + inferenceengineering.tech 决策框架 + TGI 退市 + Fluid-Guided 2504.11320) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-09-27-1335-jay-security-inference-rag-stack-sep27.md(13:35 · 11KB · OpenAI HF 入侵事件 + InferenceBench 2607.20468 + Dell KV Cache 综述 2603.20397 + LLM Serving 数学优化 2605.01280 + llm-d×vLLM×Mooncake 2609.23130 + RAG 2026 类型学 + GitHub Trending) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-09-27-1050-jay-engineering-filtering-inference-agent-eval-sep27.md(10:50 · 16KB · inferenceengineering.tech H100 三引擎对比 + AI Agents Stack 2026 + Brain Bytes + Funda AI "第三拐点") |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-09-27-csdn-rag-vllm-agent-2026q3.md(12:21 · 6.8KB · vLLM 生产 10 大坑 + RAG RRF + BGE-Reranker + LangGraph + Ollama + vLLM 三角架构 + Milvus vs Pinecone + Milvus vs PGVector vs ES) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-09-27T0820-jay-csdn-agent-ops-enterprise-eval-llm-production-sep27.md(08:20 · 11KB · AI Agent 企业网络架构 + 昇腾 NPU + GLM + K8s + LLM MLOps · vLLM OOM 根因 + 滚动更新冷启动) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-09-27-1140-news-x-tech-radar.md(11:42 · 3.8KB · Agent Harness Pi+Jev 教程 + MOPD + WHALE + Gemini Live WebSocket API + LlamaParse + Opus 5.5) |
中 ⭐⭐⭐ |
| inbox/jay | 2026-09-27-1105-jay-five-category-briefing-sep27.md(11:07 · 11KB · VecDB 2026 综合基准 + CNCF llm-d disaggregated inference + ByteByteGo 数据生命周期 + K8s Gateway API) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-09-27-1450-jay-engineering-filtering-code-agent-rag-frameworks-sep27.md(14:50 · 8KB · DEV Community RAG vs 代码搜索 + Uvik Agentic AI Frameworks 2026 + Jev boringbot 深读 + GrepRAG + Hydra + LARGER) |
中 ⭐⭐⭐ |
| inbox/tom | 2026-09-26-inference-e1prep.md(昨日锚定基线:MCP 2026-07 无状态重大版本 + Jarvislabs/PremAI H100 实测 + arXiv 2605.01604 七大失败模式 + KVSET + 风险约束淘汰 + AWS FSx 分层存储) |
基线 |
| inbox/tom | 2026-09-27-0900-hf-daily-2026-09-27.md(HF Daily 15 件立标 · Linear Superposition 64▲ #3 续涨 + Rufus-Air 13▲ #14 新进) |
邻接 |
| inbox/spark | 2026-09-27-llm-infra-e1prep.md(18:40 · 整合了 jay 9-27 inference 五棒位 + llm-infra 主棒位承接) |
参考(跨主轴邻接) |
| inbox/flyp | 2026-09-27-risk-e1prep.md(风险主轴,邻接 inference 安全内容) |
邻接 |
| inbox/stephen | 2026-09-27-llm-application-e1prep.md(llm-application 主轴) |
参考 |
| paper_cards Sep 25-27 新卡 | 1417-2609-19969 DeepSeek-V4.1-Flash KV cache compression · 主分类 llm-infra · 锚入 inference §3.3 | NET-new 极高 ⭐⭐⭐⭐⭐ |
| paper_cards Sep 25-27 新卡 | 1487-2609-26550 JEV-as-a-Judge · 决策类判别 0.36% 成本达 SOTA · 锚入 inference §5.1 | 高 ⭐⭐⭐⭐ |
| paper_cards Sep 25-27 新卡 | 1432-2609-19499 Sample Count Is Not Enough · Test-time scaling 候选生成策略 · inference 邻接 | 中 ⭐⭐⭐ |
| paper_cards Sep 25-27 新卡 | 1440-2609-15126 MoME Mixture-of-Memory Embeddings · context-aware sparse lookup · inference 邻接 | 中 ⭐⭐⭐ |
| paper_cards Sep 25-27 新卡 | 1441-2609-09206 MLLMs Hallucinate when Info Distribution Drifts · synergy heads · inference 邻接 | 中 ⭐⭐⭐ |
| work-queue Sep 27 22:00 | Top15 无 inference 主分类专项 | 参考 |
二、增量条目
增量 1:arXiv 2609.23130 — llm-d × vLLM × Mooncake agentic inference 工程量化数字(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-27-1335-jay-security-inference-rag-stack-sep27.md §2.4;原始来源 arXiv:2609.23130
URL:https://arxiv.org/html/2609.23130v1
arXiv 号:2609.23130
要点:
- agentic 工作负载特性:输入 token 占服务 token 的 98.6%,可重用前缀状态主导部署设计——这为 prefix caching / KV cache 复用提供了"经济学基础"
- Mooncake 分布式 KV 持久化效果:Cache hit 从 1.7% 升至 92.2%;吞吐量提升 3.8×;P50 TTFT 降低 46 倍——大幅量化数据,来自真实 agentic traces
- llm-d 2026 tracing 工作:通过 OpenTelemetry 跨 Gateway、Endpoint Picker、KV-cache path、prefill/decode proxy 和 model server 传播上下文,添加决策级 span而非仅聚合指标——可观测性新方法论
- AWS P/D 解聚研究:在 GPT-OSS、NVIDIA B200、1024 in/1024 out 配置下,end-to-end 解聚配置可提升吞吐量达 70%
核心论点:agentic inference 是 KV cache 复用经济学的最大受益场景——98.6% 输入 token 占比意味着 prefix 重用是性能核心;Mooncake / llm-d 是当前最完整的端到端实现
可信度:★★★★ — arXiv 2026-09(极新),包含多个生产系统实测数据;Mooncake / llm-d / AWS P/D 解聚三组数据可交叉验证
与活文档现有脉络的关系:inference.md v3.44 §1.1(框架格局)已锚定 vLLM v0.30.0 / SGLang v0.5.20 / TGI 停服 + llm-d CNCF Sandbox;§3.3(Cache Compression)已锚定 KVTC / GEAR / HiSparse / DASH / OasisKV / OmniKVQuant;§3.6(分层 Offloading)已锚定 vLLM 分层 KV Cache Offloading L0/L1/L2 三层架构 + Mooncake;本条是承接延续 + 新增具体数字:① 98.6% 输入 token 占比量化了 agentic inference 的 KV 复用经济学基础;② Mooncake 92.2% cache hit + 3.8× 吞吐 + TTFT -46× 是分层 Offloading 的生产验证数字;③ llm-d OpenTelemetry 决策级 span 是 llm-d CNCF Sandbox 工程化的新方法论;④ AWS P/D 解聚 70% 提升是 PD Disaggregation 生产价值的独立来源印证
建议归入章节: - §3.3 Cache Compression(邻接扩增预备级 · arXiv 2609.23130 · Mooncake 分布式 KV 持久化数字:98.6% 输入 token 占比 + Cache hit 1.7%→92.2% + 吞吐 3.8× + P50 TTFT -46×) - §3.6 Hybrid Memory 与分层 Offloading(邻接扩增预备级 · arXiv 2609.23130 · AWS P/D 解聚 GPT-OSS/B200 1024 in/1024 out · end-to-end 解聚吞吐提升 70%) - §1.2 llm-d CNCF Sandbox + K8s 推理编排(邻接扩增预备级 · llm-d OpenTelemetry 决策级 span 而非聚合指标 · 可观测性新方法论)
增量 2:arXiv 2607.20468 — InferenceBench:AI Agent 自动化推理部署优化(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-27-1335-jay-security-inference-rag-stack-sep27.md §2.1;原始来源 arXiv:2607.20468
URL:https://arxiv.org/html/2607.20468v1
arXiv 号:2607.20468
要点:
- 核心贡献:提出 InferenceBench,测量端到端的 LLM 推理服务器部署和优化能力,暴露框架、量化和运行时选择,对比固定预算的非 agent 搜索基线
- 实验对象:Claude Code 2.1.114、Codex CLI 0.125.0、OpenCode 1.14.19 三个 coding agent scaffold;在 vLLM 和 SGLang 两个推理引擎上执行优化任务
- 关键发现:
- Agent 驱动的推理优化在固定预算下可超越人工调优基线——这是核心结论,颠覆"LLM 自动调优不如人工"的简化叙事
- 不同 scaffold(Claude Code / Codex CLI / OpenCode)在不同场景下互有胜负——没有单一 scaffold 全场景最优
- GLM-5 和 GPT-5.5 High 均参与评测——开源 + 闭源模型双轨
- 与 SWE-Serve 的关系:SWE-Serve 是"基准测试",InferenceBench 是"端到端自动化优化"——两者共同构成推理 Serving 工程从"测"到"做"的完整链路
核心论点:AI coding agent 可自动化推理部署优化——从"评估框架"到"自动化优化"是 2026 年推理 Serving 工程的重要范式转变
可信度:★★★★ — arXiv 2026-07;具体 benchmark 数字需读全文 + 独立验证
与活文档现有脉络的关系:inference.md §1.5(推理可靠性与可观测性)已锚定 SWE-Serve(arXiv:2509.15000,Jennifer Williams et al.)作为推理 Serving 工程首个专项基准;§5.1(Agent 失败模式与可靠性)已锚定 arXiv:2605.01604 七大失败模式;本条是承接延续 + 新增:InferenceBench 是"SWE-Serve 的下一代"——从"基准测试"走向"端到端自动化优化",三个具体 scaffold 版本号(Claude Code 2.1.114 / Codex CLI 0.125.0 / OpenCode 1.14.19)是生产可参考数据;与 §5.1 已锚定的 Multi-Agent 生产级联故障(Hub injection 100% / LangGraph 89.2%)形成"Agent 自动化推理 vs Agent 故障传播"两端
建议归入章节: - §1.5 推理可靠性与可观测性(邻接扩增预备级 · arXiv 2607.20468 · InferenceBench · 端到端推理部署优化 benchmark · Claude Code 2.1.114 / Codex CLI 0.125.0 / OpenCode 1.14.19 在 vLLM/SGLang 上自动优化) - §5.1 Agent 失败模式与可靠性(邻接扩增预备级 · 承接 SWE-Serve + InferenceBench = "推理 Serving 工程基准 + 端到端自动化优化"完整链路)
增量 3:arXiv 2609.06674 — Detokenization Leaks:共享后端推理的侧信道攻击(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-27-1335-jay-security-inference-rag-stack-sep27.md §安全事件关联;原始来源 arXiv:2609.06674
URL:https://arxiv.org/html/2609.06674v1
arXiv 号:2609.06674
主题:cs.CR(密码学与安全)
要点:
- 攻击面:共享 backend(Ollama / LM Studio 等)时,detokenization 时间可作为侧信道泄露其他用户 LLM 输出
- 受影响范围:Ollama 月活高增长,5200 万次/月下载(截至 2026-09)
- 关键警告:加密通信无法防御此攻击——因为攻击针对的是推理引擎内部的 detokenization 延迟,而非网络层
- 攻击原理:token 长度与 detokenization 时间存在相关性;攻击者通过观察自己的请求响应时间推断同 backend 其他用户输出 token 的部分信息
核心论点:共享推理后端的安全风险超出传统认知——加密网络传输无法掩盖计算层的侧信道;2026 年推理引擎安全评估需将 multi-tenant 场景作为独立威胁模型
可信度:★★★★ — arXiv cs.CR,学术同行评审级别;5200 万次/月下载数字有第三方来源佐证
与活文档现有脉络的关系:inference.md §3.8(KV Cache 安全新维度)已锚定 Shadow in the Cache(arXiv:2508.09442,KV-cache 明文存储)和 MATS Research 加密推理窃取攻击(arXiv:2608.09867);本条是安全维度的横向扩展:从"KV cache 明文"延伸到"detokenization 侧信道",共同构成推理引擎安全全景;与 §1.5(推理可靠性与可观测性)形成"性能-安全"双重视角
建议归入章节: - §3.8 KV Cache 安全新维度(扩增 · arXiv 2609.06674 · Detokenization Leaks · 共享后端侧信道攻击 · Ollama 5200 万次/月受影响 · 加密通信无法防御 · multi-tenant 推理安全需独立威胁模型)
增量 4:DeepSeek-V4.1-Flash KV Cache 压缩新标杆(paper_card 1417,⭐⭐⭐⭐)
来源:paper_cards/1417-2609-19969.md(paper_card 1417 · 主分类 llm-infra · 2026-09-26 入库);原始来源 arXiv:2609.19969
URL:https://arxiv.org/abs/2609.19969
arXiv 号:2609.19969
标题:DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
要点:
- 定位:DeepSeek-V4.1-Flash 的 KV cache 压缩能力,Pushing the Limits of KV Cache Compression
- 技术方向:作为 DeepSeek 系列的 Flash 版本,预期延续 DeepSeek MLA(Multi-head Latent Attention)架构的 KV cache 压缩优势(128+ bytes/token → 576 bytes/layer,93.3% 内存降低)
- 上下文:vLLM v0.30.0 已新增 MXFP8 KV 支持(DeepSeek-V4.1-Flash),全 KV 在 SM100 以 MXFP8 存储;DeepSeek-V4 CPU 后端支持 AVX512/AMX 稀疏 MLA
核心论点:DeepSeek-V4.1-Flash 代表了 KV cache 压缩的生产极限——MLA 架构 + FP8 量化组合是 2026 年 KV cache 压缩的工程标杆
可信度:★★★★ — arXiv 2026-09,DeepSeek 系列,NVIDIA vLLM 官方集成背书
与活文档现有脉络的关系:inference.md §3.3(Cache Compression)已锚定 KVTC(20× 压缩)/ OmniKVQuant(异构模态感知)/ BeaconKV(免训练压缩)/ OasisKV(HBM 解耦);本条是同系列最新生产验证:DeepSeek-V4.1-Flash 的 MLA + MXFP8 KV 组合是 Era 5(Compression/Quantization)的当前峰值;与 §1.1 已锚定的 vLLM v0.30.0 MXFP8 KV 支持形成工程实现确认
建议归入章节: - §3.3 Cache Compression(扩增 · arXiv 2609.19969 · DeepSeek-V4.1-Flash KV cache compression 标杆 · MLA + MXFP8 KV 组合 · 锚入 Era 5 峰值)
增量 5:CSDN 推理工程化体系化内容——LangGraph 1.2.4 / vLLM 生产 10 大坑 / DSpark / TRAE 案例(⭐⭐⭐⭐)
来源:inbox/jay/2026-09-27-1620-csdn-inference-engineering-llmops-speculative-decoding-sep27.md + inbox/jay/2026-09-27-csdn-rag-vllm-agent-2026q3.md
要点:
- LangGraph 版本兼容性(生产必备):
langgraph >= 1.2.4(stable 2026-06)+langgraph-prebuilt == 1.1.0(>=1.1.0,<1.2.0)pydantic >= 2.0(推荐 2.7+)Python >= 3.10- checkpoint 表不存在 → 需调用
setup()初始化 -
Pydantic v1/v2 冲突是生产环境最常见破坏点
-
vLLM 生产 10 大坑(CSDN 高价值,⭐⭐⭐⭐⭐):
- KV Cache 泄漏 + 多卡并行负优化 + 模型加载慢 + 高并发不稳定 + 日志磁盘爆炸 + 监控盲区
- vLLM 0.3.3(2026-Q2 生产验证)
-
性能量化:P50 延迟 -72.4% / P99 -91.3% / GPU 利用率 ~65% → ~92%
-
DeepSeek DSpark 投机解码 85% 加速:
- 草稿模型预生成 + 目标模型并行验证 + 接受率指标
- vLLM 框架下工程实践:信心调度 + 半自回归优化 + 显存管理 + 可观测性监控
-
EAGLE 2-4× / P-EAGLE 2-4× / Medusa 2-3× / 树形多头(更高)
-
字节跳动 TRAE 案例:
- 90% 代码 AI 写,但人均需求吞吐率仅提升 60%——瓶颈在验证/审查/整合环节
-
这是 Agent 工程化的关键警示:工具调用频率 ≠ 实际产出提升
-
推理引擎选型决策树精化:
- 不要基于合成基准做选择,用真实流量 profiling 后再迁移(AIMultiple 2026-04 实证)
- TensorRT-LLM 编译开销大(2+ 小时/大型模型),运维 CI 流水线需管理 .engine 版本
核心论点:推理工程化已进入"版本管理 + 生产可观测性 + 成本优化"三位一体阶段——框架选择只是起点,LangGraph 版本兼容性 + vLLM 生产 10 大坑 + 字节跳动 TRAE 案例共同构成 2026 年推理工程的必修课
可信度:★★★★ — CSDN 技术社区,2026-09,版本号明确,有实测数据;vLLM 0.3.3 与活文档已锚定 v0.30.0 的版本号差异⚠ 待核实
与活文档现有脉络的关系:inference.md §1.1(框架格局)已锚定 vLLM v0.30.0 / SGLang v0.5.20 / TensorRT-LLM v1.2.1;§4.1(投机解码)已锚定 DFlash / P-EAGLE / Orthrus 警示;§5.2(Context Engineering)已锚定 MCP 2026-07-28;本条是工程落地层面的实质性补充:LangGraph 版本约束是生产部署的隐性成本;vLLM 生产 10 大坑是量化了框架选型后的工程代价;TRAE 案例揭示了"推理能力提升 ≠ 实际产出提升"的根本性认知偏差
建议归入章节: - §1.1 框架格局(扩增 · vLLM 生产 10 大坑 · P50 -72.4% / P99 -91.3% / GPU 65%→92% · vLLM 0.3.3 版本号差异⚠) - §4.1 投机解码与蒸馏部署新进展(扩增 · DSpark 85% 加速 + EAGLE/P-EAGLE/Medusa/树形多头横评 + 接受率/加速比量化) - §5.2 Context Engineering 与 Agentic RAG(扩增 · LangGraph >= 1.2.4 + langgraph-prebuilt == 1.1.0 + Pydantic >= 2.0 推荐 2.7+ · checkpoint setup() 初始化 · Pydantic v1/v2 冲突生产避坑) - §5.1 Agent 失败模式与可靠性(扩增 · 字节跳动 TRAE 90% AI 代码 / 60% 产出提升 · 瓶颈在验证/审查/整合环节)
三、值得警惕的矛盾或待核实说法
D195:vLLM 0.3.3 与 v0.30.0 版本号差异(⭐⭐⚬)
- 问题:jay 9-27 csdn 提到"vLLM 0.3.3(2026-Q2 生产验证)",但活文档已锚定 vLLM v0.30.0(762 commits,2026-09-22)
- 可能性 1:0.3.3 = 旧版本号体系,0.30.0 = 新版本号体系(双轨并行)
- 可能性 2:CSDN 作者版本号标注错误
- 建议:归入 §1.1 时标注"vLLM 0.3.3 与 0.30.0 版本号体系差异待核实;建议核验 vLLM GitHub releases 页"
D196:DSpark 85% 加速数字来源(⭐⭐⚬)
- 问题:CSDN 提到"DeepSeek DSpark 85% 推理加速",但原始数据 + 模型规格 + 接受率条件未在 snippet 中体现;可能是 DeepSeek-V4 特定场景下测得
- 建议:归入 §4.1 时标注"DSpark 85% 加速数字来源待核实;建议核验 DeepSeek 官方仓库与 vLLM 集成版本"
D197:InferenceBench 2607.20468 统计显著性(⭐⭐⚬)
- 问题:论文声称"Agent 驱动的推理优化在固定预算下可超越人工调优基线",但具体统计显著性(p-value)+ 任务多样性 + 模型数量未在 snippet 中体现
- 建议:归入 §1.5 时标注"InferenceBench 端到端自动化优化方法学已通过,但具体基准数据集规模 + scaffold head-to-head 对比条件需读全文核实"
D198:Mooncake 92.2% Cache hit 在不同 prefix 复用率下的鲁棒性(⭐⭐⚬)
- 问题:Mooncake 分布式 KV 持久化"Cache hit 1.7%→92.2% + 吞吐 3.8× + P50 TTFT -46×"是 agentic inference 场景下测得,但 prefix 复用率分布敏感——通用负载(独立请求、无共享前缀)下优势可能缩减至 1-4%
- 建议:归入 §3.3 时标注"Mooncake 92.2% Cache hit 是 agentic inference 场景下测得;通用负载下优势缩减至 1-4%;建议生产部署前用真实流量 profiling"
D199:DeepSeek-V4.1-Flash arXiv 2609.19969 论文详情待核(⭐⭐⚬)
- 问题:paper_card 1417 标注了 DeepSeek-V4.1-Flash 的 KV cache compression 方向,但具体压缩比 / 精度损失 / MLA 架构细节未在 snippet 中体现
- 建议:归入 §3.3 时标注"arXiv 2609.19969 具体数字待读全文核实;DeepSeek MLA + MXFP8 KV 组合是当前已知信息"
四、可引用 arXiv 号列表
| arXiv 号 | 标题 | 可信度 | 与 inference.md 关系 |
|---|---|---|---|
| 2609.23130 | llm-d × vLLM × Mooncake 解聚式推理工程洞察 · agentic inference 98.6% 输入 token 占比 · Mooncake Cache hit 1.7%→92.2% + 吞吐 3.8× + P50 TTFT -46× · AWS P/D 解聚 70% 提升 | 高(arXiv 2026-09,极新,多生产系统实测) | 本次新增 → §3.3/§3.6/§1.2 |
| 2607.20468 | InferenceBench · AI Agent 自动化推理部署优化 · Claude Code 2.1.114 / Codex CLI 0.125.0 / OpenCode 1.14.19 在 vLLM/SGLang 上自动优化 · GLM-5 + GPT-5.5 High 评测 | 高(arXiv 2026-07) | 本次新增 → §1.5/§5.1 |
| 2609.06674 | Detokenization Leaks · 共享后端推理的侧信道攻击 · Ollama 5200 万次/月受影响 · 加密通信无法防御 | 高(arXiv cs.CR) | 本次新增 → §3.8 |
| 2609.19969 | DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression | 高(arXiv 2026-09,DeepSeek 系列) | 本次新增 → §3.3 |
| 2605.01604 | Agentic AI 生产评估7大失败模式 · FM-7 代理目标收敛 | 高(arXiv 2026-05) | 昨日续立 → §5.1 |
| 2609.27746 | KVSET: KV Cache Working Set 在线容量规划 | 高(arXiv 2026-09-23) | 昨日续立 → §3 |
| 2609.27981 | 风险约束型 KV-Cache 淘汰:Reliability Contract | 高(arXiv 2026-09-23) | 昨日续立 → §3 |
| 2504.11320 | Fluid-Guided 在线调度 | 高 | 昨日续立 → §2.2 |
| 2609.19657 | H100 Prefix Reuse TTFT: vLLM vs TRT-LLM · 5–6.5× TTFT | 高 | 续立 → §2.2 |
| 2609.20511 | EOS Tokens:OPD 长度膨胀 | 高 | 续立 → §2.2 |
| 2605.01280 | LLM Serving 需要数学优化 | 高 | 续立 → §2.2 |
| 2605.00528 | SAGA: Workflow-Atomic Scheduling for AI Agent Inference | 高 | 续立 → §2.2 |
| 2608.06557 | Cascade: SLO 驱动的在线调度 | 高 | 续立 → §2.2 |
| 2506.09713v2 | LLM Inference Engines Bug 实证分类 | 高 | 续立 → §1.5 |
| 2605.11093 | HookPoint: 3.6% overhead 可观测性方案 | 高 | 续立 → §1.5 |
| 2509.15000 | SWE-Serve: 推理 Serving 工程专项基准 | 高 | 续立 → §1.5 |
| 2609.19169 | SiliconBench: Apple Silicon 三维 LLM Serving | 高 | 续立 → §1.6 |
| 2609.25053 | LatentPort: 跨模型递归记忆迁移 | 高 | 续立 → §3.5 |
| 2609.22870 | FP8 RL 全流水线训练不稳定 | 高 | 续立 → §4.2 |
| 2609.17475 | JustFit: 200K-Token on 24 GiB Apple Silicon | 高 | 续立 → §3.5 |
| 2609.17652 | Fathom: 稀疏解码 KV Cache 卸载每查询读取深度 | 高 | 续立 → §3.5 |
| 2609.18063 | Edge0: SSD MoE prerouter | 高 | 续立 → §3.5 |
| 2608.09442 | Shadow in the Cache | 高 | 续立 → §3.8 |
| 2608.09867 | 加密推理窃取攻击 | 高 | 续立 → §3.8 |
| 2511.01815 | KVTC: 20× KV Cache 压缩 | 高 | 续立 → §3.3 |
| 2403.05527 | GEAR: 4-bit KV Cache 近无损 | 高 | 续立 → §3.3 |
| 2504.19874 | TurboQuant: ICLR 2026 | 高 | 续立 → §3.3 |
| 2609.11582 | OmniKVQuant: 异构模态感知 KV 量化 | 高 | 续立 → §3.3 |
| 2609.04971 | BeaconKV: 免训练 KV Cache 压缩 | 高 | 续立 → §3.3 |
| 2608.08097 | OasisKV: HBM 解耦 KV Cache | 高 | 续立 → §3.3 |
| 2608.14333 | DASH: MoE 专用双层 KV Cache | 高 | 续立 → §3.3 |
| 2608.07009 | HiSparse: 分层 KV Cache 4.7× 吞吐提升 | 高 | 续立 → §3.3 |
| 2510.09665 | LMCache: 字节跳动生产级 KV Cache 跨节点缓存 | 高 | 续立 → §3.4 |
| 2602.21548 | DualPath: Agentic 推理 I/O 瓶颈破解 | 高 | 续立 → §3.7 |
| 2609.26550 | JEV-as-a-Judge: 决策类判别 0.36% 成本达 SOTA | 高(HF Daily) | 续立 → §5.1 |
| 2609.15504 | Orthrus 损失性警示:BF16 下仅 45% 轨迹匹配 | 高 | 续立 → §4.1 |
| 2608.30135 | Verification-Aware Training for Speculative Decoding | 高 | 续立 → §4.1 |
| 2607.26627 | Revisiting Lossy Verification in Speculative Decoding | 高 | 续立 → §4.1 |
五、检查过的来源汇总(可审计)
inbox/jay/2026-09-27-1050-jay-engineering-filtering-inference-agent-eval-sep27.md(10:50 · 16KB · inferenceengineering.tech H100 三强对比 + AI Agents Stack 2026 + Brain Bytes + Funda AI 第三拐点)
inbox/jay/2026-09-27-1105-jay-five-category-briefing-sep27.md(11:07 · 11KB · VecDB 2026 综合基准 + CNCF llm-d disaggregated inference)
inbox/jay/2026-09-27-1335-jay-security-inference-rag-stack-sep27.md(13:35 · 11KB · OpenAI HF 入侵事件 + InferenceBench 2607.20468 + Dell KV Cache 综述 + LLM Serving 数学优化 + llm-d×vLLM×Mooncake 2609.23130 + RAG 2026 类型学)
inbox/jay/2026-09-27-1450-jay-engineering-filtering-code-agent-rag-frameworks-sep27.md(14:50 · 8KB · Jev boringbot 深读 + GrepRAG + Hydra + LARGER)
inbox/jay/2026-09-27-1620-csdn-inference-engineering-llmops-speculative-decoding-sep27.md(16:20 · 13KB · 5 大加速技术栈 + vLLM/SGLang/TRT-LLM 决策树 + LangGraph 版本兼容性 + DSpark 85% + EAGLE/P-EAGLE/Medusa + Agent 生产四大工程问题 + TRAE 案例)
inbox/jay/2026-09-27-1735-jay-research-briefing-inference-vecdb-substack.md(17:35 · 13KB · LLM 推理引擎 2026Q3 状态 + RAGPerf/RAGMark/VecDB 评测 + Ken Huang 10 篇 + inferenceengineering.tech 决策框架 + TGI 退市 + Fluid-Guided)
inbox/jay/2026-09-27-csdn-rag-vllm-agent-2026q3.md(12:21 · 6.8KB · vLLM 生产 10 大坑 + RAG RRF + BGE-Reranker + LangGraph + Ollama + vLLM 三角架构)
inbox/jay/2026-09-27T0820-jay-csdn-agent-ops-enterprise-eval-llm-production-sep27.md(08:20 · 11KB · AI Agent 企业网络架构 + 昇腾 NPU + vLLM OOM 根因)
inbox/jay/2026-09-27-1140-news-x-tech-radar.md(11:42 · 3.8KB · Agent Harness Pi+Jev 教程 + MOPD + WHALE + Gemini Live WebSocket)
inbox/tom/2026-09-26-inference-e1prep.md(昨日锚定基线)
inbox/tom/2026-09-27-0900-hf-daily-2026-09-27.md(HF Daily 立标)
inbox/spark/2026-09-27-llm-infra-e1prep.md(llm-infra 主棒位承接)
inbox/flyp/2026-09-27-risk-e1prep.md(risk 主轴邻接)
paper_cards/1417-2609-19969.md(DeepSeek-V4.1-Flash · NET-new 锚入)
paper_cards/1487-2609-26550.md(JEV-as-a-Judge · 续立)
paper_cards/1432-2609-19499.md(Sample Count Is Not Enough · inference 邻接)
paper_cards/1440-2609-15126.md(MoME · inference 邻接)
paper_cards/1441-2609-09206.md(MLLMs Hallucinate · inference 邻接)
work-queue Sep 27 22:00(Top15 无 inference 主分类专项)
六、本次无显著新增量的来源说明
以下来源已检查,但无 inference 主轴净增量,或已被活文档覆盖:
- paper_cards Sep 25-27 新卡筛选结果:
- 1432-2609-19499(Sample Count Is Not Enough · Test-time scaling 候选生成策略)→ inference 邻接但非直接新增
- 1440-2609-15126(MoME Mixture-of-Memory Embeddings)→ context-aware sparse lookup,inference 邻接
- 1441-2609-09206(MLLMs Hallucinate when Info Distribution Drifts)→ synergy heads,inference 邻接
- 其余 paper_cards 均为其他主分类(agent / multimodal / evaluation / engineering),筛选后排除
- inbox/spark/2026-09-27-llm-infra-e1prep.md:llm-infra 主轴,跨主轴邻接 inference 但已由 spark 独立维护
- inbox/stephen/2026-09-27-llm-application-e1prep.md:llm-application 主轴,与 inference 邻接但非直接新增
- inbox/flyp/2026-09-27-risk-e1prep.md:risk 主轴,邻接 inference 安全内容但由 flyp 独立维护
七、建议今晚 E2 活文档更新优先级
| 优先级 | 内容 | 动作 |
|---|---|---|
| 🔴 最高 | arXiv 2609.23130 llm-d×vLLM×Mooncake agentic inference 工程数字(98.6% 输入占比 / 92.2% cache hit / 3.8× 吞吐 / TTFT -46×) | 写入 §3.3/§3.6/§1.2 |
| 🔴 最高 | arXiv 2609.06674 Detokenization Leaks 侧信道攻击(Ollama 5200 万次/月 · 加密通信无法防御) | 写入 §3.8 |
| 🔴 最高 | arXiv 2607.20468 InferenceBench coding agent 自动推理部署优化 | 写入 §1.5/§5.1 |
| 🟡 中 | DeepSeek-V4.1-Flash arXiv 2609.19969 KV cache 压缩新标杆 | 写入 §3.3 |
| 🟡 中 | LangGraph 1.2.4 + Pydantic v2.7+ 版本兼容性生产避坑 | 写入 §5.2 |
| 🟡 中 | vLLM 生产 10 大坑(P50 -72.4% / P99 -91.3% / GPU 65%→92%) | 写入 §1.1 |
| 🟡 中 | DSpark 85% 加速 + EAGLE/P-EAGLE/Medusa 横评 | 写入 §4.1 |
| 🟡 中 | 字节跳动 TRAE 90% AI 代码 / 60% 产出提升案例 | 写入 §5.1 |
| 🟢 低 | D195-D199 矛盾/待核实标注(vLLM 版本号差异 / DSpark 85% 来源 / InferenceBench 统计显著性 / Mooncake cache hit 鲁棒性 / DeepSeek-V4.1-Flash 详情) | §附录标注 |
本报告由 Tom 实例自动生成 · 2026-09-27 22:20 CST 增量条目:5 条(arXiv 2609.23130 llm-d×vLLM×Mooncake / arXiv 2607.20468 InferenceBench / arXiv 2609.06674 Detokenization Leaks / DeepSeek-V4.1-Flash 2609.19969 / CSDN 推理工程化体系化内容) 涉及 arXiv 号:3+40+(本次新增:2609.23130 / 2607.20468 / 2609.06674;续用锚定 40+ 个)