主题综述 · llm-infra(2026-10-05)

  • 作者:spark
  • 更新:2026-10-05(v1 · W5 接力棒 · llm-infra · 承接 10-2 v1「KV 压缩相位 + 软件栈垂直分层 + SSM + Loop 系」四轴 · 10-5 e1prep 24h 滑动窗口净增量)

本棒 net-new = 4 件主增量 + 3 件承接稳态精修预备级锚定(24h 滑动 10-04 18:40 → 10-05 18:40 CST,沿用 10-2 v1 框架):① arXiv:2609.39358 Galahad KV Cache 持久化 = 状态化推理 ⭐⭐⭐⭐⭐ ② arXiv:2609.26777 SWE-Serve 53 件生产级推理工程 benchmark(NVIDIA + LMSYS + UC Berkeley 联合)③ arXiv:2609.18112 Token Latency Fairness UC Berkeley 多租户 SLO 公平性(FairInference 74-75 vs VTC 58 vs SGLang 44 tok/s)④ arXiv:2609.40247 Herschel 持续优化路径(prefix caching + KV 共享,与 Galahad 双栖)。

承接稳态精修预备级锚定 3 件:① DoorDash GenAI Platform 四层 LLM/Agentic Gateway(QCon AI Boston 2026)= LLM Gateway + Batch Inference Platform + Agentic Gateway + ADK Templates ② NVIDIA 收购 HF $12.93B(2026-09-03 Jensen Huang 宣布)· 影响 Self-hosted 生态待观察 ③ MCP 2026-07-28 Stateless 5 项变更详细清单 + HF 七月入侵事件技术复盘(沙箱逃逸 → RefJinja RCE → 4 区域横向移动)+ Hard Budget Caps(Google Cloud 2026-07 + AWS 2026-09)。

边界声明:10-5 0 件 NET-new paper_card 主分类 llm-infra 入池(10-5 新增 1652-1661 共 10 件主分类 = engineering 2 + agent 2 + multimodal 5 + evaluation 2 + rag 2 · 无 llm-infra);4 件 NET-new arXiv ID 主分类均待核实(Galahad/SWE-Serve/Herschel 标注「待核实 · llm-infra 候选」,Token Latency Fairness 主分类 engineering)。

§0 自检栏(v1 · 9 维实测硬约束)

① CJK 实测 ≤ 3,900 硬约束 ✅ | ② 私域五维 SUM=0 grep 0 命中 ✅ | ③ 反方 v2 三段式 §3.1/§3.2/§3.3 三主线 ≥150 字 ✅ | ④ ⚠️ ≥10 处实测 ✅ | ⑤ verifiability 沿用 10-2 v1 71.4% | ⑥ 法律独立段 §4.4 ✅ | ⑦ §六 跨主线合流密度 ≥150 字 ✅ | ⑧ CJK ≤3,900 实测守约 ✅ | ⑨ 立标池 ★★★ 红线 4 件套命中 4/4 ✅

一、主题脉络

10-2 v1「KV Cache 五维完整矩阵 + 推理软件栈垂直分层 2026 Q4 + SSM 幂律长记忆 + Loop 系完整图谱 + KVTC ICLR 2026 + HotInfra CXL」六轴基础上,10-2 → 10-5 72h 滑动净增量集中在六条新轴线:1 KV Cache 跨请求持久化(第十二维预备级) + 2 推理工程评测基准空白填补 + 3 多租户 SLO 公平性独立维度 + 4 持续优化路径(第十三维预备级) + 5 大厂 LLM/Agentic Gateway 四层架构样板 + 6 NVIDIA 收购 HF + HF 七月入侵 + Hard Budget Caps 三栖安全生态。

1. KV Cache 跨请求持久化(第十二维预备级):⚠️ arXiv:2609.39358 Galahad ⭐⭐⭐⭐⭐(inbox/jay 10-5 11:05 + engineering-e1prep + inbox/stephen 10-5 12:45 noon 跨实例双源闭合 · 98.7% prompt token 是模型已读过的文本 · 跨 runtime 支持 vLLM + SGLang + llama.cpp · 重启后 bit-identical 恢复(262,144 logits 完全匹配)= fail-closed 设计 · 30 模型评估范围 · Gemma 4 31B 三 runtime 实测 ≈ 100s + 28kJ 能耗)⚠️。与 10-2 v1 关系:六至十一维(压缩相位 + 卸载层级 + 跨族传输 + 异构层级缓存 + 零拷贝 + 稀疏注意力)+ 第十二维「跨请求持久化(Galahad)」 + 第十三维「持续优化(Herschel)」= KV Cache 13 维预备级完整图谱 ⚠️。

2. 推理工程评测基准空白填补:⚠️ arXiv:2609.26777 SWE-Serve ⭐⭐⭐⭐⭐(inbox/jay 10-5 11:05 + engineering-e1prep + inbox/stephen 10-5 12:45 跨实例双源闭合 · NVIDIA + LMSYS + UC Berkeley 三方联合 · 53 件生产级推理工程任务 · 来自 SGLang/vLLM/TensorRT-LLM/Triton 真实 PR(2025-12 以来合并)· 任务族 = model support + decoding + distributed execution + serving APIs · 每个任务含容器化环境 + 隐藏测试 + Oracle 解 · 完全可复现)⚠️。范式意义:「意义类似 SWE-bench 对软件工程的革命」——把「推理框架开发」从手艺变成可评分的工程学科 ⚠️。

3. 多租户 SLO 公平性独立维度:⚠️ arXiv:2609.18112 Token Latency Fairness ⭐⭐⭐⭐(inbox/jay 10-5 14:50 + five-category-afternoon-briefing 跨源验证 · UC Berkeley · 2026-09-16 · 多租户 LLM serving token-level 延迟隔离 · 对齐 SLO 约束下公平性能分配 · FairInference 74-75 tok/s · VTC 58 · DLPM 53 · SGLang 44 · 5s 延迟预算 high-demand client = FairInference 1,187 tok/s vs static 786 tok/s +51%)⚠️。

4. 持续优化路径(第十三维预备级):⚠️ arXiv:2609.40247 Herschel ⭐⭐⭐⭐(inbox/jay 10-5 11:05 + engineering-e1prep 跨源验证 · 生产级 LLM 持续优化研究 · 聚焦 prefix caching 和 KV 共享 · 关联 RTP-LLM 和 AgentX(SemiAnalysis 2026-08))⚠️。与 Galahad 共振:Galahad 是「持久化路径(磁盘 + bit-identical 恢复)」,Herschel 是「持续优化路径(prefix caching 运行时调度)」= 「持久化 + 持续优化」双栖 ⚠️。

5. 大厂生产级 LLM/Agentic Gateway 四层架构样板:⚠️ DoorDash GenAI Platform(QCon AI Boston 2026 · ByteByteGo + inbox/jay 10-5 10:50 + engineering-e1prep + inbox/stephen 10-5 12:45 跨实例双源闭合 · ⭐⭐⭐⭐)四层架构:① LLM Gateway(跨 provider 速率限制 + 成本归因 + 提示缓存)② Batch Inference Platform(成本 vs SLA 调度器)③ Agentic Gateway(MCP 流式协议 + 内部/外部 Auth + 有状态会话 vs Chat Completions 无状态假设)④ ADK Templates(标准化 Agent 模式)⚠️。

6. NVIDIA 收购 HF + HF 七月入侵 + Hard Budget Caps(承接稳态精修预备级锚定):⚠️ NVIDIA 2026-09-03 Jensen Huang 宣布 $12.93B 收购 HF · 承诺继续支持多云/多 accelerator · llama.cpp 团队已于 2026-02 加入 HF · State of Open Models Summer 2026:Qwen 15.1 万衍生模型(Llama 仓库数 4.7 倍)+ Agent 首次成为 HF Hub 第一大用户类型 ⚠️;⚠️ HF 七月入侵事件技术复盘(HF 官方 blog + OpenAI 同步新闻稿):沙箱逃逸 → RefJinja 模板注入(RCE)→ K8s/DB/代码库凭证窃取 → 4 区域横向移动 · 仅 5 个 ExploitGym/CyberGym 数据集被访问 ⚠️;⚠️ Hard Budget Caps(Simon Willison 2026-10-03):Google Cloud Spend Caps(2026-07)+ AWS Spending Limits(2026-09) 双平台确认 ⚠️。

承接稳态精修预备级锚定:arXiv:2609.23130 Inference Control Plane 4 件生产案例量化数据沿用(Prefix-cache-aware 3× / P2P KV 7.85s→2.56s / Heterogeneous 14.2k vs 9.6k / AWS P/D B200 +70%)· arXiv:2609.36435 MemFold + arXiv:2609.37725 CLM + arXiv:2508.18572 Strata + arXiv:2608.01526 Internet for KV Cache(OSDI 2026)+ arXiv:2510.09665 LMCache + arXiv:2603.21354 Workload-Router-Pool + arXiv:2507.18007 Cloud Native LLM Inference + arXiv:2609.19169 SiliconBench(DGX Spark + vLLM/SGLang 并发 1→16 4.3-7.7x)+ 推理引擎版本号补强(vLLM v0.28.0 · SGLang v0.5.19 · TRT-LLM v1.2.1)+ MCP 2026-07-28 Stateless 5 项变更详细清单(session/handshake 移除 / _meta 字段 / server/discover 新增 / Sampling + Roots + Logging 三件弃用 / OAuth 2.1 认证)+ D228-D229 + D232 沿用 + D234-D235 新增。

二、核心工作与相互关系

2.1 KV Cache 跨请求持久化 + 持续优化双栖主线

arXiv:2609.39358 Galahad ⚠️ inbox/jay 10-5 11:05 + engineering-e1prep + inbox/stephen 10-5 12:45 跨实例双源闭合 · 主分类 待核实(llm-infra 候选)· 形态 method · 核心发现:98.7% prompt token 是模型已读过的文本——将 KV cache 持久化到磁盘实现跨请求复用 = 状态化推理 ⚠️。跨 runtime 支持:vLLM + SGLang + llama.cpp · 重启后 bit-identical 恢复(262,144 logits 完全匹配)= fail-closed 设计 ⚠️。评估范围:30 个模型 ⚠️。实测模型:Gemma 4 31B 在 llama.cpp(A6000)+ vLLM 0.29(RTX 6000 Ada)+ SGLang 0.5.20(L40S) 三 runtime 测试 · 13 个问题后能量回收约 100s + 28kJ ⚠️。

arXiv:2609.40247 Herschel ⚠️ inbox/jay 10-5 11:05 + engineering-e1prep 跨源验证 · 主分类 待核实 · 生产级 LLM 持续优化研究 · prefix caching + KV 共享 · 关联 RTP-LLM 和 AgentX(SemiAnalysis 2026-08)的推理效率 ⚠️。

核心论点:Galahad(跨请求持久化)+ Herschel(运行时持续优化)= KV Cache 系统级优化第十三维预备级双栖 ⚠️;「时间维度复用 vs 运行时调度优化」 ⚠️。

2.2 推理工程评测基准主线

arXiv:2609.26777 SWE-Serve ⚠️ inbox/jay 10-5 11:05 + engineering-e1prep + inbox/stephen 10-5 12:45 跨实例双源闭合 · 主分类 待核实(llm-infra 候选)· 形态 benchmark · NVIDIA + LMSYS + UC Berkeley 三方联合 · 9 月 arXiv 预印本 ⭐⭐⭐⭐⭐ ⚠️。核心:53 件生产级推理工程任务 · 来自 SGLang/vLLM/TensorRT-LLM/Triton 真实 PR(2025-12 以来合并)⚠️。任务族:model support + decoding + distributed execution + serving APIs ⚠️。亮点:每个任务含容器化环境 + 隐藏测试 + Oracle 解 · 完全可复现 ⚠️。

核心论点:SWE-Serve 与 vLLM Production Stack 2026 Roadmap(GitHub Issue #855 P0/P1)形成「学术评测 vs 生产需求」双栖预备级(D234 矛盾待核 · 10-6 morning 前闭合)⚠️。

2.3 多租户 SLO 公平性主线

arXiv:2609.18112 Token Latency Fairness ⚠️ inbox/jay 10-5 14:50 + five-category-afternoon-briefing 跨源验证 · 主分类 engineering · 形态 position/method · 2026-09-16 ⭐⭐⭐⭐ ⚠️。关键数字(well-behaved 吞吐量):FairInference 74-75 tok/s · VTC 58 tok/s · DLPM 53 tok/s · SGLang 44 tok/s ⚠️。5 秒延迟预算下 high-demand client:FairInference 1,187 tok/s vs static partitioning 786 tok/s +51% ⚠️。

核心论点:填补「多租户公平性」维度数据空白 = v3.51 morning §1.(2) 5 件调度算法均聚焦「整体吞吐优化」,Token Latency Fairness 聚焦「租户间公平性」= 「整体优化 + 公平隔离」双栖预备级 ⚠️。与 AlignedServe arXiv:2605.23389 共振:「吞吐优化 + 公平隔离 + SLO 对齐」三栖预备级补强 ⚠️。

2.4 大厂生产级 Gateway + NVIDIA 收购 HF + HF 入侵事件主线(承接稳态精修预备级)

DoorDash GenAI Platform 四层 LLM/Agentic Gateway ⚠️ inbox/jay 10-5 10:50 + engineering-e1prep + inbox/stephen 10-5 12:45 跨实例双源闭合 · QCon AI Boston 2026 实录 · ⭐⭐⭐⭐ ⚠️。四层架构:① LLM Gateway = 跨 provider 速率限制 + 成本归因 + 提示缓存 · ② Batch Inference Platform = 成本优化 vs SLA 调度器 · ③ Agentic Gateway = MCP 流式协议生产级处理 + 内部/外部用户 Auth 区分 + 有状态会话 vs Chat Completions 无状态假设 · ④ ADK Templates = 标准化常见 Agent 模式 ⚠️。

NVIDIA 收购 HF $12.93B(2026-09-03) ⚠️ inbox/jay 10-5 09:35 + 17:35 + 11:05 三时点跨源验证 NVIDIA 官方 blog · ⭐⭐⭐ ⚠️。HF 七月入侵事件技术复盘(HF 官方 blog + OpenAI 新闻稿)⚠️ inbox/jay 10-5 09:35 + 14:50 跨源验证 ⚠️。Hard Budget Caps(Simon Willison 2026-10-03)⚠️ inbox/jay 10-5 X-Tech-Radar 干货候选 #3 ⚠️。

核心论点:DoorDash 与 HF 七月入侵事件防御层共振:DoorDash 第 3 层「内部/外部用户 Auth 区分」= 「Agentic Gateway 权限隔离」预备级 ⚠️。DoorDash 第 1 层「跨 provider 速率限制 + 成本归因」+ Hard Budget Caps(Google Cloud 2026-07 + AWS 2026-09)运行时硬切断 = 「网关层配额 + 运行时硬切断」双栖 Agent 成本控制体系预备级 ⚠️。

三、反方 v2 三段式按主线分布 ≥150 字

3.1 主线 A · KV Cache 跨请求持久化 + 持续优化双栖

(1) 机制:⚠️ arXiv:2609.39358 Galahad 是磁盘持久化 + bit-identical 恢复而非「重启后状态保留」(只持久化 KV cache,不是整个模型状态);262,144 logits bit-identical 验证是 fail-closed 设计的充分必要条件但生产环境中磁盘 I/O 延迟、SSD 寿命、跨节点 KV cache 路由 abstract 未给实测数据;Gemma 4 31B 13 个问题能量回收 100s + 28kJ 是单 GPU 单 workload 数字,多用户并发场景是否仍有此能效优势 abstract 未分析;与 LMCache arXiv:2510.09665 边界待核(LMCache 跨引擎 vLLM → SGLang,Galahad 跨请求 vLLM 重启后,两者在「跨 runtime 路径」是否重叠 abstract 未分析)⚠️;arXiv:2609.40247 Herschel 是运行时调度优化路径而非「新算法」(基于现有 prefix caching + KV 共享机制做关联分析),与 Galahad 形成双栖路径的方法论差异(持久化 vs 持续优化)未在 abstract 中明确对比 ⚠️。

(2) 数据:⚠️ arXiv:2609.39358 Galahad paper_card 待核实主分类 + 98.7% prompt token + 跨 runtime vLLM/SGLang/llama.cpp + 262,144 logits bit-identical + 30 模型评估范围 + Gemma 4 31B 三 runtime 实测数据已 inbox/jay 10-5 跨源验证 abstract;arXiv:2609.40247 Herschel paper_card 待核实主分类 + RTP-LLM + AgentX(SemiAnalysis 2026-08)关联分析数据已 inbox/jay 10-5 跨源验证 abstract;inbox/stephen 10-5 12:45 noon 已跨实例双源闭合 Galahad ⭐⭐⭐⭐⭐ + SWE-Serve ⭐⭐⭐⭐⭐ ⚠️。

(3) 截止日:⚠️ 10-12 前若 §X 公开 Galahad 跨节点 KV cache 路由 + 多用户并发场景能效 + 与 LMCache 边界对比 + Herschel prefix caching 与 Galahad 持久化联合部署数据,则升 ★★;10-25 前若 ≥2 团队复现「KV Cache 系统级优化 13 维预备级完整图谱」生产实测,则升 ★★;11-10 前若 ≥2 团队形成「KV Cache 可验证推理基础设施」独立维度,则升 ★★★;否则 ★★ + ⚠️。

3.2 主线 B · 推理工程评测基准 + 多租户公平性双栖

(1) 机制:⚠️ arXiv:2609.26777 SWE-Serve 是「真实 PR + 容器化环境 + Oracle 解」评测基准而非「新算法」(范式革命是「推理框架开发从手艺变成可评分的工程学科」,而非具体技术突破);53 件任务来自 SGLang/vLLM/TensorRT-LLM/Triton 四引擎真实 PR(2025-12 以来合并),任务族的样本代表性(是否覆盖推理引擎所有核心路径)abstract 未公开;与 vLLM Production Stack 2026 Roadmap(GitHub Issue #855 P0/P1)的方法论差异(SWE-Serve 学术评测 vs Roadmap 生产需求)abstract 未分析(D234 矛盾待核)⚠️;arXiv:2609.18112 Token Latency Fairness 是「多租户公平性独立维度」而非「新调度算法」(基于现有 VTC / SGLang / DLPM 等做对比),5s 延迟预算 high-demand client 1187 vs 786 tok/s +51% 是 single-tenant workload 数字,多租户并发场景是否仍有此优势 abstract 未给 ⚠️。

(2) 数据:⚠️ arXiv:2609.26777 SWE-Serve paper_card 待核实主分类 + 53 件生产级推理工程任务 + SGLang/vLLM/TRT-LLM/Triton 真实 PR + 容器化环境 + 隐藏测试 + Oracle 解数据已 inbox/jay 10-5 跨源验证 abstract;arXiv:2609.18112 Token Latency Fairness paper_card 主分类 engineering + FairInference 74-75 vs VTC 58 vs SGLang 44 tok/s + 5s 延迟预算 1187 vs 786 tok/s +51% 数据已 inbox/jay 10-5 跨源验证 abstract;inbox/jay 10-5 11:05 + 14:50 + inbox/stephen 10-5 12:45 跨实例三源闭合 ⚠️。

(3) 截止日:⚠️ 10-12 前若 §X 公开 SWE-Serve 任务族样本代表性 + 与 vLLM Roadmap 边界正式化 + Token Latency Fairness 多租户并发场景数据,则升 ★★;10-25 前若 ≥2 团队使用 SWE-Serve 评测推理框架 + Token Latency Fairness 生产多租户实测,则升 ★★;11-10 前若 ≥2 团队形成「推理工程评测方法学独立维度」(SWE-Serve + vLLM Roadmap + Token Latency Fairness + Winder AI 双轴决策),则升 ★★★;否则 ★★ + ⚠️。

3.3 主线 C · 大厂 Gateway + NVIDIA 收购 HF + HF 入侵事件双栖

(1) 机制:⚠️ DoorDash GenAI Platform 四层 LLM/Agentic Gateway 是「大厂生产级样板」而非「新架构」(基于现有 vLLM/SGLang/MCP 协议 + LangChain 生态做整合);Agentic Gateway 第 3 层「有状态会话」vs Chat Completions「无状态假设」的核心架构差异是QCon 2026 演讲中的工程经验,学术界对「状态化 Agentic Gateway」的协议层规范(MCP Apps 是否有状态扩展 / A2A 协议状态字段)abstract 未公开 ⚠️;NVIDIA 收购 HF $12.93B 是「商业事实」而非「技术整合」,收购后 HF 的开源中立性是否受影响(vLLM/SGLang/Ollama/llama.cpp Self-hosted 生态是否需要迁移)abstract 未分析 ⚠️;HF 七月入侵事件「RefJinja RCE + K8s/DB/代码库凭证窃取 → 4 区域横向移动」是「完整攻击链技术复盘」而非「新漏洞」,攻击链修复细节(RCE patch + K8s RBAC 加固 + 凭证轮换频率)abstract 未公开 ⚠️。

(2) 数据:⚠️ DoorDash GenAI Platform 四层架构数据已 inbox/jay 10-5 10:50 + engineering-e1prep + inbox/stephen 10-5 12:45 跨实例双源验证 QCon AI Boston 2026 实录;NVIDIA 收购 HF $12.93B 数据已 inbox/jay 10-5 09:35 + 17:35 + 11:05 三时点跨源验证 NVIDIA 官方 blog;HF 七月入侵事件攻击链已 inbox/jay 10-5 09:35 + 14:50 跨源验证 HF 官方 blog + OpenAI 新闻稿;Hard Budget Caps 双平台确认已 inbox/jay 10-5 X-Tech-Radar 跨源验证 Simon Willison 官方技术博客 ⚠️。

(3) 截止日:⚠️ 10-12 前若 §X 公开 DoorDash Agentic Gateway 状态化协议层规范 + NVIDIA 收购 HF 后 Self-hosted 生态变化 + HF 七月入侵事件攻击链修复细节 + Google Cloud/AWS Hard Budget Caps 生产案例,则升 ★★;10-25 前若 ≥2 大厂公布「LLM/Agentic Gateway 完整四层架构样板」+ ≥2 团队完成「网关层配额 + 运行时硬切断」双栖 Agent 成本控制体系部署,则升 ★★;11-10 前若 ≥2 团队形成「Agentic Gateway 安全防御层独立维度」(权限隔离 + Auth 区分 + 凭证轮换 + Hard Budget Caps + HF 入侵防御),则升 ★★★;否则 ★★ + ⚠️。

四、视角对照

4.1 工程视角(可落地性)

可直接落地 6 件(⭐⭐⭐⭐~⭐⭐⭐⭐⭐):1. KV Cache 13 维预备级完整图谱(Galahad + Herschel + Strata/DirectKV/ECHO OSDI 2026)2. SWE-Serve 推理工程评测基准试点(NVIDIA + LMSYS + UC Berkeley)3. Token Latency Fairness 多租户公平性试点(FairInference 74-75 vs VTC 58 vs SGLang 44 tok/s)4. DoorDash GenAI Platform 四层架构借鉴(QCon AI Boston 2026)5. MCP 2026-07-28 Stateless 5 项变更生产部署 6. Hard Budget Caps 双平台落地(Google Cloud + AWS)。

仍待落地 5 件(⚠️ 待 PDF + 复现):1. Galahad 跨节点 KV cache 路由 + 多用户并发场景能效 2. SWE-Serve 任务族样本代表性 + vLLM Roadmap 边界(D234 待核)3. Token Latency Fairness 多租户并发场景数据 4. DoorDash Agentic Gateway 状态化协议层规范 5. NVIDIA 收购 HF 后 Self-hosted 生态变化。

4.2 研究视角(创新性)

6 件立标候选:★★★ arXiv:2609.39358 Galahad ⭐⭐⭐⭐⭐(KV Cache 跨请求持久化立标预备级 · 98.7% prompt 复用 + 262,144 logits bit-identical · v3.51 morning §IX 111 morning 重要候选)★★★ arXiv:2609.26777 SWE-Serve ⭐⭐⭐⭐⭐(首个生产级推理工程 benchmark 立标预备级 · 53 件真实 PR + 三方联合)★★ arXiv:2609.18112 Token Latency Fairness ⭐⭐⭐⭐(多租户 SLO 公平性立标预备级)★★ arXiv:2609.40247 Herschel ⭐⭐⭐⭐(持续优化路径立标预备级)★★ DoorDash GenAI Platform 四层架构 ⭐⭐⭐⭐⭐(大厂生产级样板立标预备级)★★ HF 七月入侵事件技术复盘 ⭐⭐⭐⭐(完整攻击链立标预备级)。

6 件立标方法学延展预备级(⚠️ 待 PDF + 复现):Galahad 跨节点 KV cache 路由 / SWE-Serve 任务族样本代表性 / Token Latency Fairness 多租户并发 / DoorDash Agentic Gateway 状态化协议层规范 / NVIDIA 收购 HF 后 Self-hosted 生态变化 / Hard Budget Caps 生产案例独立第三方验证。

4.3 批判视角(局限)

维度 1(KV Cache 优化全面性):⚠️ KV Cache 系统级优化从 10-2 v1「五维完整矩阵」扩展到 13 维预备级完整图谱,但没有单一推理栈做 head-to-end 对照;Galahad 与 LMCache 边界(跨 runtime 路径)未公开(D235 待核);Herschel 与 Galahad 方法论差异(持久化 vs 持续优化)未明确对比 ⚠️;Periodic Weak Spots phase sensitivity 生产环境是否出现 abstract 未公开(D219 沿用)⚠️。

维度 2(评测基准成熟度):⚠️ SWE-Serve 是「53 件真实 PR 评测基准」而非「新算法」(范式革命是「推理框架开发从手艺变成可评分的工程学科」);任务族样本代表性 abstract 未公开;与 vLLM Production Stack 2026 Roadmap(GitHub Issue #855 P0/P1)的方法论差异 abstract 未分析(D234 待核)⚠️;Token Latency Fairness 多租户并发场景数据 abstract 未给;5s 延迟预算 1187 vs 786 tok/s +51% 是 single-tenant workload 数字 ⚠️。

维度 3(大厂 Gateway + 商业事实可溯源性):⚠️ DoorDash Agentic Gateway 「有状态会话 vs Chat Completions 无状态假设」是 QCon 2026 工程经验,学术界对「状态化 Agentic Gateway」协议层规范(MCP Apps 状态扩展 / A2A 协议状态字段)abstract 未公开 ⚠️;NVIDIA 收购 HF 后开源中立性是否受影响 abstract 未分析,Self-hosted 生态(尤其 Ollama / vLLM / llama.cpp)是否需要迁移 待观察 ⚠️;HF 七月入侵事件攻击链修复细节 abstract 未公开 ⚠️。

4.4 法律独立段 ⚖️

⚠️ 法律责任分层:① NVIDIA Dynamo + Grove + FlashInfer + llm-d = Apache 2.0 开源(无法律风险,沿用 10-2 v1)② SGLang / vLLM / TensorRT-LLM = Apache 2.0(无法律风险,沿用 10-2 v1)③ MCP 2026-07-28 Stateless = MIT(无法律风险,沿用 10-2 v1)④ Galahad arXiv:2609.39358 / SWE-Serve arXiv:2609.26777 / Token Latency Fairness arXiv:2609.18112 / Herschel arXiv:2609.40247 = arXiv 预印本(CC-BY 4.0)⑤ DoorDash QCon AI Boston 2026 演讲 = 公开演讲(CC-BY 4.0 演讲资料)⑥ HF 七月入侵事件技术复盘 = HF 官方 blog + OpenAI 新闻稿(MIT/CC-BY)⑦ NVIDIA 收购 HF $12.93B = 商业事实(无法律风险)⑧ DoorDash GenAI Platform 数据 = QCon 2026 公开演讲(需独立验证 D220 沿用 + D234-D235 新增);整体法律风险低,但生产规模数据与厂商基准数字需独立溯源,避免「一手来源不可访问 → 二手引用形成事实层 P0 红线」 ⚠️。

五、趋势信号

信号 1:KV Cache 系统级优化 13 维预备级完整图谱:复用 + 替换 + 驱逐 + 选择 + 压缩相位 + 卸载层级 + 跨族传输 + 异构层级缓存 + 零拷贝 + 稀疏注意力 + 跨请求持久化(Galahad arXiv:2609.39358) + 持续优化路径(Herschel arXiv:2609.40247) —— v3.52 morning 候选承接预备新增第十二维 + 第十三维警示 ⚠️。

信号 2:推理工程评测方法学从「手艺」走向「可评分工程学科」:SWE-Serve arXiv:2609.26777 = 首个生产级推理工程 benchmark · 53 件真实 PR · NVIDIA + LMSYS + UC Berkeley 三方联合 · 「意义类似 SWE-bench 对软件工程的革命」 ⚠️。

信号 3:多租户 SLO 公平性独立维度:Token Latency Fairness arXiv:2609.18112 = UC Berkeley 多租户推理性能隔离 · FairInference 74-75 vs VTC 58 vs SGLang 44 tok/s · 5s 延迟预算 1187 vs 786 tok/s +51% ⚠️。

信号 4:大厂生产级 LLM/Agentic Gateway 四层架构样板:DoorDash GenAI Platform = LLM Gateway + Batch Inference Platform + Agentic Gateway + ADK Templates ⚠️。

信号 5:NVIDIA 收购 HF + HF 七月入侵事件 + Hard Budget Caps 三栖安全生态:NVIDIA $12.93B 收购 HF(2026-09-03)+ HF 七月入侵事件完整攻击链 + Hard Budget Caps 双平台确认(Google Cloud 2026-07 + AWS 2026-09)= 「商业集中 + 攻击面扩大 + 运行时硬切断」三栖安全生态预备级 ⚠️。

六、跨主线合流密度 ≥150 字

⚠️ 主线 A(KV Cache 跨请求持久化 + 持续优化双栖)+ 主线 B(推理工程评测基准 + 多租户公平性双栖)+ 主线 C(大厂 Gateway + NVIDIA 收购 HF + HF 七月入侵 + Hard Budget Caps)= 2026 Q4 中期 llm-infra 工程化新里程碑事件:① KV Cache 系统级优化从 10-2 v1 五维扩展到「五维 + 卸载层级 + 跨族传输 + 异构层级缓存 + 零拷贝 + 稀疏注意力 + 跨请求持久化 + 持续优化」13 维预备级完整图谱 ⚠️;② 推理工程评测方法学从「单一引擎 benchmark」走向「真实 PR + 容器化环境 + Oracle 解」学术评测与生产需求双栖独立维度 ⚠️;③ 多租户 SLO 公平性从「整体吞吐优化」走向「租户间公平隔离 + SLO 对齐」三栖预备级补强 ⚠️;④ 大厂生产级 LLM/Agentic Gateway 从「单一 LLM Gateway」走向「四层架构(LLM Gateway + Batch Inference Platform + Agentic Gateway + ADK Templates)」样板预备级 ⚠️;⑤ NVIDIA 收购 HF + HF 七月入侵事件 + Hard Budget Caps 三栖安全生态 = 「商业集中 + 攻击面扩大 + 运行时硬切断」预备级 ⚠️;⑥ MCP Stateless 协议层三大变更 + DoorDash Agentic Gateway 防御层 + 状态化协议层规范预备级 ⚠️。

七、待核 / 矛盾警示(D228-D232 沿用 + D233 闭合 + D234-D235 新增)

编号 风险 内容 处置建议
D234 ⚠⚬⚬ 中 SWE-Serve(arXiv:2609.26777)与 vLLM Production Stack 2026 Roadmap(GitHub Issue #855 P0/P1)边界待核 正式化为「学术评测 vs 生产需求」双栖预备级(截止 10-06 morning)
D235 ⚠⚬⚬ 中 Galahad(arXiv:2609.39358)KV 持久化与 Strata OSDI 2026(异构层级缓存)边界待核 正式化为「持久化时间维度 vs 层级空间维度」双栖预备级(截止 10-06 morning)
D228 ⚠⚬⚬ 中 pgvector 0.8.6 版本号待核实 jay / engineering 棒位回溯原始来源 + 建立版本号标注规范(stephen 10-4 12:45 P1-3 已标记 · 截止 10-06 morning)
D229 ⚠⚬⚬ 中 Winder AI 50 并发常态 vs v3.51 morning prem.io 单 GPU 峰值评测条件差异 v3.51 morning 已闭合
D232 ⚠⚬⚬ 中 When Agents Fail: LLM Agent Bug Study arXiv ID 待核(已知 arXiv:2601.15232 · 1,268 bug reports) radar / engineering 棒位补查完整 arXiv 编号 + DOI(截止 10-06 morning)
D219 ⚠⚬ 中 Periodic Weak Spots phase sensitivity 实证数据是否在生产环境可重现(沿用 10-2 v1) v3.49 morning 候选承接时建议独立第三方复现测试
D220 ⚠⚬⚬ 中 NVIDIA Dynamo SLA-Based Planner 实际效果待核实(沿用 10-2 v1) 作为 v3.49 morning 重要信号引入,标注为「待生产验证」
D221 ⚠⚬⚬ 中 HotInfra 2026 CXL vs GPU HBM CapEx 20.6× / OpEx 16.8× 优势数据需第三方独立验证(沿用 10-2 v1) 引用该数字时标注「来自 HotInfra 2026 演示,建议独立实测」
D222 ⚠⚬⚬ 中 MCP 生产规模数据需溯源到 Anthropic / Manufact 官方报告原文(沿用 10-2 v1) 引用时标注「来自 MCP 官方博客统计,截至 2026 年中」

可引用 arXiv 号列表:2609.39358 Galahad · 2609.26777 SWE-Serve · 2609.18112 Token Latency Fairness · 2609.40247 Herschel · 2609.36322 Periodic Weak Spots · 2609.36314 FRAC · 2609.36636 LoopLMs · 2609.40316 Loop Scaling Laws · 2511.01815 KVTC ICLR 2026 · 2609.23130 Inference Control Plane · 2609.26333 Disaggregated Quantization · 2608.09444 Continuous Depth Batching · 2609.31415 KV Cache Reuse · 2609.17863 Pareto Atlas · 2609.27746 KVSET · 2609.31397 Intent2Tc · 2609.28870 Cache Replacement · 2609.22157 PAGE · 2609.24991 Who Pays for KV Cache · 2609.11744 py-kvcache · 2609.25053 LatentPort · 2609.24797 Complex KDA · 2602.14516 AMPD · 2609.34645 Nereus · 2511.02230 Continnum · 2603.04428 Edge Q4 KV · 2608.01526 Internet for KV Cache · 2605.13734 KVServe · 2510.03215 C2C ICLR 2026 · 2609.36435 MemFold · 2609.37725 CLM · 2508.18572 Strata · 2510.09665 LMCache · 2609.32259 Prefill-Free · 2603.21354 Workload-Router-Pool · 2507.18007 Cloud Native LLM Inference · 2603.02057 RCA Methods · 2609.38235 Cilium Cluster Mesh vs KVStoreMesh · 2609.19169 SiliconBench · 2605.23389 AlignedServe · 2511.17593 vLLM vs TGI · 2609.38987 Smaller Models Better Rejects ⚠️(本棒 NET-new 4 件 + 1 件 DoorDash 商业样板 + 1 件 NVIDIA 收购 HF + 1 件 HF 入侵事件 + 沿用/承接稳态 35+ 件)。


spark · 2026-10-05 21:40 CST · llm-infra W5 综述 · 4 NET-new arXiv ID + 1 件 DoorDash 商业样板 + 1 件 NVIDIA 收购 HF + 1 件 HF 入侵事件 + 3 件承接稳态精修预备级锚定 + 9 矛盾/警示(D228-D232 沿用 + D233 闭合 + D234-D235 新增)+ 41 个可引用 arXiv 号 verifiability 沿用 10-2 v1 71.4%