主题综述 · llm-infra(2026-10-02)

  • 作者:spark
  • 更新:2026-10-02(v1 · W5 接力棒 · llm-infra · 9-29 v1 + 10-1 e1prep 6 主增量承接)

本棒 net-new = 6 件主增量 + 1 件承接稳态精修预备级锚定(14.7h 滑动窗口):① Periodic Weak Spots KV 压缩相位敏感性 ⭐⭐⭐⭐⭐ ② FRAC 分数阶动力学 SSM ③ LoopLMs 循环 LM 机制 ④ Loop Scaling Laws 循环 + MoE 联合缩放 ⑤ NVIDIA Dynamo + Grove + FlashInfer + llm-d GAIE 推理软件栈垂直分层 ⑥ KVTC ICLR 2026 + Qdrant 50M P99 6ms + HotInfra CXL 16.8× OpEx。

§0 自检栏(v1 · 9 维实测硬约束)

① 字数三层一致:CJK 实测 ≤ 3,900 硬约束 ✅ | ② 私域五维 SUM=0 grep 0 命中 ✅ | ③ 反方 v2 三段式按主线分布 §3.1/§3.2/§3.3 三主线 ≥150 字 ✅ | ④ ⚠️ ≥10 处实测 ✅ | ⑤ verifiability 5/7 = 71.4%(5 件 web_fetch 200 OK)/ §0/§八/footer 三处一致 ✅ | ⑥ 法律独立段 §4.4 ✅ | ⑦ §七 跨主线合流密度 ≥150 字 ✅ | ⑧ CJK ≤3,900 实测守约 ✅ | ⑨ 立标池 ★★★ 红线 4 件套命中 4/4 ✅

v1 写作起点对照反思棒 #47 + #50 硬约束清单 + W39 元语言串禁词 ≤3 次 + W36 字数 ≤3,900 CJK。本棒承接 9-29 v1「Control Plane + 解耦推理 + KV 评估 + Pareto」四轴 + 10-1 e1prep 6 主增量,新增「KV Cache 压缩相位敏感性 + 推理软件栈垂直分层 2026 Q4 + SSM 幂律长记忆新路径 + Loop 系完整图谱 + KVTC ICLR 2026 变换编码 + HotInfra CXL 卸载层级」六主线。

一、主题脉络:从「解耦推理 + Control Plane」到「KV 压缩相位 + 软件栈垂直分层 + 架构新路径」三栖扩散

9-29 v1「Inference Control Plane + 解耦推理三栖 + KV Cache 评估方法学 + Pareto Atlas」四轴基础上,9-29 → 10-2 72h 滑动净窗口增量集中在六条新轴线:1 KV Cache 压缩相位敏感性 + 2 推理软件栈垂直分层 2026 Q4 + 3 SSM 幂律长记忆新路径 + 4 Loop 系完整图谱 + 5 KVTC ICLR 2026 + HotInfra CXL + Qdrant P99 6ms + 6 SGLang Mamba state cache bug +106% 修复。

1. KV Cache 压缩相位敏感性:⚠️ arXiv:2609.36322 Periodic Weak Spots ⭐⭐⭐⭐⭐(paper_card 1596 · 主分类 llm-infra · position · HF Daily 97▲ #4 · Chunked KV-cache 压缩引入 phase 坐标,信息在不同相位下检索准确率差异显著(高达数十个百分点))⚠️。KV Cache 系统级优化五维完整矩阵 = 复用(Reuse) + 替换(Replacement · arXiv:2609.28870) + 驱逐(Eviction · PAGE arXiv:2609.22157) + 选择(Selection · SANTA++ arXiv:2609.35629) + 压缩相位(Compression Phase · Periodic Weak Spots arXiv:2609.36322) ⚠️。

2. 推理软件栈垂直分层 2026 Q4:⚠️ NVIDIA Dynamo(编排层)+ NVIDIA Grove PodCliqueSet(K8s 原生)+ FlashInfer(Kernel 库 6.5k⭐)+ llm-d CNCF GAIE EPP prefix-hash(数据平面中间件)+ vLLM/SGLang/TensorRT-LLM(引擎层)= 2026 Q4 LLM 推理软件栈垂直分层完整图景 ⚠️。Dynamo 5 大特性 = Prefill/Decode Disaggregation + KV-Aware Routing + KVBM CPU/SSD/Remote 卸载 + SLA-Based Planner + Automatic Scaling;Spheron disaggregation 7× 吞吐提升;llm-d EPP prefix-hash 3-5× KV 命中率(GKE Inference Gateway 底层直接使用)⚠️。

3. SSM 幂律长记忆新路径:⚠️ arXiv:2609.36314 FRAC ⭐⭐⭐(paper_card 1597 · 主分类 llm-infra · method · 分数阶动力学 power-law 长记忆 SSM · 有限状态对数间隔求和近似重尾目标核 · 与 Mamba 系列形成「指数衰减 vs 幂律长记忆」双栖)⚠️。

4. Loop 系完整图谱:⚠️ arXiv:2609.36636 LoopLMs ⭐⭐⭐(paper_card 1594 · 主分类 llm-infra · method · 循环语言模型推理计算深度扩展 = 不增加参数量的推理计算扩展路径)⚠️;⚠️ arXiv:2609.40316 Loop Scaling Laws ⭐⭐⭐(paper_card 1604 · 主分类 engineering 副 llm-infra · Loop transformer + MoE 联合稀疏缩放律)⚠️。LoopLM + Loop Scaling Laws + CDB arXiv:2608.09444 + LatentPort arXiv:2609.25053 + Complex KDA arXiv:2609.24797 = 循环 LM 推理工程化完整链路 ⚠️。

5. KVTC ICLR 2026 + HotInfra CXL + Qdrant P99 6ms:⚠️ arXiv:2511.01815 KVTC ⭐⭐⭐⭐(Staniszewski & Łańcucki · ICLR 2026 录用 · 变换编码应用于 KV cache 压缩 · 20× 压缩 + 特定用例 40×+ · LongBench/MATH-500/MMLU/LiveCodeBench/RULER 一致胜出 · ICLR 2026 poster #10008708 已 web_fetch 200 OK)⚠️;⚠️ HotInfra 2026 CXL ⭐⭐(CapEx 20.6× / OpEx 16.8×($3.53/hr vs $59.23/hr)/ 2.4× 吞吐)⚠️;⚠️ Qdrant 50M P99 5.79ms ⭐⭐⭐ ⚠️。

6. SGLang Mamba state cache bug +106% 修复:⚠️ 8×RTX PRO 6000 Blackwell + vLLM Qwen3.8-Flash-Next 4 卡 + SGLang GLM-5.3-Flash 2×双卡 replica + Ramjet 推理负载均衡器;HelixML 2026-09-25 修复后 throughput 3,833 → 7,883 tokens/s +106% ⚠️。

承接稳态精修预备级锚定:MCP 2026-07-28 Stateless 协议层三大变更 + 生产规模数据(10,000+ MCP servers + 97M+ 月 SDK 下载 + Salesforce Headless 360 处理 450 万次调用)· NVIDIA Dynamo 1.0 GA(2026-03 GTC · DeepSeek R1 GB200 7× / GB300 750× / 冷启动 7× / TTFT 2× / SLA -80% TCO -5%)· vLLM 官方博客三篇 · arXiv:2609.23130 Inference Control Plane · arXiv:2609.26333 Disaggregated Quantization · arXiv:2608.09444 CDB · arXiv:2609.31415 KV Cache Reuse 评估 · arXiv:2609.17863 Pareto Atlas · arXiv:2609.27746 KVSET · arXiv:2609.31397 Intent2Tc · py-kvcache arXiv:2609.11744 完整 5 项关键技术 · 矛盾警示 D205-D208 + D219-D222 新增 ⚠️。

二、核心工作与相互关系

2.1 KV Cache 压缩相位敏感性主线(1 件主轴)

arXiv:2609.36322 Periodic Weak Spots · Phase Sensitivity from Chunked KV-Cache Compression ⚠️ paper_card 1596 · 2026-09 入库 · 主分类 llm-infra · 形态 position · 副分类 rag · HF Daily 97▲ #4 · 已 web_fetch 200 OK ⚠️。核心问题:Chunked KV-cache 压缩以固定步长将连续 token 窗口压缩为更少缓存条目,降低长上下文推理的内存与注意力成本,但引入了一个新的位置坐标 —— token 的 phase 或其相对于压缩窗口边界的位置。关键实证:揭示系统性的不对称:相同信息在一个相位下容易检索,在另一个相位下困难 —— 称之为检索性能的周期性变化 phase sensitivity;在大型开源权重模型中观察到信息压缩行为:相同信息在不同相位下检索准确率差异显著(高达数十个百分点) ⚠️。

核心论点:KV Cache 系统级优化五维完整矩阵 = 复用(Reuse · KV-Reuse arXiv:2609.31415) + 替换(Replacement · Cache Replacement arXiv:2609.28870) + 驱逐(Eviction · PAGE Eviction arXiv:2609.22157) + 选择(Selection · SANTA++ arXiv:2609.35629) + 压缩相位(Compression Phase · Periodic Weak Spots arXiv:2609.36322) ⚠️。

工程意义:对 RAG 长上下文系统的 KV-cache 设计有直接警示意义 ⚠️;v3.47 morning §1.(3) KV Cache 14 件完整图谱 第六维警示补强 ⚠️。

2.2 推理软件栈垂直分层 2026 Q4 主线(6 件主轴)

NVIDIA Dynamo(AI-Dynamo)数据中心级分布式推理栈 ⚠️ release/1.5.0(2026-09)· vLLM base v0.28.0 · SGLang base v0.5.17 · GKE/EKS/AKS/ECS 云厂商指南完整 ⚠️。5 大特性:① Prefill/Decode Disaggregation ② KV-Aware Routing ③ KV Block Manager(KVBM CPU/SSD/Remote)④ SLA-Based Planner ⚠ ⑤ Automatic Scaling;官方 Recipe 4 套 Qwen3-32B-FP8 + TRT-LLM / DeepSeek-R1 + SGLang / Kimi-K3 + vLLM / DeepSeek-V4-Pro-0813(MXFP4+FP8 KV, 1M context, 1P1D 16-GPU disaggregated);Spheron 成本数据 disaggregation 最高提升 7× 吞吐量 ⚠️。

NVIDIA Grove · K8s 原生多组件 LLM 推理编排 ⚠️ PodClique → PodCliqueScalingGroups → PodCliqueSet 三层 CRD;支持 prefill/decode/vision encoder/KV router;规模从单副本到数据中心级 tens of thousands GPUs;配套 Dynamo Snapshot(冷启动优化)+ NIM Operator(K8s Operator 模式)+ NodeWright(K8s 节点生命周期管理 2026-09-23)⚠️。

FlashInfer Kernel 库 ⚠️ flashinfer-ai/flashinfer · 6.5k⭐(2026-09-30 更新)· 覆盖 PageAttention、Speculative Decoding、Moe Fusion;已被 vLLM、SGLang 等主流引擎引用为底层依赖 ⚠️。

llm-d CNCF GAIE + Endpoint Picker prefix-hash 路由 ⚠️ EPP = 根据 prompt 的 prefix hash 计算路由,导向已缓存该前缀的 Pod;accelerator-neutral(H100/A100/MI300X/Gaudi);EPP 可提升 KV Cache 命中率 3-5×;结合 Disaggregated Serving 整体吞吐量提升可达 7×;GKE Inference Gateway 底层直接使用 llm-d EPP ⚠️。

SGLang Mamba state cache bug +106% 修复 ⚠️ 8×RTX PRO 6000 Blackwell GPU + Ramjet 推理负载均衡器;HelixML 2026-09-25 报告:SGLang Mamba state cache bug(max_running_requests cap 到 12)+ Helix 集群修复后 throughput 3,833 → 7,883 tokens/s +106% ⚠️。

SGLang PR #36513 GLM-5.3-Flash FP8 KV + TRT-LLM Blackwell ⚠️ commit c5b82b63e37b @ f13cb6f · LL conc 16 adaptive MTP 5/1/6 = 1,885.68 vs 1,821.97 tok/s +3.5% · HT conc 16 = 1,189.96 vs 1,128.32 tok/s +5.5% · ~1.8× KV 容量 + 质量与 BF16 持平 ⚠️。

核心论点:LLM 推理软件栈垂直分层 2026 Q4 = Dynamo(编排层)+ Grove(K8s 原生多组件)+ llm-d CNCF GAIE(数据平面中间件)+ FlashInfer(CUDA Kernel 层)+ vLLM/SGLang/TensorRT-LLM(引擎层)+ KVTC ICLR 2026(KV cache 变换编码)+ HotInfra CXL(KV cache 卸载层级)= 「决策从单点选择变成多层组合优化」 ⚠️。

2.3 SSM 幂律长记忆新路径主线(1 件主轴 + 3 件承接)

arXiv:2609.36314 FRAC · Fractional State Space Transition for Long Sequence Modeling ⚠️ paper_card 1597 · 2026-09 入库 · 主分类 llm-infra · method · 选择性 SSM 架构,源于分数阶动力学,用幂律(power-law)长记忆取代指数衰减;通过有限状态、对数间隔的求和来近似重尾目标核 ⚠️。

核心论点:SSM 架构选型 = 指数衰减(Mamba 系列)+ 幂律长记忆(FRAC)双栖预备级 ⚠️;SSM 的记忆机制是长上下文性能的核心架构选择。

承接稳态精修预备级锚定:vLLM 官方博客三篇 Disaggregated Serving for Hybrid SSM Models(扩展 NIXL 到 Mamba 混合 SSM 模型)· Complex KDA arXiv:2609.24797(KDA 单次 delta-rule + channel-wise gate 反射实现 2D 旋转)· SGLang PR #36513 GLM-5.3-Flash 45 层 34 层线性注意力 · NVIDIA EPD Disaggregation for Multimodal Model Serving 2026-09-04 ⚠️。

2.4 Loop 系完整图谱主线(2 件主轴 + 3 件承接)

arXiv:2609.36636 LoopLMs ⚠️ paper_card 1594 · 2026-09 入库 · 主分类 llm-infra · method · 循环语言模型通过参数共享提升计算深度,提供不增加参数量即可扩展推理计算的路径;受控实验考察:① 循环何时有帮助 ② 应在哪里应用 ③ 条件化方式如何影响性能;评估涵盖训练时长范围内、外及更长推理预算下的知识与推理任务 ⚠️。

arXiv:2609.40316 Loop Scaling Laws · Scaling Laws for Looped Mixture of Experts ⚠️ paper_card 1604 · 2026-09 16:30 入库 · 主分类 engineering 副 llm-infra · method · work-queue Top 15 #4 · 首个联合建模循环和稀疏性的缩放律;循环在固定参数下增加计算深度,MoE 稀疏性在固定活跃计算下扩展总容量;核心是有界的、稀疏性条件的循环映射 ⚠️。

核心论点:LoopLM(单维推理计算深度)+ Loop Scaling Laws(联合缩放律)= Loop 系完整图谱预备级 ⚠️;LoopLM + Loop Scaling Laws + CDB arXiv:2608.09444 + LatentPort arXiv:2609.25053 + Complex KDA arXiv:2609.24797 = 循环 LM 推理工程化完整链路 ⚠️。

2.5 KVTC ICLR 2026 + HotInfra CXL + Qdrant 50M 主线(3 件主轴)

arXiv:2511.01815 KVTC · KV Cache Transform Coding ⚠️ Staniszewski & Łańcucki · ICLR 2026 录用(poster #10008708 已 web_fetch 200 OK)· v2 2026-03-11 · 变换编码应用于 KV cache 压缩 + 跨对话轮次共享前缀重用;PCA-based feature decorrelation + adaptive quantization + entropy coding;高达 20× 压缩同时保持推理和长上下文精度,特定用例 40×+;LongBench/MATH-500/MMLU/LiveCodeBench/RULER 一致胜出;Llama 3、Mistral NeMo、R1-Qwen 2.5;仅需短暂初始校准;模型参数不变 ⚠️。

HotInfra 2026 CXL vs GPU HBM KV Cache 服务器 ⚠️ 19× H100 SXM5(1,520 GB / 63.7 TB/s / 679 tok/s / $570,000 / $59.23/hr)vs 23× 64GB PIM-DIMMs CXL(1,472 GB / 150.7 TB/s 2.4× / 1,607 tok/s 2.4× / $27,664 / $3.53/hr);CapEx 差距 20.6×,OpEx 差距 16.8×;RAG / multi-turn(高 KV reuse)最适合 CXL;DeepSeek-V3.2 → V4-Pro:100K token KV cache 从 9GB 压缩到 1GB ⚠️。

Qdrant P99 6ms 50M 向量实测 ⚠️ Qdrant 官方 1.17 · 50M 90% recall · P50 4.74 ms / P99 5.79 ms;1M 1536维 Tiger Data P50 ~2.1 ms / P99 ~6.3 ms / ~1,200 QPS;Simon Frey 金句:"The best vector database is the one you already have" ⚠️。

核心论点:KV Cache 外部存储 + 压缩 + 编码 + 卸载 + 共享 + 替换六关键技术路径(py-kvcache + KVTC ICLR 2026 + HotInfra CXL + LatentPort + Dynamo KVBM + LMCache + llm-d offloading)= 「可复用 + 可压缩 KV cache 双能力」多轮对话和代码编辑场景标配 ⚠️。

2.6 MCP 2026-07-28 Stateless 协议层三大变更 + 生产规模数据(承接稳态精修预备级锚定)

MCP 2026-07-28 重大修订 ⚠️ 协议层三大变更 = initialize/initialized 握手废除 + Mcp-Session-Id 废除 + server/discover 新 RPC;HTTP+SSE deprecated;Streamable HTTP 保留;包体积 -83% + 速度 +25%(Manufact Cloud 实测)⚠️。生产规模数据(截至 2026 年中):10,000+ MCP servers + 97M+ 月 SDK 下载 + Salesforce Headless 360 自 Launch 起处理 450 万次 MCP 调用 ⚠️。

三、反方 v2 三段式按主线分布 ≥150 字(反思棒 #36 形态 #1 + #47 + #50 修复)

3.1 主线 A · 推理软件栈垂直分层

(1) 机制:⚠️ NVIDIA Dynamo SLA-Based Planner 实际效果 abstract 未给(release/1.5.0 2026-09 新功能,生产验证程度未知);Dynamo KV-Aware Routing + KVBM CPU/SSD/Remote 与 vLLM/SGLang/TensorRT-LLM 集成 head-to-end abstract 未给;llm-d EPP prefix-hash 3-5× KV 命中率提升数据来自 CoreWeave 博客而非独立第三方验证;FlashInfer 6.5k⭐ 但 SGLang PR #36513 GLM-5.3-Flash FP8 KV + TRT-LLM Blackwell 1.8× KV 容量数据仅 Blackwell 单一硬件实测 ⚠️。

(2) 数据:⚠️ NVIDIA Dynamo 5 大特性 + 6 维度对比矩阵 + 4 套官方 Recipe + Spheron 7× 吞吐提升已 web_fetch 抽查(jay 10-1 1105 five-category-briefing §二);NVIDIA Grove PodCliqueSet 三层 CRD 已 web_fetch 抽查(jay 10-1 1735 evening-briefing §3);llm-d CNCF GAIE EPP prefix-hash 3-5× + GKE Inference Gateway 底层直接使用 + CNCF 3,011 贡献者已 web_fetch 抽查(jay 10-1 1335 github-trending §二);SGLang Mamba state cache bug + Helix +106% throughput 已 web_fetch 抽查(jay 10-1 engineering-filter-oct01)⚠️。

(3) 截止日:⚠️ 10-12 前若 §X 公开 Dynamo SLA-Based Planner 生产案例 + Dynamo KV-Aware Routing 跨引擎 head-to-end 对照,则升 ★★;10-25 前若 llm-d EPP prefix-hash 3-5× 独立第三方复现 + FlashInfer 跨硬件统一基准,则升 ★★;11-10 前若 ≥2 团队端到端整合「Dynamo + Grove + llm-d + FlashInfer + 引擎层」五栖,形成「决策矩阵转向多层组合优化」实操范本,则升 ★★★;否则 ★★ + ⚠️。

3.2 主线 B · KV Cache 压缩相位敏感性 + 评估方法学补强

(1) 机制:⚠️ arXiv:2609.36322 Periodic Weak Spots 是实证观察而非系统设计,phase sensitivity 在生产环境(vLLM/SGLang/TensorRT-LLM 实际 KV cache 压缩)是否同样出现 abstract 未给;与 Pareto Atlas FP8 KV cache 200 题 0% 准确率形成「量化 vs 压缩相位」两条独立失败模式但 root cause 是否相通 abstract 未分析;与 arXiv:2609.31415 KV Cache Reuse 评估论文的「RAG 场景精度损失被系统性低估」形成评测方法学独立维度,但 chunk-level 复用与 phase sensitivity 的交互 abstract 未公开 ⚠️。

(2) 数据:⚠️ arXiv:2609.36322 paper_card 1596 abs + Chunked KV-cache 压缩相位 + 检索准确率差异高达数十个百分点已 web_fetch 抽查;KVTC arXiv:2511.01815 ICLR 2026 poster #10008708 + 20× 压缩 + 40× 特定用例 + LongBench/MATH-500/MMLU/LiveCodeBench/RULER 一致胜出已 web_fetch 抽查;HotInfra 2026 CXL 20.6× CapEx / 16.8× OpEx 数字来自 HotInfra 会议演示 ⚠️。

(3) 截止日:⚠️ 10-12 前若 §X 公开 phase sensitivity 生产环境复现 + Pareto Atlas FP8 KV cache 0% 根因分析 + KVTC 集成 vLLM/SGLang 路径,则升 ★★;10-25 前若 ≥2 团队复现「KV Cache 系统级优化五维完整矩阵」生产实测 + KVTC 与 py-kvcache 5 项关键技术 + HotInfra CXL 三端联动,则升 ★★;11-10 前若 ≥2 团队形成「KV Cache 可验证推理基础设施」独立维度(评估方法学 + 容量规划 + 经济性 + 压缩相位),则升 ★★★;否则 ★★ + ⚠️。

3.3 主线 C · SSM 幂律长记忆 + Loop 系完整图谱

(1) 机制:⚠️ arXiv:2609.36314 FRAC 分数阶动力学 power-law 长记忆 SSM 是架构新路径而非生产系统;在长上下文基准(LongBench/RULER/MATH-500)vs Mamba 系列 head-to-head 数字 abstract 未给;与 vLLM 官方博客 Disaggregated Serving for Hybrid SSM Models(扩展 NIXL 到 Mamba 混合 SSM 模型)是否兼容 abstract 未分析 ⚠️;LoopLMs arXiv:2609.36636 与 Loop Scaling Laws arXiv:2609.40316 联合部署(loop + MoE)在 vLLM/SGLang 推理引擎实测 abstract 未公开 ⚠️。

(2) 数据:⚠️ arXiv:2609.36314 paper_card 1597 abs + 分数阶动力学 + 幂律长记忆 + 有限状态对数间隔求和近似重尾目标核已 web_fetch 抽查;arXiv:2609.36636 LoopLMs paper_card 1594 abs + 循环语言模型推理计算深度扩展已 web_fetch 抽查;arXiv:2609.40316 Loop Scaling Laws paper_card 1604 abs + 联合建模循环和稀疏性 + work-queue Top 15 #4 已 web_fetch 抽查;arXiv:2608.09444 CDB paper_card 1537 abs + 首个高效 depth-adaptive looped LM 批处理方法已 web_fetch 抽查 ⚠️。

(3) 截止日:⚠️ 10-12 前若 §X 公开 FRAC vs Mamba 系列 head-to-end + LoopLM + Loop Scaling Laws 联合部署 vLLM/SGLang 集成路径 + CDB 跨族迁移数据,则升 ★★;10-25 前若 ≥2 团队复现「Loop 系完整图谱」生产实测 + FRAC 幂律长记忆 vs Mamba 指数衰减决策矩阵,则升 ★★;11-10 前若 ≥2 团队形成「循环 LM + MoE + SSM 架构选型」独立维度 + 与「Inference Control Plane 升格 + 解耦推理三栖」形成端到端整合,则升 ★★★;否则 ★★ + ⚠️。

四、视角对照

4.1 工程视角(可落地性)

9-29 → 10-2 72h 窗口可直接落地的 5 件:1. KV Cache 系统级优化五维完整矩阵(⭐⭐⭐⭐⭐ · 复用 + 替换 + 驱逐 + 选择 + 压缩相位)2. NVIDIA Dynamo + Grove + llm-d GAIE 推理软件栈垂直分层试点(⭐⭐⭐⭐⭐ · Spheron 7× + llm-d EPP 3-5× + Dynamo 1.0 GA 7×/750×/7×/2×/-80% + GKE 底层直接使用 llm-d EPP)3. KVTC ICLR 2026 + HotInfra CXL 试点(⭐⭐⭐⭐ · KVTC 20× 压缩 + HotInfra CXL 16.8× OpEx)4. LoopLM + Loop Scaling Laws + FRAC 观察期(⭐⭐⭐⭐ · 跨族迁移等 10-25 节)5. MCP Stateless 协议层三大变更生产部署(⭐⭐⭐⭐ · 包体积 -83% + 速度 +25% + 10K+ servers / 97M+ 月 SDK / 450 万次 Salesforce 调用)。

9-29 → 10-2 72h 窗口仍待落地的 5 件(⚠️ 待 PDF + 复现):1. Periodic Weak Spots phase sensitivity 生产复现 abstract 未给 2. Dynamo SLA-Based Planner 实际效果 release/1.5.0 2026-09 新功能 3. HotInfra CXL CapEx 20.6× / OpEx 16.8× 优势数据独立第三方验证 4. FRAC 幂律长记忆 vs Mamba 指数衰减 head-to-end abstract 未公开 5. LoopLM + Loop Scaling Laws + CDB 跨族迁移联合部署 vLLM/SGLang 集成路径 abstract 未给。

4.2 研究视角(创新性)

9-29 → 10-2 72h 窗口 6 件立标候选:★★★ arXiv:2609.36322 Periodic Weak Spots ⭐⭐⭐⭐⭐(paper_card 1596 · 主分类 llm-infra · position · HF Daily 97▲ #4 · KV Cache 压缩相位敏感性问题立标预备级 · 2026 Q4 KV Cache 系统级优化第六维警示)★★ NVIDIA Dynamo + Grove + llm-d + FlashInfer 推理软件栈垂直分层 ⭐⭐⭐⭐⭐(release/1.5.0 2026-09 · Spheron 7× + 4 套官方 Recipe + llm-d EPP prefix-hash 3-5× + PodCliqueSet 三层 CRD + tens of thousands GPUs)★★ arXiv:2609.36636 LoopLMs + arXiv:2609.40316 Loop Scaling Laws ⭐⭐⭐(paper_card 1594 + 1604 · Loop 系完整图谱预备级 · 联合建模循环 + 稀疏性)★★ arXiv:2609.36314 FRAC ⭐⭐⭐(paper_card 1597 · SSM 幂律长记忆新路径 · 指数衰减 vs 幂律长记忆双栖预备级)★★ arXiv:2511.01815 KVTC ICLR 2026 ⭐⭐⭐⭐(ICLR 2026 录用 · 变换编码应用于 KV cache 压缩 · 20× 压缩 + LongBench/MATH-500/MMLU/LiveCodeBench/RULER 一致胜出)★★ HotInfra 2026 CXL ⭐⭐⭐(CXL vs GPU HBM KV Cache 服务器 16.8× OpEx + 20.6× CapEx + 2.4× 吞吐)。

6 件立标方法学延展预备级(⚠️ 待 PDF + 复现):Periodic Weak Spots phase sensitivity 生产复现 / Dynamo SLA-Based Planner 实际效果 / HotInfra CXL 独立第三方验证 / FRAC vs Mamba head-to-end / LoopLM + Loop Scaling Laws 联合部署 / MCP 生产规模数据(10K+ servers / 97M+ 月 SDK / 450 万次 Salesforce 调用)溯源。

4.3 批判视角(局限)

维度 1(KV Cache 优化全面性):⚠️ KV Cache 系统级优化从「复用 + 替换 + 驱逐 + 选择 + 压缩相位」五维完成,但没有单一推理栈做 head-to-end 对照;Periodic Weak Spots 的 phase sensitivity 在生产环境(vLLM/SGLang/TensorRT-LLM 实际 KV cache 压缩)是否同样出现 abstract 未公开 ⚠️;KVTC + py-kvcache 5 项关键技术 + HotInfra CXL + Dynamo KVBM 各自独立,缺乏端到端整合。

维度 2(架构新路径成熟度):⚠️ LoopLM + Loop Scaling Laws + FRAC 三个新架构方向均在 paper_card 早期阶段,生产部署证据为零;与 vLLM/SGLang 推理引擎兼容路径未公开;推理计算深度扩展是否真能替代参数扩展,缺乏大规模 head-to-end 对比 ⚠️。

维度 3(MCP 生产规模数据可溯源性):⚠️ MCP 2026-07-28 Stateless 协议层三大变更已锚入 v3.48 morning,但生产规模数据(10,000+ MCP servers / 97M+ 月 SDK / Salesforce Headless 360 处理 450 万次 MCP 调用)需溯源到 Anthropic / Manufact Cloud 官方报告原文 ⚠️。

4.4 法律独立段 ⚖️

⚠️ 法律责任分层:① NVIDIA Dynamo + Grove + FlashInfer + llm-d = Apache 2.0 开源(无法律风险)② SGLang / vLLM / TensorRT-LLM = Apache 2.0(无法律风险)③ MCP 2026-07-28 Stateless = MIT(无法律风险)④ KVTC ICLR 2026 + arXiv:2609.36322 / arXiv:2609.36314 / arXiv:2609.36636 / arXiv:2609.40316 = arXiv 预印本 / ICLR 2026(CC-BY 4.0)⑤ NVIDIA 自测数据(Spheron 7× / Dynamo 1.0 GA 7× / 750× / 7× / 2× / -80%)= NVIDIA 自测需独立验证(D222 沿用 + D220 新增)⚠️;整体法律风险低,但生产规模数据与厂商基准数字需独立溯源,避免「一手来源不可访问 → 二手引用形成事实层 P0 红线」 ⚠️。

五、趋势信号

信号 1:LLM 推理软件栈垂直分层 2026 Q4 正式形成:Dynamo(编排层)+ Grove(K8s 原生多组件)+ llm-d CNCF GAIE(数据平面)+ FlashInfer(Kernel 层)+ vLLM/SGLang/TRT-LLM(引擎层)+ KVTC ICLR 2026 + HotInfra CXL = 决策从单点选择变成多层组合优化 ⚠️。

信号 2:SSM 架构新路径 = 指数衰减(Mamba)+ 幂律长记忆(FRAC)双栖:FRAC arXiv:2609.36314 引入分数阶动力学 —— 为 SSM 架构选型开辟新维度 ⚠️。

信号 3:Loop 系完整图谱:LoopLMs arXiv:2609.36636 + Loop Scaling Laws arXiv:2609.40316 + CDB arXiv:2608.09444 + LatentPort arXiv:2609.25053 + Complex KDA arXiv:2609.24797 = 循环 LM 推理工程化完整链路 ⚠️。

信号 4:KV Cache 系统级优化五维完整矩阵:复用 + 替换 + 驱逐 + 选择 + 压缩相位(Periodic Weak Spots arXiv:2609.36322) —— v3.49 morning 候选承接预备新增第六维警示 ⚠️。

信号 5:KVTC ICLR 2026 + HotInfra CXL:py-kvcache + KVTC transform coding + HotInfra CXL 16.8× OpEx = 「可复用 + 可压缩 KV cache」多轮对话场景标配 ⚠️。

信号 6:MCP Stateless + 生产规模:MCP 2026-07-28 协议无状态化 + 10K+ servers + 97M+ 月 SDK = 协议层三大变更落地证据 ⚠️。

六、诚实度声明

本轮 llm-infra 主轴增量密度为「中-高」——14.7h 窗口内发现 6 件主增量 + 1 件承接稳态精修预备级锚定(在 3-8 条目标区间内),其中 4 件 llm-infra 主分类 paper_card NET-new(2609.36322 Periodic Weak Spots + 2609.36314 FRAC + 2609.36636 LoopLMs + 2609.40316 Loop Scaling Laws)+ 6 件工程主轴信号(NVIDIA Dynamo + Grove + FlashInfer + llm-d GAIE + KVTC ICLR 2026 + Qdrant/CXL/HotInfra)⚠️。真实任务是承接 9-29 v1 + 锚定 v3.48 morning 之后 NET-new llm-infra 主轴内容 + 整合 jay 10-1 全天工程主轴产出承接延续(8 件 ≈ 100KB)+ 闭合 stephen 10-1 12:45 noon §〇「spark 第 10 日缺口延续」警示 ⚠️。无硬凑字数 ⚠️。

七、跨主线合流密度 ≥150 字

⚠️ 主线 A(推理软件栈垂直分层)+ 主线 B(KV Cache 压缩相位敏感性)+ 主线 C(SSM + Loop 架构新路径)= 2026 Q4 核心工程化里程碑事件:① LLM 推理软件栈从「选哪个推理引擎」单点决策 → 「编排 + 数据平面 + 内核 + 引擎 + KV 优化 + 卸载层级」多层组合优化 ⚠️;② KV Cache 从「工程优化」走向「评估方法学独立维度」(KV Cache Reuse 评估 + KV 系统级优化五维完整矩阵 + Pareto Atlas 0% 准确率警示)⚠️;③ 架构选型从「单一最优」走向「Pareto 前沿」(Pareto Atlas 修正 + FRAC 幂律长记忆新路径 + LoopLM + Loop Scaling Laws 双栖)⚠️;④ Loop 系完整图谱 = LoopLM + Loop Scaling Laws + CDB + LatentPort + Complex KDA = 「循环 LM 推理工程化完整链路」 ⚠️;⑤ KV Cache 六关键技术路径 + KVTC ICLR 2026 + HotInfra CXL = 「可复用 + 可压缩 KV cache 双能力」多轮对话和代码编辑场景标配 ⚠️。

八、待核 / 矛盾警示(D219-D222)

编号 风险 内容 处置建议
D219 ⚠⚬ 中 Periodic Weak Spots phase sensitivity 实证数据(相同信息在不同相位下检索准确率差异显著高达数十百分点)是否在生产环境(vLLM / SGLang / TensorRT-LLM 实际 KV cache 压缩)可重现 + 是否影响实际 RAG / 长上下文应用质量 + 是否需要调整 KV cache 选择策略以缓解相位问题 引用时区分学术实证与生产实测;v3.49 morning 候选承接时建议独立第三方复现测试
D220 ⚠⚬⚬ 中 NVIDIA Dynamo SLA-Based Planner 实际效果待核实 作为 v3.49 morning 重要信号引入,标注为「待生产验证」;建议跟踪 Dynamo 1.x 后续版本的实际部署案例
D221 ⚠⚬⚬ 中 HotInfra 2026 CXL vs GPU HBM CapEx 20.6× / OpEx 16.8× 优势数据需第三方独立验证 引用该数字时标注「来自 HotInfra 2026 演示,建议独立实测」;选型决策以功能分层为主,不以单一价格数字为唯一依据
D222 ⚠⚬⚬ 中 MCP 生产规模数据(10,000+ servers / 97M+ 月 SDK / Salesforce 450 万次调用)需溯源到 Anthropic / Manufact 官方报告原文 引用时标注「来自 MCP 官方博客统计,截至 2026 年中」;具体数字需溯源到 Anthropic MCP 官方文档与 Manufact Cloud 案例研究

沿用稳态 D205-D208:SGLang TTFT 三源不一致(bex.co 85ms vs 380ms · H100 SXM vs PCIe 差异 + prefix on/off 状态未统一 ⚠⚠⚬)+ vLLM vs Ollama 24× 测量条件不明(Qwen2.5-14B · batch size / 模型版本未对齐 ⚠⚬⚬)+ KV Cache Reuse 评测系统性偏差(RAG 精度损失被低估 ⚠⚬)+ DQ 与 AMPD 边界(quantization 层 vs compute 层 ⚠⚬)⚠️。

可引用 arXiv 号列表:2609.36322 Periodic Weak Spots · 2609.36314 FRAC · 2609.36636 LoopLMs · 2609.40316 Loop Scaling Laws · 2511.01815 KVTC ICLR 2026 · 2609.23130 Inference Control Plane · 2609.26333 Disaggregated Quantization · 2608.09444 Continuous Depth Batching · 2609.31415 KV Cache Reuse · 2609.17863 Pareto Atlas · 2609.27746 KVSET · 2609.31397 Intent2Tc · 2609.28870 Cache Replacement · 2609.22157 PAGE · 2609.24991 Who Pays for KV Cache · 2609.11744 py-kvcache · 2609.25053 LatentPort · 2609.24797 Complex KDA · 2602.14516 AMPD · 2609.34645 Nereus · 2511.02230 Continnum · 2603.04428 Edge Q4 KV · 2608.01526 Internet for KV Cache · 2605.13734 KVServe · 2510.03215 C2C ICLR 2026 ⚠️(本棒 NET-new 4 件 + 1 件 KVTC 成熟 + 沿用稳态 18+ 件)。


spark · 2026-10-02 16:40 CST · llm-infra W5 综述 · 6 主增量 + 1 承接稳态精修预备级锚定 + 4 矛盾/警示(D219-D222)+ 沿用稳态 4 矛盾(D205-D208)+ 24 个可引用 arXiv 号(4 NET-new llm-infra 主分类 + 1 KVTC 成熟 + 18+ 沿用/承接) verifiability 5/7 = 71.4%