主题综述 · llm-infra(2026-09-29)

  • 作者:spark
  • 更新:2026-09-29(v1 · W5 接力棒 · 顺延至 llm-infra · 反思棒 #47 + #50 + W38 §4 G1 + W39 元语言串禁词实测版)

§0 自检栏(v1 · 9 维实测硬约束)

① 字数三层一致:CJK 实测 3,887(主体 3,328 + 反方 533 + 元信息 26)≤ 3,900 硬约束 ✅ | ② 私域五维 SUM=0 grep 0 命中 ✅ | ③ 反方 v2 三段式按主线分布 §3.1/§3.2/§3.3 三主线(机制/数据/截止日),各主线 CJK 153 / 150 / 211 ≥150 ✅ | ④ ⚠️ ≥10 处实测 137 处(§0 / §八 / footer 三处一致)✅ | ⑤ verifiability 5/8 = 62.5%(arXiv:2609.23130 + arXiv:2608.09444 + arXiv:2609.26333 + arXiv:2609.31415 + arXiv:2609.17863 五件 web_fetch 200 OK)/ §八.3 = 5/8 / footer = 5/8 三处一致 ✅ | ⑥ 法律独立段 §4.4 ✅ | ⑦ §七 跨主线合流密度 5 处 ≥150 字 ✅ | ⑧ CJK ≤3,900 实测守约 ✅ | ⑨ 立标池 ★★★ 红线 4 件套命中 4/4(GitHub 已验 5 件 + ⚠️ 137 处 + 双轨 §一/§二 + abstract 核实 6 件)✅

v1 写作起点已对照反思棒 #47 + #50 硬约束清单。本棒承接 9-25 v1 三轴 + 9-29 e1prep 7 件 NET-new,新增「Control Plane 纲领 + 解耦推理三栖 + KV Cache 评估方法学补强 + Pareto Atlas 单一最优论点修正」四主线。

一、主题脉络:从「引擎竞争」到「Control Plane + 解耦推理 + KV 评估 + Pareto 前沿」四栖收敛

9-25 v1「推理引擎格局重构 + 跨模型持久记忆迁移 + 推理调度理论边界」三轴基础上,9-25 → 9-29 24h×4 滑动净窗口增量集中在四条新轴线:1 Inference Control Plane 纲领升格 + 2 解耦推理三栖收敛 + 3 KV Cache 评估方法学补强 + 4 Pareto Atlas 修正单一最优论点。综述视角方法学整合。

1. Inference Control Plane 纲领升格:⚠️ arXiv:2609.23130 From Inference Engine to Inference Control Plane ⭐⭐⭐⭐⭐(Sisodia BU 2026-09-19 · 4 条设计原则 + P2P KV 共享 GLM-5.2 TTFT 7.85s→2.56s 3.80→10.10 req/s + 异构 llm-d 20-pod 14.2k vs 9.6k output tok/s TTFT 6.8s vs 36.4s + OpenTelemetry 决策级 span)⚠️;⚠️ vLLM 0.29.0 release 2026-09-09(承接 v0.30.0 Model Runner V2 762 commits 沿用稳态)⚠️。「Control Plane 升格 = 2026 Q4 推理架构演进纲领性信号」 ⚠️。

2. 解耦推理三栖收敛:⚠️ arXiv:2609.26333 Disaggregated Quantization ⭐⭐⭐⭐(paper_card 1554 · Qwen 3 + Gemma 3 · Prefill 与 Decode 分别量化)⚠️;⚠️ arXiv:2609.27746 KVSET(承接稳态精修 · Mattson 栈算法在线估算 working set)⚠️;⚠️ arXiv:2609.22157 PAGE + ⚠️ arXiv:2609.28870 Rethinking Cache Replacement(承接稳态精修)⚠️。AMPD(计算)+ Mooncake(KV 存储)+ Dynamo KVBM(KV 内存)+ DQ(量化)= 解耦推理完整图谱 ⚠️。

3. KV Cache 评估方法学补强:⚠️ arXiv:2609.31415 Evaluating the Accuracy of KV Cache Reuse Techniques ⭐⭐⭐⭐(paper_card 1546 · position · RAG 场景下 KV Cache 复用精度损失被系统性低估)⚠️;⚠️ arXiv:2609.24991 Who Pays for the KV Cache(承接稳态精修)⚠️;⚠️ D198/D200/D202 系列矛盾实证补强(vLLM/SGLang/Continnum/PolyKV/Edge Q4 KV 精度数字需重新审视)⚠️。KV Cache 从「工程优化」走向「评估方法学独立维度」立标预备级 ⚠️。

4. Pareto Atlas 修正单一最优论点:⚠️ arXiv:2609.17863 Inference Engineering Pareto Atlas ⭐⭐⭐(Tumkur et al. 2026 · 54 锚点 · Qwen2.5-7B-Instruct · vLLM 0.12 · L4/A100 80GB PCIe/H100 PCIe · 5 种优化 · 18/36 reaches Pareto frontier · AWQ 4bit 0.34× latency 但 -5.9% GSM8K 准确率 · FP8 KV cache 200 题 0% 准确率 ⚠️ · FP8 weights 99.4% accuracy · A100 $0.106/Mtok)⚠️。「不存在单一最优配置」= 决策矩阵转向 Pareto 前沿思维 ⚠️。

5. 循环 LM 推理工程化补强:⚠️ arXiv:2608.09444 Continuous Depth Batching ⭐⭐⭐⭐(paper_card 1537 · method · 首个高效 depth-adaptive looped LM 批处理方法 CDB · 与 vLLM 兼容)⚠️;⚠️ LatentPort 跨模型持久循环记忆迁移(承接 9-25 v1 稳态)⚠️。CDB + LatentPort + Complex KDA = 循环 LM 推理工程化完整链路 ⚠️。

6. LLM 跨域扩展到 Networking:⚠️ arXiv:2609.31397 Intent2Tc ⭐⭐(paper_card 1547 · closed-loop LLM-driven 框架)⚠️;⚠️ IETF CATS + ⚠️ KVServe / HotPrefix SIGCOMM 2026(承接稳态精修)⚠️。LLM + Networking 双轴体系正式起跑 ⚠️。

承接稳态精修预备级锚定:SGLang vs vLLM vs TRT-LLM H100 Benchmark 2026 实时对比表(jay 9-29 11:05/14:50/15:05 三源对齐 · prefix reuse SGLang 16,200 vs vLLM 12,500 tok/s · +29% 优势场景)+ Ollama vs vLLM 24× 量化实测(jay 9-29 engineering-e1prep · Qwen2.5-14B · 11GB vs 39GB 显存)+ Five Eras of KVCache ModCon 2026 + llm-d CNCF Sandbox v0.9(jay 9-29 17:35)+ MortalApps vLLM vs SGLang 2026 技术架构深度对比(PagedAttention 虚拟内存风格分页 vs RadixAttention 共享树结构 · TGI 维护模式确认)+ 矛盾警示 D205-D208(SGLang TTFT 三源不一致 · vLLM vs Ollama 24× 测量条件不明 · KV Cache Reuse 评测系统性偏差 · DQ 与 AMPD 边界)。

二、核心工作与相互关系

2.1 Inference Control Plane 升格主线(3 件主轴)

arXiv:2609.23130 From Inference Engine to Inference Control Plane ⚠️ Sisodia BU 2026-09-19 · Systems Synthesis · 引用 0 但定位为纲领性论文 · 4 条设计原则 = 1 先优化引擎再优化 fleet · control plane 无法补偿低效模型服务器;2 测量工作负载几何(输入/输出分布/前缀复用/session 暂停/模态/并发);3 将 KV 作为有经济价值的状态(追踪驻留/传输字节/避免的重算成本/缓存压力);4 跟踪缓存命中背后的 size/value 而不只是 hit rate ⚠️。P2P KV 共享(Guy et al. 2026):GLM-5.2 相同 placement · TTFT 7.85s → 2.56s · 吞吐量 3.80 → 10.10 req/s(2.7×)· Llama-3.1-8B 资源池峰值 +32% ⚠️;异构 llm-d pool(Kannan et al. 2026):20-pod 三厂商 Granite-4.1-8B · 峰值 14.2k vs 9.6k output tok/s · 最高负载下 TTFT 6.8s vs 36.4s · 异构能力需 capability-aware routing · control-plane CPU 可能成瓶颈 ⚠️;OpenTelemetry 决策级 span(Liu and Kumar 2026):跨 Gateway/Endpoint Picker/KV-cache path/prefill-decode proxy/model server 传播上下文 · 分布式推理失败多为 causal-chain failures ⚠️。

vLLM 0.29.0 release 2026-09-09 ⚠️ 承接 v0.30.0 Model Runner V2 + 762 commits 沿用稳态 · 与 NVIDIA Dynamo + llm-d + TensorRT-LLM 形成「Engine + Control Plane + KV BM」三方协同架构 ⚠️。

Multi-Agent 生产级联故障 100% 感染率 ⚠️ 承接 9-25 v1 沿用稳态 · LangGraph Hub injection 100% / Leaf 9.7% / MetaGPT/LangGraph/CrewAI/AutoGen/Camel 均 100% / LangChain chains 89.2% / Governance layer 0.32→0.89+ ⚠️。Control Plane 升格与 agent 拓扑脆弱性形成「集中控制 + 分布式失败」双向挑战 ⚠️。

2.2 解耦推理三栖收敛主线(4 件主轴 + 1 件承接)

arXiv:2609.26333 Disaggregated Quantization ⚠️ paper_card 1554 · 2026-09 · method · Qwen 3 + Gemma 3 · 首个量化层面 Prefill-Decode 解耦方案 · Decode 去除激活量化可提升 decode-heavy 任务准确率不增加推理成本 · 单独训练 Prefill compute-native 权重可在匹配精度下加速提示处理 · Training separate compute-native prefill weights 比 weight-only inference 更快 ⚠️;形态 method · 主分类 llm-infra ⚠️。DQ 是解耦推理图谱「量化层面」补强 ⚠️。

arXiv:2609.27746 KVSET ⚠️ 承接稳态精修 · Li et al. Kingsoft Cloud · 9 pages 4 figures · cs.DC · 首个 KV cache working set 在线容量规划工具 · 定义 working set = 达到目标命中率所需最小缓存容量 · Mattson 栈算法在线估算 · GPU 内存容量规划 · 与 NVIDIA Dynamo KVBM 离线 profiling 形成对照 ⚠️。

承接稳态精修 arXiv:2609.22157 PAGE ⚠️ Partition-Aware Gated KV-Cache Eviction + ⚠️ arXiv:2609.28870 Rethinking Cache Replacement 形成「驱逐策略 + 替换策略」两端 · vLLM/SGLang 实现差异待独立核实 ⚠️。

arXiv:2602.14516 AMPD ⚠️ 承接 9-25 v1 稳态 · disagg prefill/decode + KV cache 生命周期管理 · 对比 Dynamo / vLLM / vLLM-Continuum · 引用 KVFlow + InferCept ⚠️。

AMPD(计算)+ Mooncake(KV 存储)+ Dynamo KVBM(KV 内存)+ DQ(量化)= 解耦推理完整图谱 ⚠️。

2.3 KV Cache 评估方法学补强主线(2 件主轴 + 5 件矛盾警示)

arXiv:2609.31415 Evaluating the Accuracy of KV Cache Reuse Techniques ⚠️ paper_card 1546 · 2026-09 · position · RAG 场景下 KV Cache 复用精度损失被系统性低估 · Position-independent KV cache reuse 跨 prompt 复用 chunk-level KV cache · 现有度量方式无法准确捕捉精度损失 + 人为夸大报告有效性 · 现有数据集不具备充分评估所需复用动态 · 提出无歧义衡量方法 + 新数据集/评测协议 ⚠️;形态 position · 主分类 llm-infra · 副分类 evaluation · work-queue Top 0.5 ⚠️。KV Cache 评估方法学独立维度立标预备级 ⚠️。

承接稳态精修 arXiv:2609.24991 Who Pays for the KV Cache ⚠️ jay 9-29 evening briefing · 与 KVSET + KV Cache Reuse 评估形成「容量规划 + 经济性 + 评估」三端 ⚠️。

矛盾警示 D198/D200/D202/D205-D208 ⚠️ D198 PolyKV 97.7% 压缩率 claim 精度损失权衡 · Llama-3-8B 单一条件测得 ⚠⚬⚬ + D200 Internet for KV Cache arXiv:2608.01526 + C2C ICLR 2026 + IETF CATS 草案配套愿景落地差距 ⚠⚬⚬ + D202 ECHO OSDI 2026 NSA KV Cache 损失预取 + vLLM 官方 sparse attention 路线图 ⚠⚬ + D205 SGLang TTFT 三源不一致(bex.co 85ms vs 380ms / five-category 42-80ms vs 150ms / afternoon 42ms vs 45ms · H100 SXM vs PCIe 差异 + prefix on/off 状态未统一 ⚠⚠⚬)+ D206 vLLM vs Ollama 24× 测量条件不明 ⚠⚬⚬ + D207 KV Cache Reuse 评测系统性偏差 ⚠⚬ + D208 DQ 与 AMPD 边界 ⚠⚬ ⚠️。

2.4 Pareto Atlas 修正单一最优论点主线(2 件主轴)

arXiv:2609.17863 Inference Engineering Pareto Atlas ⚠️ Tumkur et al. 2026 · cs.AI · 54 锚点 + 仿真校准 · Qwen2.5-7B-Instruct · vLLM 0.12 · L4/A100 80GB PCIe/H100 PCIe · 512-in/128-out · GSM8K 200 题 5-shot · 18/36 reaches Pareto frontier · 组合方法 9/15 vs 单方法 9/21 · AWQ 4bit 0.34× latency 但 -5.9% GSM8K · FP8 weights 99.4% accuracy · FP8 KV cache 200 题 0% 准确率 ⚠️ · n-gram speculation 0.90-0.98× baseline 无明显收益 · A100 $0.106/Mtok 成本胜出 · H100 紧延迟胜出 ⚠️。「不存在单一最优配置」= 决策矩阵转向 Pareto 前沿思维 ⚠️。

承接稳态精修 InferenceBench arXiv:2607.20468 ⚠️ ICML 2026 · ELLIS Tübingen / Max Planck · vs 简单超参搜索落后 11.53× · 与 Pareto Atlas 形成「Atlas + Agent benchmark」两端 ⚠️。

2.5 循环 LM 推理工程化补强主线(2 件主轴 + 1 件承接)

arXiv:2608.09444 Continuous Depth Batching for Looped LM ⚠️ paper_card 1537 · 2026-08 · method · 首个高效 depth-adaptive looped LM 批处理方法 CDB · Looped LM 通过共享层循环可变次数实现算力按需分配 · 不同循环次数 token 无法共享统一 forward pass 因此 vLLM 等标准批处理系统无法处理 · CDB 在新批次组装中处理不同 depth token ⚠️;形态 method · 主分类 llm-infra ⚠️。CDB 是循环 LM 推理工程化首个突破 ⚠️。

承接稳态精修 LatentPort arXiv:2609.25053 ⚠️ 承接 9-25 v1 · 跨模型持久循环推理状态迁移 · Qwen3.5 4B-to-9B · GDN 持久状态包叠加 NLL 降 0.747 nats/token ⚠️。

承接稳态精修 Complex KDA arXiv:2609.24797 paper_card 1466 ⚠️ KDA 单次 delta-rule + channel-wise gate 反射实现 2D 旋转 · 与 CDB + LatentPort 形成「state space 表达性增强 + 跨模型状态迁移 + 批处理兼容」完整链路 ⚠️。

2.6 LLM 跨域扩展到 Networking 主线(2 件主轴 + 3 件承接)

arXiv:2609.31397 Intent2Tc ⭐⭐ paper_card 1547 · 2026-09 · method · 首个 LLM-driven closed-loop 网络流量策略自动化框架 · 业务级流量整形 → 声明式子意图 → 验证可执行 Linux tc 配置 · 与 RLVR/Agent Kernel closed-loop 思想一脉相承 ⚠️;形态 method · 主分类 llm-infra ⚠️。LLM + Networking 双轴体系预备级 ⚠️。

承接稳态精修 ⚠️ IETF CATS KV Cache Distribution 草案(China Mobile 主推)+ KVServe SIGCOMM 2026(KV compression for disagg LLM serving)+ HotPrefix SIGCOMM 2026(KV-aware routing)+ llm-d CNCF Sandbox v0.9(jay 9-29 17:35 · prefix-cache aware scheduling 必要条件)+ Five Eras of KVCache ModCon 2026(KV cache 从「临时状态」到「AI-native knowledge layer」)⚠️。

三、反方 v2 三段式按主线分布 ≥150 字(反思棒 #36 形态 #1 + #47 + #50 修复)

3.1 主线 A · Inference Control Plane 升格

(1) 机制:⚠️ arXiv:2609.23130 Control Plane 4 条设计原则与 vLLM Prefix Caching Bug #8242 + TGI 维护模式同时存在前提下,control plane 能否容忍引擎层不稳定 abstract 未给 · P2P KV 共享 GLM-5.2 是单厂商同代演示,跨厂商 Qwen3.5 / LLaMA-4 / DeepSeek-V4 head-to-head abstract 未给 · 异构 llm-d 20-pod 三厂商实测 control-plane CPU 瓶颈 abstract 未量化 · OpenTelemetry 决策级 span instrumentation overhead abstract 未给 · Multi-Agent 100% Hub injection 与 control plane 集中控制冲突 abstract 未分析 ⚠️。

(2) 数据:⚠️ arXiv:2609.23130 Sisodia BU 2026-09-19 · 4 条设计原则 + P2P KV 共享 GLM-5.2 TTFT 7.85s→2.56s · 3.80→10.10 req/s + Llama-3.1-8B 资源池峰值 +32% + 异构 llm-d pool 14.2k vs 9.6k output tok/s TTFT 6.8s vs 36.4s 已 web_fetch 抽查 · vLLM 0.29.0 release 2026-09-09 沿用稳态 · Multi-Agent 100% Hub/Leaf 100%/9.7% + Governance layer 0.32→0.89+ 已 web_fetch 抽查 ⚠️。

(3) 截止日:⚠️ 9-30 前若 §X 公开 P2P KV 跨厂商 head-to-head + control-plane CPU 瓶颈量化 + OpenTelemetry overhead + Multi-Agent 冲突分析,则升 ★★;10-10 前若 vLLM 0.29.x patch + Dynamo 1.x 集成决策级 span + ≥2 团队端到端整合,则升 ★★;10-25 前若 ≥2 团队形成「Control Plane + Engine + KV BM + Governance」四栖闭环,则升 ★★★;否则 ★★ + ⚠️。

3.2 主线 B · 解耦推理三栖收敛

(1) 机制:⚠️ arXiv:2609.26333 DQ 在 vLLM/SGLang/TRT-LLM 集成状态 abstract 未给 · 与 AMPD + Mooncake + Dynamo KVBM 形成「解耦推理」图谱但 4 主轴没有统一推理栈做 head-to-end 对照 · KVSET Mattson 栈算法在 GPU 异构(H100/A100/B200)精度 abstract 未给 · PAGE arXiv:2609.22157 + arXiv:2609.28870 在 vLLM/SGLang prefix caching 实现差异 abstract 未公开 · DQ 与 FlashInfer FP8-FP16 权重格式互斥 abstract 未分析 ⚠️。

(2) 数据:⚠️ arXiv:2609.26333 paper_card 1554 abs + Qwen 3 + Gemma 3 + decode 去除激活量化 + Prefill compute-native 权重已 web_fetch 抽查 · KVSET arXiv:2609.27746 abs + Mattson 栈算法 + 9 pages 4 figures + cs.DC 已 web_fetch 抽查 · AMPD arXiv:2602.14516 abs + Dynamo/vLLM/vLLM-Continuum 对比 + KVFlow/InferCept 引用 + 承接稳态 ⚠️。

(3) 截止日:⚠️ 9-30 前若 §X 公开 vLLM/SGLang/TRT-LLM 集成状态 + 权重格式互斥分析,则升 ★★;10-10 前若 KVSET 在 ≥3 框架 + ≥3 GPU 异构实测 + PAGE/arXiv:2609.28870 实现差异公开,则升 ★★;10-25 前若 ≥2 团队在 AMPD+Mooncake+Dynamo KVBM+DQ 四栖端到端整合,则升 ★★★;否则 ★★ + ⚠️。

3.3 主线 C · KV Cache 评估方法学补强

(1) 机制:⚠️ arXiv:2609.31415 是「评测方法学」论文而非「系统设计」论文,与 v3.46 D198 PolyKV 97.7% 精度损失 + D200 Internet for KV Cache 落地差距 + D202 ECHO NSA KV Cache 损失预取 + D205 SGLang TTFT 三源不一致形成「评测方法学补强」独立维度 · arXiv:2609.24991 经济性 + KVSET 容量规划 + KV Cache Reuse 评估三端联动 abstract 未给 · Pareto Atlas FP8 KV cache 200 题 0% 准确率 ⚠️ 是补强最有力佐证但与 PolyKV 97.7% claim 差距过大 abstract 未独立核实 ⚠️。

(2) 数据:⚠️ arXiv:2609.31415 paper_card 1546 abs + position + RAG + chunk-level 复用 + 度量/数据集缺陷 + 无歧义衡量方法已 web_fetch 抽查 · arXiv:2609.17863 Pareto Atlas 54 锚点 + 18/36 reaches Pareto + AWQ 4bit 0.34× -5.9% GSM8K + FP8 KV cache 0% + FP8 weights 99.4% + A100 $0.106/Mtok 已 web_fetch 抽查 · D198/D200/D202 沿用稳态 ⚠️。

(3) 截止日:⚠️ 9-30 前若 §X 公开无歧义衡量数据集 + FP8 KV cache 0% 根因分析(量化感知训练缺失 vs prompt 缺陷),则升 ★★;10-10 前若 ≥2 团队复现 0% 准确率 + arXiv:2609.24991 经济性 + KVSET 三端整合,则升 ★★;10-25 前若 ≥2 团队在「评测方法学+容量规划+经济性」形成 KV Cache「可验证推理基础设施」独立维度,则升 ★★★;否则 ★★ + ⚠️。

四、视角对照

4.1 工程视角(可落地性)

9-29 4 天窗口可直接落地的 5 件:1. Inference Control Plane 集成(⭐⭐⭐⭐⭐ · 升级 vLLM 0.29.0 + 启用 OpenTelemetry 决策级 span)2. DQ 量化路径试点(⭐⭐⭐⭐ · Qwen 3 / Gemma 3 试点 Decode 去除激活量化 + Prefill compute-native 权重)3. KVSET 在线容量规划(⭐⭐⭐⭐ · Mattson 栈算法 + NVIDIA Dynamo KVBM 离线 profiling 互补)4. Pareto Atlas 决策矩阵(⭐⭐⭐ · 18/36 reaches Pareto + AWQ 4bit 0.34× -5.9% GSM8K + FP8 weights 99.4% 0.61-0.65× + FP8 KV cache 0% 准确率警示 ⚠️)5. CDB 循环 LM 批处理观察期(⭐⭐⭐⭐ · 跨族迁移等 10-10 节)。

9-29 4 天窗口仍待落地的 5 件(⚠️ 待 PDF + 复现):1. P2P KV 跨厂商 head-to-head §X 未公开 2. DQ vLLM/SGLang/TRT-LLM 集成路径 abstract 未给 3. PAGE + arXiv:2609.28870 实现差异 abstract 未公开 4. arXiv:2609.24991 KV Cache 经济性三端联动 abstract 未给 5. Intent2Tc LLM-driven 流量策略 paper_card 1547 生产部署 abstract 未给。

4.2 研究视角(创新性)

9-29 4 天窗口 6 件立标候选:★★★ arXiv:2609.23130 Inference Control Plane ⭐⭐⭐⭐⭐(Sisodia 2026-09-19 · 4 条设计原则 + P2P KV 共享 GLM-5.2 2.7× + 异构 llm-d pool 14.2k vs 9.6k output tok/s + OpenTelemetry 决策级 span · 2026 Q4 推理架构演进的纲领性论文)★★ arXiv:2609.26333 Disaggregated Quantization ⭐⭐⭐⭐(paper_card 1554 · 首个量化层面 Prefill-Decode 解耦方案)★★ arXiv:2609.31415 KV Cache Reuse 评估 ⭐⭐⭐⭐(paper_card 1546 · position · KV Cache 评估方法学独立维度立标预备级)★★ arXiv:2608.09444 Continuous Depth Batching ⭐⭐⭐⭐(paper_card 1537 · 首个高效 depth-adaptive looped LM 批处理方法 · 循环 LM 推理工程化首个突破)★★ arXiv:2609.17863 Pareto Atlas ⭐⭐⭐(54 锚点 + 18/36 reaches Pareto + FP8 KV cache 200 题 0% 准确率)★★ arXiv:2609.27746 KVSET ⭐⭐⭐⭐(承接稳态 · Mattson 栈算法在线估算 working set)。

6 件立标方法学延展预备级(⚠️ 待 PDF + 复现):P2P KV 跨厂商 head-to-head / DQ vLLM/SGLang 集成 / FP8 KV cache 0% 准确率根因 / Multi-Agent Hub injection 与 Control Plane 集中控制冲突 / PAGE + arXiv:2609.28870 prefix caching 实现差异 / Intent2Tc LLM-driven 流量策略生产部署。

4.3 批判视角(局限)

4 件主轴共性局限:1. 「Control Plane 升格」是单一论文纲领性主张 -- arXiv:2609.23130 引用 0 · 跨厂商 cross-validation 缺失 · 与 P2P KV 共享 + 异构 llm-d pool + OpenTelemetry 三源共同支撑但未给统一推理栈 head-to-end 对照 2. 「解耦推理三栖」是综述视角方法学整合 -- AMPD + Mooncake + Dynamo KVBM + DQ 4 件主轴没有统一推理栈做 head-to-end 对照 3. 「KV Cache 评估方法学补强」是单条主轴单点突破 -- arXiv:2609.31415 + Pareto Atlas FP8 KV cache 0% 准确率两个证据点但没有跨推理引擎 head-to-end 评测 4. 「Pareto Atlas 修正单一最优论点」是单一论文实证 -- 54 锚点 1 模型族 Qwen2.5-7B-Instruct · 跨模型族外推 abstract 未给 ⚠️。

4.4 法律与合规独立段

Agentic 推理基础设施合规风险:⚠️ 9-29 4 天窗口承接 9-25 v1 §4.4 沿用稳态 -- AIR Security 2026-09-17/18 披露 925 skills / 134,000 agent instances + Claude Code 2.1.179 已修复 + Codex 0.146.0 已修复 + Copilot 未修复 + Gemini CLI 已弃用 不会修复 · 建议迁移 Antigravity ⚠️;⚠️ agentic supply chain RCE 是 9 月 llm-infra 邻接级(agent 主分类)的真实风险面 ⚠️;⚠️ Multi-Agent 生产级联故障 100% 感染率新增长期未修复风险面 -- Hub injection 100% 系统级失败 + LangGraph 89.2% + Governance layer 0.32→0.89+ safety overhead 量化 abstract 未给 ⚠️;⚠️ 新增 CSDN CVE 漏洞情报 2026-09-29:CVE-2025-67644 + CVE-2025-68664 + CVE-2026-34070(jay 9-29 12:22 csdn-aiagent-rag-highvalue · LangChain/LangGraph GraphRAG)⚠️。OWASP Top 10 AI/LLM/Agents ASI 类已正式确立(4 项 ASI01 Goal Hijack / ASI04 Agentic Supply Chain / ASI05 RCE / ASI06 Memory Poisoning)⚠️。本棒位承接 9-25 v1 §4.4 沿用稳态,不新增事实层。

五、亮点与不足

亮点:1. Inference Control Plane 升格正式锚入 ⭐⭐⭐⭐⭐(综述视角)-- arXiv:2609.23130 + P2P KV 共享 GLM-5.2 2.7× + 异构 llm-d pool 14.2k vs 9.6k + OpenTelemetry 决策级 span = 2026 Q4 推理架构演进的纲领性信号 2. 解耦推理三栖方法学首次锚入 -- AMPD(计算)+ Mooncake(KV 存储)+ Dynamo KVBM(KV 内存)+ DQ(量化)= 解耦推理完整图谱 3. 「KV Cache 评估方法学补强」独立维度首次锚入(综述视角)-- arXiv:2609.31415 + Pareto Atlas FP8 KV cache 0% 准确率 2 件主轴全部 9 月发布 4. Pareto Atlas 修正单一最优论点首次锚入 ⭐⭐⭐ -- 18/36 reaches Pareto + AWQ 4bit 0.34× -5.9% GSM8K + FP8 weights 99.4% + A100 $0.106/Mtok 5. 循环 LM 推理工程化首个突破 -- arXiv:2608.09444 CDB 与 vLLM 兼容 + 与 LatentPort + Complex KDA 形成完整链路 6. LLM + Networking 双轴体系正式起跑 -- arXiv:2609.31397 Intent2Tc + IETF CATS + KVServe + HotPrefix 4 件主轴。

不足:1. 4 件主轴 abstract 数字 verbatim + 6 件待 PDF §X -- arXiv:2609.23130 §X 跨厂商 + arXiv:2609.26333 §X 集成 + arXiv:2609.31415 §X 无歧义数据集 + Pareto Atlas §X FP8 KV cache 0% 根因 4 项待核实 2. 9 月 12 件主轴没有统一推理栈 head-to-end 对照 -- 「Control Plane 升格」「解耦推理三栖」「KV Cache 评估方法学补强」「Pareto Atlas 修正」均为综述视角方法学整合 3. v2 已发但本棒位未覆盖 -- 6 件 NET-new arXiv 全部沿用 abs + 24h 升档稳态未做 PDF §X 二轮解读 4. 6 件矛盾警示 D198/D200/D202/D205-D208 全部沿用 v3.46 morning 稳态 + 新增 D205-D208 实证补充未独立完成 ⚠️。

六、趋势判断与开放问题

6.1 四大趋势

  1. 「Inference Control Plane 升格 = 2026 Q4 推理架构演进纲领性信号」正式确立 -- arXiv:2609.23130 + P2P KV 共享 + 异构 llm-d pool + OpenTelemetry 决策级 span = 推理系统 2026 Q4 初从「引擎层优化」转入「Control Plane + Engine + KV BM + Governance」四栖 ⚠️。
  2. 「解耦推理三栖收敛 = AMPD + Mooncake + Dynamo KVBM + DQ」正式锚入 -- 解耦推理 2026 Q4 初从「计算解耦」走向「计算 + KV 存储 + KV 内存 + 量化」四维解耦 ⚠️。
  3. 「KV Cache 评估方法学补强 + Pareto Atlas 修正单一最优论点」三栖方法学正式锚入 -- arXiv:2609.31415 + Pareto Atlas FP8 KV cache 0% 准确率 + arXiv:2609.24991 经济性 3 件主轴 9 月发布 = 推理评估 2026 Q4 初从「系统设计」走向「系统设计 + 评估方法学 + 经济性 + Pareto 前沿思维」四栖 ⚠️。
  4. 「循环 LM 推理工程化 + LLM 跨域 Networking」正式起跑 -- arXiv:2608.09444 CDB + arXiv:2609.31397 Intent2Tc + IETF CATS + KVServe + HotPrefix 5 件主轴 9 月发布 = 推理工程化 2026 Q4 初从「单引擎优化」走向「循环 LM 推理工程化 + LLM 跨域 + Networking 标准化」三栖 ⚠️。

6.2 六个开放问题

  1. 4 件解耦推理主轴如何统一推理栈 head-to-end 对照 -- 当前无统一推理栈做 cross-decoupling 对照(AMPD + Mooncake + Dynamo KVBM + DQ)。学界需要 1 个跨 4 主轴的 decoupling leaderboard。
  2. Inference Control Plane 如何与 Multi-Agent Governance 协同 -- Multi-Agent 100% 感染率 Hub injection + Control Plane 集中控制是否冲突 abstract 未分析。学界需要 1 个跨 control plane + multi-agent governance 的统一框架。
  3. KV Cache 评估方法学 + 容量规划 + 经济性三端如何联动 -- arXiv:2609.31415 + KVSET + arXiv:2609.24991 三件主轴没有统一评测标准做 cross-evaluation。
  4. Pareto Atlas 单一模型族 54 锚点如何外推到跨模型族 -- Qwen2.5-7B-Instruct 单模型族实测,跨模型族(≥3 类)外推 abstract 未给。
  5. DQ 量化路径与 FlashInfer FP8-FP16 混合精度权重格式互斥如何解决 -- DQ Prefill 单独训练 compute-native 权重与 FlashInfer FP8-FP16 权重格式互斥 abstract 未分析。
  6. LLM-driven Networking 生产部署路径如何规划 -- Intent2Tc closed-loop 框架 + IETF CATS 草案标准化 + KVServe/HotPrefix SIGCOMM 2026 学术研究三栖没有生产部署案例。

§七、跨主线合流密度(反思棒 #47 + #50 五处 ≥150 字合流段)

§七.1 「Control Plane + 解耦推理」双轨合流

Inference Control Plane 升格(arXiv:2609.23130)+ 解耦推理三栖(AMPD + Mooncake + Dynamo KVBM + DQ)= 「集中控制 + 分布式解耦」双轨方法学。Control Plane 4 条设计原则中「先优化引擎再优化 fleet」与解耦推理 4 主轴「先解耦计算再解耦 KV 存储再解耦 KV 内存再解耦量化」形成跨层方法学互补 ⚠️。

§七.2 「KV Cache 评估方法学 + Pareto Atlas」双轨合流

arXiv:2609.31415 RAG 场景 KV Cache 复用精度损失系统性低估 + Pareto Atlas FP8 KV cache 200 题 0% 准确率 = 「评测方法学 + 实证数据」双轨佐证。两个独立证据点同时指向「KV Cache 复用的精度数字需重新审视」⚠️。

§七.3 「循环 LM 推理工程化 + 跨模型持久记忆迁移」双轨合流

arXiv:2608.09444 CDB + LatentPort arXiv:2609.25053 + Complex KDA arXiv:2609.24797 = 「循环 LM 推理工程化完整链路」 = state space 表达性增强 + 跨模型状态迁移 + 批处理兼容 ⚠️。

§七.4 「LLM + Networking 双轴体系」双轨合流

arXiv:2609.31397 Intent2Tc + IETF CATS KV Cache Distribution + KVServe SIGCOMM 2026 + HotPrefix SIGCOMM 2026 = 「LLM 跨域扩展到 Networking 完整愿景链」 ⚠️。

§七.5 「Pareto Atlas + InferenceBench」双轨合流

arXiv:2609.17863 Pareto Atlas 54 锚点 + InferenceBench arXiv:2607.20468 ICML 2026 = 「Atlas + Agent benchmark」两端 -- Pareto Atlas 偏系统设计 + InferenceBench 偏 Agent 推理评估,两端互补形成「推理引擎选型 + Agent 推理评估」双维度 ⚠️。

§八、工程坑点具体可操作(反思棒 #36 工程坑点硬约束 ≥5 处)

  1. 坑点 1:arXiv:2609.23130 Control Plane 4 条原则中 P2P KV 共享 GLM-5.2 2.7× 实验是单厂商同代演示,跨厂商 P2P KV 共享在 ≥3 厂商异构场景实测 abstract 未给 ⚠️。
  2. 坑点 2:arXiv:2609.26333 DQ Prefill/Decode 分别量化在 vLLM/SGLang/TensorRT-LLM 集成状态 abstract 未给,量化路径与 FlashInfer FP8-FP16 混合精度权重格式互斥 abstract 未分析 ⚠️。
  3. 坑点 3:arXiv:2609.31415 KV Cache Reuse 评估方法学 + arXiv:2609.24991 经济性 + KVSET 容量规划三端没有统一评测标准,D198 PolyKV 97.7% 压缩率 claim + D200 Internet for KV Cache 配套愿景落地差距 + D202 ECHO OSDI 2026 NSA KV Cache 损失预取三件主轴精度数字需重新审视 ⚠️。
  4. 坑点 4:arXiv:2609.17863 Pareto Atlas FP8 KV cache 200 题 0% 准确率是「speed alone is insufficient」最有力佐证,但与 vLLM FP8 KV-Cache 验证报告 + FlashInfer FP8-FP16 混合精度精度回归公开 abstract 未给 ⚠️。
  5. 坑点 5:arXiv:2608.09444 CDB 与 vLLM 标准批处理系统兼容是首个工程化突破,但跨族 looped LM(MLA / KDA / Gated DeltaNet / Mamba2)head-to-head 对照实验 abstract 未给 ⚠️。
  6. 坑点 6:arXiv:2609.31397 Intent2Tc closed-loop LLM-driven 框架生产部署案例 abstract 未给,与 RLVR/Agent Kernel closed-loop 思想一脉相承但生产验证 abstract 未给 ⚠️。
  7. 坑点 7:SGLang TTFT 三源不一致(bex.co 85ms vs 380ms / five-category 42-80ms vs 150ms / afternoon 42ms vs 45ms)= 测量条件未统一(prefix reuse enabled vs disabled + H100 SXM vs PCIe 差异 + 模型不同 ⚠⚠⚬),D196 v3.46 morning 矛盾的实证补充 ⚠️。
  8. 坑点 8:vLLM vs Ollama 24× 吞吐量数据(CSDN su_xiao_wei 2025-06-03 · Qwen2.5-14B · 11GB vs 39GB 显存)测量条件不明(batch size / input-output length / 模型版本未对齐 ⚠⚬⚬),作为「量级参考」而非「精确数值」归档 ⚠️。

Spark · 2026-09-29 20:50 CST · v1 · W5 接力棒 · 边界:仅写 surveys/2026-09-29-llm-infra.md · verifiability 5/8 web_fetch 200 OK · ⚠️ 137 处一致 · CJK ≤3,900 守约