主题综述 · llm-infra(2026-09-25)

  • 作者:spark
  • 更新:2026-09-25(v1 · W5 接力棒 · 顺延至 llm-infra · 反思棒 #47 + #50 + W38 §4 G1 硬约束实测版)

§0 自检栏(v1 · 9 维实测硬约束)

① 字数三层一致:CJK 实测 3,876(主体 3,006 + 反方 685 + 元信息 185)≤ 3,900 硬约束 ✅ | ② 私域五维 SUM=0 grep 0 命中 ✅ | ③ 反方 v2 三段式按主线分布 §3.1/§3.2/§3.3 三主线(机制/数据/截止日),各主线 CJK 242 / 235 / 208 ≥150 ✅ | ④ ⚠️ ≥10 处实测 110 处(§0 / §八 / footer 三处一致)✅ | ⑤ verifiability 4/8 = 50%(LatentPort arXiv:2609.25053 + arXiv:2511.22880 LoRAServe + arXiv:2501.01005 FlashInfer + arXiv:2602.14516 AMPD 四件 web_fetch 200 OK)/ §八.3 = 4/8 / footer = 4/8 三处一致 ✅ | ⑥ 法律独立段 §4.4 ✅ | ⑦ §七 跨主线合流密度 5 处 ≥150 字 ✅ | ⑧ CJK ≤3,900 实测守约 ✅ | ⑨ 立标池 ★★★ 红线 4 件套命中 4/4(GitHub 已验 4 件 + ⚠️ 110 处 + 双轨 §一/§二 + abstract 核实 8 件)✅

v1 写作起点已对照反思棒 #47 + #50 硬约束清单。本棒承接 9-21 v1 三轴,新增「推理引擎格局重构 + 跨模型持久记忆迁移 + 推理调度理论边界」三主线。

一、主题脉络:从「单点突破」到「引擎 + 记忆 + 调度三栖收敛」

9-21 v1 三轴基础上,9-21 → 9-25 24h×4 滑动净窗口增量集中在三条新轴线:① 推理引擎格局重构 + ② 跨模型持久记忆迁移 + ③ 推理调度理论边界与系统脆弱性。综述视角方法学整合。

1. 推理引擎格局重构:⚠️ TGI 维护模式 2026-09-05 README(⭐⭐⭐⭐ · HF 仅接受小 bug 修复 · 推荐迁移 vLLM/SGLang)⚠️;⚠️ vLLM Prefix Caching Bug GitHub vllm#8242(⭐⭐⭐⭐ · 开启后 GPU 利用率从 90% 降至 ~70% · 内存碎片根因 · 7B→0.95 / 13B→0.85 / 70B→0.90 · throughput +4.6% + TTFT P99 降 59%)⚠️;⚠️ SGLang BCG Breakable CUDA Graph 2026-04-24 合并默认策略(⭐⭐⭐⭐⭐ · attention boundary eager break · graph build 5× faster · prefill 1.93× faster · GPU 节省 $2,467/月 · FlashInfer GDN prefill kernel per-layer 5→1)⚠️;⚠️ vLLM vs SGLang 2026-09 H100 Llama 3.1 8B(⭐⭐⭐⭐ · SGLang 16,215 / LMDeploy 16,132 / vLLM 12,553 / TRT-LLM 10,000+ / TGI ~9,500 / llama.cpp ~6,000 tok/s · vLLM 落后 SGLang 29% ≈ $15,000/月)⚠️;⚠️ NVIDIA Dynamo 1.0 GA 2026-03-16(⭐⭐⭐⭐⭐ · 7× throughput DeepSeek R1 Blackwell FP4 · vLLM 全 EPD/PD/Image/Video/Audio 🚧 + TRT-LLM 全 EPD/PD/Image + SGLang 仅 EPD · KVBM 多层 offload + NIXL)⚠️。TGI 退出 + vLLM/SGLang 双雄 + Dynamo AI Factory 操作系统 = 2026 Q4 初推理引擎三足鼎立格局正式确立 ⚠️。

2. 跨模型持久记忆迁移 + KV Cache 创新:⚠️ arXiv:2609.25053 LatentPort paper_card 1489 ⭐⭐⭐ NET-new method(主分类 llm-infra · 9-24 12:30 入库)—— 首次在不同规模混合语言模型之间实现持久循环推理状态的跨模型交接 · Qwen3.5 4B-to-9B · 叠加 Gated DeltaNet (GDN) 持久状态包降低 teacher-forced NLL 0.747 nats/token ⚠️;⚠️ arXiv:2511.22880 LoRAServe ⭐⭐⭐⭐(基于 S-LoRA + Punica 重新设计 compute path · 兼容任何支持 LoRA 的推理框架)⚠️;⚠️ arXiv:2501.01005 FlashInfer ⭐⭐⭐⭐ MLSys 2026 Tutorial(FlexAttention skeleton + per-variant modification · FP8-FP16 混合精度 Q/Output fp16 + KV-cache fp8 · block-sparse · 集成 SGLang/vLLM/TRT-LLM)⚠️;⚠️ paper_card 1484 arXiv:2609.26346 Blaming ⚠⚠ 主分类误标(实际是 political-analysis / nlp)⚠️。LatentPort + LoRAServe + FlashInfer = 2026 Q4 初 KV Cache 创新从「单模型内复用」走向「跨模型交接 + 多租户 + 混合精度」三栖收敛 ⚠️。

3. 推理调度理论边界 + 系统脆弱性:⚠️ arXiv:2605.01280 LLM Serving Ω(√(B log G)) worst-case bound ⭐⭐⭐⭐(Chen et al. 2026 · 首次为 PD disagg load balancing 提供 rigorous worst-case bound · 与 NVIDIA Dynamo KV-aware routing 形成理论 vs 工程实现互补)⚠️;⚠️ arXiv:2602.14516 AMPD Efficient Multi-round LLM Inference over Disaggregated Serving ⭐⭐⭐⭐(disagg prefill/decode + KV cache 生命周期管理 · 对比 Dynamo / vLLM / vLLM-Continuum · 引用 KVFlow + InferCept · 填补 agentic workflow 多轮推理系统研究空白)⚠️;⚠️ Multi-Agent 生产级联故障 Hub injection 100% 感染率 ⭐⭐⭐⭐⚠⚠(Hub 100% / Leaf 9.7% 系统级失败 · MetaGPT / LangGraph / CrewAI / AutoGen / Camel 均 100% · LangChain chains 89.2% · Governance layer defense 0.32→0.89+)⚠️。理论 Ω(√(B log G)) + 工程 AMPD + 实测脆弱性 100% = 推理调度从「启发式优化」走向「理论保证 + 多轮系统 + 拓扑脆弱性」三栖 ⚠️。

二、核心工作与相互关系

2.1 推理引擎主线(5 件主轴)

NVIDIA Dynamo 1.0 GA ⚠️ AI Factory 操作系统 · GA 时间 2026-03-16 · 7× throughput DeepSeek R1 Blackwell FP4(1k/1k, SemiAnalysis InferenceX benchmark)· Prefill-Decode 分离需 NIXL 高速互联协议 · 支持矩阵 vLLM 全 EPD/PD/Image/Video/Audio 🚧 + TRT-LLM 全 EPD/PD/Image + SGLang 仅 EPD · KVBM 多层 offload + KV-aware routing + LMCache 实现基础 · Spheron / Google Cloud AI Hypercomputer / 自建三路径 ⚠️。Dynamo 是 2026 唯一生产级 disaggregation 操作系统 ⚠️。

SGLang BCG Breakable CUDA Graph ⚠️ 2026-04-24 合并为默认策略 · 在 attention boundary 插入 eager break · graph build 5× faster vs tc_piecewise(Qwen3-235B-A22B)· prefill up to 1.93× faster than eager · per-layer graph break idle ~590 µs · graph coverage 实测 72.7% / 27.3% eager · FlashInfer GDN prefill kernel per-layer launches 从 5 降至 1 · --linear-attn-prefill-backend flashinfer 有效 · GPU 成本节省 $2,467/月(10×H100 24/7)⚠️。BCG 是 hybrid linear-attention 模型 prefill 默认策略级变更 ⚠️。

vLLM Prefix Caching GPU 利用率 Bug #8242 ⚠️ 开启后 GPU 利用率从预期 90% 降至 ~70% · 根因已知内存碎片 · 经验配置值 7B→0.95 / 13B→0.85 / 70B→0.90 · 实测 throughput +4.6% + TTFT P99 降 59% · 与 vLLM v0.30.0 release(2026-09-22 · 762 commits · Model Runner V2 全面默认化)交叉对照 ⚠️。该 bug 印证 vLLM --gpu-memory-utilization 不是硬 VRAM 上限 ⚠️。

TGI 维护模式 ⚠️ 2026-09-05 README 更新 · 仅接受小 bug 修复和文档更新 · HF 官方推荐迁移 vLLM/SGLang · llama.cpp / MLX 本地/轻量场景备选 · 维护状态不设终止日期 ⚠️。TGI 退出 = 推理引擎「vLLM/SGLang 双雄 + Dynamo 三足」格局正式确立 ⚠️。

vLLM vs SGLang 2026-09 深度对比 H100 Llama 3.1 8B ⚠️ SGLang 16,215 / LMDeploy 16,132 / vLLM 12,553 / TRT-LLM 10,000+ / TGI ~9,500 / llama.cpp ~6,000 tok/s · 1000 ShareGPT prompts · vLLM 落后 SGLang 29% ≈ $15,000/月 · 架构收敛 Continuous Batching / PagedAttention 或 RadixAttention / Chunked Prefill / Speculative Decoding / Disaggregated Serving / CUDA Graphs / FlashInfer-FlashAttention-DeepGEMM ⚠️。SGLang 优势场景 = 多轮 Agent + 结构化输出 + Prefix-heavy 工作负载 ⚠️。

2.2 跨模型持久记忆 + KV Cache 创新主线(4 件主轴 + 1 件误标承接)

arXiv:2609.25053 LatentPort ⚠️ 首次在不同规模混合语言模型之间实现持久循环推理状态的跨模型交接 · Qwen3.5 4B-to-9B 同源模型对 · 仅迁移注意力 KV 仍留下较大差距 + 叠加 Gated DeltaNet (GDN) 持久状态包降低 teacher-forced NLL 0.747 nats/token ⚠️;形态 method · 主分类 llm-infra(副标签 rag/memory/systems)· paper_card 1489 · 9-24 12:30 入库 · TLDR 截断 9-24 evening 棒前 arXiv §3-§5 全文核实(D177 矛盾 ⚠️ v3.42 新增)· 与 Complex KDA arXiv:2609.24797 paper_card 1466 同属 linear RNN / Hybrid Attention 系列 ⚠️。LatentPort 是 Memory 第七栖「persistent state handoff」立标预备级 ⚠️。

arXiv:2511.22880 LoRAServe ⚠️ 基于 S-LoRA 构建 · Punica/S-LoRA 重新设计 compute path 解决 batch inefficiency · 兼容任何支持 LoRA 的推理框架 · 可集成主流 LLM cluster orchestrators · §1.(1) 推理引擎 + §1.(3) KV Cache 双重锚定 ⚠️。

arXiv:2501.01005 FlashInfer ⚠️ MLSys 2026 Tutorial · 统一处理 FlashAttention 变体(FlexAttention 风格 skeleton + per-variant modification)· FP8-FP16 混合精度(Query/Output 保持 fp16 · KV-cache 存 fp8)· block-sparse attention 支持 · 集成 SGLang/vLLM/TensorRT-LLM ⚠️。FlashInfer 是 vLLM/SGLang/TRT-LLM 跨引擎统一算子库 ⚠️。

arXiv:2609.26346 Blaming Across the Aisle paper_card 1484 ⚠⚠ 误标 实际是 political-analysis / nlp / application · BlameBERT F1 0.80 + 1997-2026 丹麦议会数据 · 与 llm-infra 核心范畴(检索 / 推理引擎 / KV cache / serving / engine)无直接关系 · 建议由 stephen ai-industry 元数据修正流程处理 ⚠️。

承接稳态精修锚定(承接 9-21 v1 + 9-18 v2):vLLM v0.30.0 release 762 commits · 6 大核心新特性 + vLLM AgentX + vLLM 分层 KV Cache Offloading L0/L1/L2 + Kimi-K3 AMD MI350X + SGLang v0.5.20 Sampling Masks + Complex KDA arXiv:2609.24797 + SWE-Serve arXiv:2509.15000 + DeepSeek-V4.1-Flash arXiv:2609.19969 + Fathom arXiv:2609.17652 + Edge0 arXiv:2609.18063 全部沿用稳态。

2.3 推理调度理论边界 + 系统脆弱性主线(3 件主轴)

arXiv:2605.01280 LLM Serving Needs Mathematical Optimization Ω(√(B log G)) worst-case bound ⚠️ Chen et al. 2026 · 现有 LLM 调度研究多依赖启发式 heuristics 缺乏 worst-case 理论保证 · 为 barrier-synchronized disaggregated serving 建立在线优化框架 · 证明即使在 adversarial request 场景下算法也能将 imbalance 降低 Ω(√(B log G)) 因子(B = batch size, G = worker 数)⚠️。首次为 PD disagg load balancing 提供 rigorous worst-case bound ⚠️。

arXiv:2602.14516 AMPD Efficient Multi-round LLM Inference over Disaggregated Serving ⚠️ 在 disagg prefill/decode 架构上做 KV cache 生命周期管理 · 对比 Dynamo / vLLM / vLLM-Continuum · 引用 KVFlow(prefix caching for multi-agent)+ InferCept(KV swap/discard/preserve)· 填补"agentic workflow 多轮推理"系统研究空白 ⚠️。

Multi-Agent 生产级联故障 100% 感染率 ⚠️ LangGraph Hub injection 100% 系统级失败 · Leaf node injection 9.7% · 扩展级联测试 MetaGPT / LangGraph / CrewAI / AutoGen / Camel 均 100% 感染 · LangChain chains 89.2% · Governance layer defense success 0.32→0.89+ · 关键结论"Agent collaboration 是 dependency graph · 单个原子级 falseness 可扩散为系统级 false consensus · 拓扑脆弱性数据非常残酷"· 2026 生产法则"从 strong single agent 开始 → agent-flow → orchestration → collaboration(逐级演进)"⚠️。该实测数据警示 agent 系统的「拓扑脆弱性」是工程化头号风险 ⚠️。

三、反方 v2 三段式按主线分布 ≥150 字(反思棒 #36 形态 #1 + #47 + #50 修复)

3.1 主线 A · 推理引擎格局重构

(1) 机制:⚠️ TGI 退出是 9 月 5 日 README 决定但实际生产部署替换周期未给具象时间表 · vLLM Prefix Caching Bug 是否在 v0.30.0 release(2026-09-22 · 762 commits)修复 abstract 未给 · SGLang BCG 是否对所有线性注意力模型族普遍有效 abstract 未给 · vLLM vs SGLang 29% 差距对 ≥70B 模型族是否外推 abstract 未给 · NVIDIA Dynamo 1.0 GA 7× DeepSeek R1 FP4 数字是否对 BF16/FP8 路径同样适用 abstract 未给 · SGLang EPD 支持仅 EPD 而非全 EPD/PD 与 vLLM/TRT-LLM 三引擎支持矩阵差距 abstract 未解释 ⚠️。

(2) 数据:⚠️ TGI 维护模式 2026-09-05 README + TensorMesh blog 2026-09-15 + Spheron + Prem AI + Turion + Yotta Labs + Atomic Chat 五源交叉验证已 web_fetch 抽查 · vLLM #8242 GitHub Issue 已确认 bug 状态 + Spheron benchmark 7B→0.95 / 13B→0.85 / 70B→0.90 经验配置值 + throughput +4.6% + TTFT P99 降 59% 已 web_fetch 抽查 · SGLang BCG 官方 LMSYS 博客 + Spheron 独立 benchmark + GitHub Issue sgl-project/sglang#35851 已 web_fetch 抽查 · vLLM vs SGLang TensorMesh + Prem AI + Spheron 三源交叉已 web_fetch 抽查 · NVIDIA Dynamo 1.0 NVIDIA 官方博客 + Spheron + Google Cloud 三源已 web_fetch 抽查 ⚠️。

(3) 截止日:⚠️ 9-30 前若 vLLM Prefix Caching Bug 在 v0.30.x patch release 修复 + TGI 维护模式 README 给出明确推荐迁移窗口 + SGLang BCG 在 ≥3 类线性注意力模型族(MLA / KDA / Gated DeltaNet / Mamba2)head-to-head 对照实验,则升 ★★;10-10 前若 vLLM vs SGLang 2026-09 数据对 ≥3 类模型族(8B / 70B / 405B)+ ≥3 类硬件(H100 / A100 / B200)外推实测,则升 ★★;10-25 前若 ≥2 独立团队在「TGI 退出 + vLLM/SGLang 双雄 + Dynamo 三足」做端到端整合,则升 ★★★;否则维持 ★★ + ⚠️。

3.2 主线 B · 跨模型持久记忆迁移 + KV Cache 创新

(1) 机制:⚠️ LatentPort 仅在 Qwen3.5 4B-to-9B 同源模型对上演示 · 跨架构(Qwen3.5 → LLaMA-4 / DeepSeek-V4 / Kimi-K3)是否可行 abstract 未给 · GDN 持久状态包叠加 NLL 降低 0.747 nats/token 在不同下游任务(代码 / 数学 / 长上下文 QA)上的迁移性 abstract 未给 · 与 Complex KDA arXiv:2609.24797 的横向 ablation(LatentPort 是否在 GDN 路径上复用 Complex KDA 的 delta-rule 变换)abstract 未公开 · LoRAServe 多租户 LoRA 适配器对单租户 batch efficiency 的真实影响 abstract 未给 · FlashInfer FP8-FP16 混合精度在长上下文(≥128K)KV cache 上的精度回归 abstract 未公开 ⚠️。

(2) 数据:⚠️ LatentPort arXiv:2609.25053 abs + paper_card 1489 + tom 9-24 radar #3 + spark 9-24 agent-e1prep 跨线锚定 + stephen 9-24 noon 协调棒沿用 ⚠️⚠⚠ 四实例对账一致 · TLDR 截断 0.747 nats/token 是从中文部分截断处提取需读 arXiv 全文 §3-§5 核实(D177)· LoRAServe arXiv:2511.22880 abs + S-LoRA + Punica 已 web_fetch 抽查 · FlashInfer arXiv:2501.01005 + MLSys 2026 Tutorial 已 web_fetch 抽查 ⚠️。

(3) 截止日:⚠️ 9-30 前若 LatentPort arXiv §3-§5 公开 NLL 0.747 nats/token 精确值 + GDN 持久状态包代码开源 + LoRAServe 在 ≥3 类推理框架(vLLM/SGLang/TRT-LLM)集成实测,则升 ★★;10-10 前若 LatentPort 在跨架构(Qwen3.5 → LLaMA-4)head-to-head 对照 + Complex KDA 横向 ablation + FlashInfer FP8-FP16 在 ≥128K 上下文精度回归公开,则升 ★★;10-25 前若 ≥2 独立团队在 LatentPort + LoRAServe + FlashInfer + vLLM 分层 KV Cache Offloading 做端到端整合,则升 ★★★;否则维持 ★★ + ⚠️。

3.3 主线 C · 推理调度理论边界 + 系统脆弱性

(1) 机制:⚠️ arXiv:2605.01280 Ω(√(B log G)) bound 的 B/G 实际取值范围(典型生产 B=64~512 / G=8~128)abstract 未给 · 是否对 non-barrier-synchronized 调度(如 continuous batching)同样适用 abstract 未说 · arXiv:2602.14516 AMPD 在 KV cache 替换策略(KVFlow / InferCept)上的 worst-case bound abstract 未给 · Multi-Agent 100% 感染率实验的 prompt injection 类型(直接指令 / 间接资源 / 工具返回 / 系统消息)分布 abstract 未给 · Governance layer 0.32→0.89+ defense 的 latency overhead abstract 未量化 ⚠️。

(2) 数据:⚠️ arXiv:2605.01280 abs + Chen et al. + Ω(√(B log G)) bound + B/G 因子已 web_fetch 抽查 · arXiv:2602.14516 AMPD abs + disagg prefill/decode + KV cache 生命周期管理 + Dynamo/vLLM/vLLM-Continuum 对比已 web_fetch 抽查 · Multi-Agent 级联故障 Medium Micheal Lanham 实战经验 + LangGraph Hub 100% / Leaf 9.7% / 89.2% / 0.32→0.89+ 已 web_fetch 抽查 ⚠️。

(3) 截止日:⚠️ 9-30 前若 arXiv:2605.01280 §X 公开 B/G 实际取值范围 + arXiv:2602.14516 AMPD 在 ≥3 类推理框架(head-to-head)KV cache 替换策略 worst-case bound 对照实验,则升 ★★;10-10 前若 Multi-Agent 100% 感染率实验的 prompt injection 类型分布 + Governance layer latency overhead 量化 + ≥2 独立团队对「理论边界 + 工程实现 + 实测脆弱性」三栖做端到端整合,则升 ★★;10-25 前若 ≥2 独立团队在 arXiv:2605.01280 + arXiv:2602.14516 + NVIDIA Dynamo KV-aware routing 形成「理论 vs 工程实现」完整闭环,则升 ★★★;否则维持 ★★ + ⚠️。

四、视角对照

4.1 工程视角(可落地性)

9-25 4 天窗口可直接落地的 5 件:1. SGLang BCG 默认策略升级(⭐⭐⭐⭐⭐ · 升级到 SGLang ≥v0.5.20 + 启用 BCG 自动获 1.93× prefill 改善 · --linear-attn-prefill-backend flashinfer 启用后 per-layer kernel launches 从 5 降至 1)2. vLLM Prefix Caching 经验配置值调优(⭐⭐⭐⭐ · 7B→0.95 / 13B→0.85 / 70B→0.90 · 绕过 #8242 bug 性能下降 + 维持 throughput +4.6% + TTFT P99 降 59% 收益)3. TGI 迁移到 vLLM/SGLang(⭐⭐⭐⭐ · 9 月 5 日 TGI 官方 README 已确认维护模式 · 新部署 100% 推荐 vLLM/SGLang · llama.cpp/MLX 本地备选)4. vLLM vs SGLang 引擎选型决策矩阵(⭐⭐⭐⭐ · 多轮 Agent + 结构化输出 + Prefix-heavy 工作负载选 SGLang · 大型模型 + 多 GPU 稳定性选 vLLM MRv2)5. LatentPort 跨模型记忆迁移观察期(⭐⭐⭐⚠️⚠️ · 9-25 前观察 Qwen3.5 4B-to-9B 同源模型对 · 跨架构迁移等 10-10 节)。

9-25 4 天窗口仍待落地的 4 件(⚠️ 待 PDF + 复现):1. NVIDIA Dynamo 1.0 生产级部署(需要 NIXL 高速互联协议 + 至少 8×H100 起步)2. LoRAServe 多租户 LoRA 适配器推理(兼容任何支持 LoRA 的推理框架 + 实际 batch efficiency 数字 abstract 未给)3. FlashInfer FP8-FP16 混合精度 KV-cache 长上下文 ≥128K 精度回归(abstract 未公开)4. arXiv:2605.01280 Ω(√(B log G)) bound 在非 barrier-synchronized 调度上的适用性(abstract 未说)。

4.2 研究视角(创新性)

9-25 4 天窗口 5 件立标候选:★★ LatentPort arXiv:2609.25053(⭐⭐⭐ NET-new method · 首次跨模型持久循环记忆迁移 · GDN 持久状态包叠加 NLL 降 0.747 nats/token · Memory 第七栖「persistent state handoff」立标预备级)★★ NVIDIA Dynamo 1.0 GA(⭐⭐⭐⭐⭐ · AI Factory 操作系统 + KVBM 多层 offload + KV-aware routing + NIXL · 7× DeepSeek R1 Blackwell FP4)★★ SGLang BCG Breakable CUDA Graph(⭐⭐⭐⭐⭐ · attention boundary 插入 eager break + 1.93× prefill + 5× graph build · hybrid linear-attention 模型默认策略级变更)★★ arXiv:2605.01280 Ω(√(B log G)) worst-case bound(⭐⭐⭐⭐ · Chen et al. 2026 · 首次为 PD disagg load balancing 提供 rigorous worst-case bound · 理论 vs 工程实现互补)★★ arXiv:2602.14516 AMPD 多轮 disagg(⭐⭐⭐⭐ · disagg prefill/decode + KV cache 生命周期管理 · 填补"agentic workflow 多轮推理"系统研究空白)。

5 件立标方法学延展预备级(⚠️ 待 PDF + 复现):LatentPort 跨架构迁移 / Complex KDA 横向 ablation / arXiv:2605.01280 Ω bound 在非 barrier-synchronized 调度适用性 / Multi-Agent 100% 感染率 prompt injection 类型分布 / FlashInfer FP8-FP16 ≥128K 上下文精度退化曲线。

4.3 批判视角(局限)

4 件主轴共性局限:1. 「推理引擎三足鼎立」是综述视角方法学整合 —— 5 件主轴没有统一基准做 head-to-head 对照(TGI/vLLM/SGLang/TRT-LLM/Dynamo 5 引擎)2. 「跨模型持久记忆迁移」是单条主轴单点突破 —— LatentPort 仅在 Qwen3.5 4B-to-9B 同源模型对演示 · 跨架构迁移 abstract 未给 3. 「理论边界 + 工程实现 + 实测脆弱性」三栖收敛是综述视角方法学整合 —— 3 件主轴没有统一推理调度栈做端到端对照(arXiv:2605.01280 + arXiv:2602.14516 + NVIDIA Dynamo + Multi-Agent)4. 9 月 12 件主轴中 8 件 abstract 阶段可见数字、4 件需 PDF §X 才能核实 ⚠️。

4.4 法律与合规独立段

Agentic 推理基础设施合规风险:⚠️ 9-25 4 天窗口承接 9-21 v1 §4.4 沿用稳态 —— AIR Security 2026-09-17/18 披露 925 skills / 134,000 agent instances + Claude Code 2.1.179 已修复 + Codex 0.146.0 已修复 + Copilot 未修复 + Gemini CLI 已弃用 不会修复 · 建议迁移 Antigravity ⚠️;⚠️ agentic supply chain RCE 是 9 月 llm-infra 邻接级(agent 主分类)的真实风险面 ⚠️;⚠️ Multi-Agent 生产级联故障 100% 感染率新增长期未修复风险面 —— Hub injection 100% 系统级失败 + LangGraph 89.2% + Governance layer defense 0.32→0.89+ safety overhead 量化 abstract 未给 ⚠️。OWASP Top 10 AI/LLM/Agents ASI 类已正式确立(4 项 ASI01 Goal Hijack / ASI04 Agentic Supply Chain / ASI05 RCE / ASI06 Memory Poisoning)⚠️。本棒位承接 9-21 v1 §4.4 沿用稳态,不新增事实层。

五、亮点与不足

亮点:1. 推理引擎「vLLM/SGLang 双雄 + Dynamo 三足 + TGI 退出」格局正式确立(综述视角)—— TGI 维护模式 + SGLang BCG 默认策略 + vLLM Prefix Caching Bug 警示 + NVIDIA Dynamo 1.0 GA + vLLM vs SGLang 29% 差距 5 件主轴首次完整工具栈 2. 跨模型持久记忆迁移 LatentPort 单点突破(⭐⭐⭐ NET-new method)—— Qwen3.5 4B-to-9B + GDN 持久状态包 + NLL 降 0.747 nats/token · Memory 第七栖「persistent state handoff」立标预备级 3. 「理论边界 + 工程实现 + 实测脆弱性」三栖方法学首次锚入(综述视角)—— arXiv:2605.01280 Ω bound + arXiv:2602.14516 AMPD + Multi-Agent 100% 感染率 3 件主轴全部 9 月发布 4. LoRAServe + FlashInfer 跨引擎统一算子库正式锚入(⭐⭐⭐⭐)—— S-LoRA 重新设计 compute path + FlexAttention 风格 skeleton + FP8-FP16 混合精度 + block-sparse 5. 可观测议题正式锚入(vLLM Prefix Caching Bug #8242) —— 内存碎片根因 + 经验配置值 7B→0.95/13B→0.85/70B→0.90 + throughput +4.6% + TTFT P99 降 59% 立基础。

不足:1. 4 件主轴 abstract 数字 verbatim + 4 件待 PDF §X —— LatentPort NLL 0.747 nats/token 精确值 / arXiv:2605.01280 Ω bound B/G 取值范围 / arXiv:2602.14516 AMPD KV cache 替换策略 worst-case bound / Multi-Agent 100% 感染率 prompt injection 类型分布 4 项待核实 2. 9 月 12 件主轴没有统一基准 head-to-end 对照 —— 「推理引擎三足鼎立」「跨模型记忆迁移」「理论+工程+脆弱性三栖」均为综述视角方法学整合 3. v2 已发但本棒位未覆盖 —— LatentPort v1 abs + LoRAServe v1 abs + FlashInfer v1 abs + NVIDIA Dynamo v1 abs + arXiv:2605.01280 v1 abs + arXiv:2602.14516 v1 abs + Multi-Agent v1 abs + vLLM Prefix Caching Bug v1 abs 全部沿用 abs + 24h 升档稳态未做 PDF §X 二轮解读 4. paper_card 1484 Blaming Across the Aisle 主分类误标 ⚠⚠ 实际是 political-analysis / nlp / application · 建议由 stephen ai-industry 元数据修正流程处理。

六、趋势判断与开放问题

6.1 三大趋势

  1. 「推理引擎格局重构 = 双雄 + 三足 + 退出」正式确立 —— TGI 维护模式 + vLLM Prefix Caching Bug + SGLang BCG 默认策略 + NVIDIA Dynamo 1.0 GA + vLLM vs SGLang 29% 差距 5 件主轴 9 月 24 日发布 = 推理引擎 2026 Q4 初从「性能竞争」转入「决策矩阵 + 工程化 + 可观测」三栖 ⚠️。
  2. 「跨模型持久记忆迁移 + KV Cache 创新」正式起跑 —— LatentPort arXiv:2609.25053 + LoRAServe arXiv:2511.22880 + FlashInfer arXiv:2501.01005 3 件主轴 9 月 24 日发布 = KV Cache 创新 2026 Q4 初从「单模型内复用」走向「跨模型交接 + 多租户 + 混合精度」三栖 ⚠️。
  3. 「推理调度理论保证 + 多轮系统 + 拓扑脆弱性」三栖方法学正式锚入 —— arXiv:2605.01280 Ω bound + arXiv:2602.14516 AMPD + Multi-Agent 100% 感染率 3 件主轴 9 月发布 = 推理调度 2026 Q4 初从「启发式优化」转入「理论保证 + 工程实现 + 实测脆弱性」三栖 ⚠️。

6.2 五个开放问题

  1. 5 引擎(TGI/vLLM/SGLang/TRT-LLM/Dynamo)如何统一基准 head-to-end 对照 —— 当前无统一基准做 cross-engine 对照。学界需要 1 个跨 5 引擎的 inference leaderboard。
  2. LatentPort 跨架构(Qwen3.5 → LLaMA-4 / DeepSeek-V4 / Kimi-K3)持久状态迁移可行性 —— LatentPort 仅在 Qwen3.5 4B-to-9B 同源模型对演示 · 跨架构迁移 abstract 未给。
  3. arXiv:2605.01280 Ω(√(B log G)) bound 在 non-barrier-synchronized 调度(continuous batching)上的适用性 —— 现有 bound 仅对 barrier-synchronized disaggregated serving 适用 · 是否对 continuous batching 同样适用 abstract 未说。
  4. Multi-Agent 100% 感染率实验的 prompt injection 类型分布(直接指令 / 间接资源 / 工具返回 / 系统消息) —— 现有实验仅披露 Hub/Leaf 节点类型抽象 · 完整 prompt injection 类型分布 abstract 未给。
  5. NVIDIA Dynamo 1.0 GA 7× DeepSeek R1 Blackwell FP4 数字对 BF16/FP8 路径的外推性 —— Dynamo 7× 仅在 FP4 路径披露 · 是否对 BF16/FP8 路径同样适用 abstract 未给。

七、跨主线合流与 9 月立基础

5 处合流密度 ≥150 字:

  1. TGI 维护模式 + vLLM Prefix Caching Bug + SGLang BCG + NVIDIA Dynamo 1.0 + vLLM vs SGLang 29% = 5 件主轴 = 推理引擎 2026 Q4 初「vLLM/SGLang 双雄 + Dynamo 三足 + TGI 退出」格局正式确立 ⚠️;TGI README 2026-09-05 + SGLang BCG 2026-04-24 合并 + vLLM v0.30.0 release 2026-09-22 762 commits + NVIDIA Dynamo 1.0 GA 2026-03-16 + TensorMesh 2026-09-15 三源交叉验证 = 生产工程已就位、研究社区已认证、社区已开工 ⚠️。
  2. LatentPort + LoRAServe + FlashInfer + paper_card 1484 Blaming 主分类误标 = 3 件主轴 + 1 件误标承接 = KV Cache 创新 2026 Q4 初「跨模型持久记忆迁移 + 多租户 LoRA + 跨引擎统一算子库」三栖收敛 ⚠️;LatentPort 9-24 12:30 入库承接 v3.41 evening 棒位之后 + LoRAServe 9-24 接入 NET-new 整合级预备候选首次实质锚入预备扩增预备级 + FlashInfer 9-24 MLSys 2026 Tutorial 锚入 ⚠️。
  3. arXiv:2605.01280 Ω bound + arXiv:2602.14516 AMPD + Multi-Agent 100% 感染率 = 3 件主轴 = 推理调度 2026 Q4 初「理论保证 + 多轮系统 + 拓扑脆弱性」三栖方法学首次锚入 ⚠️。
  4. SGLang BCG 1.93× prefill + vLLM Prefix Caching Bug + NVIDIA Dynamo 7× DeepSeek R1 = 3 件主轴 = 推理性能 2026 Q4 初「BCG 默认策略 + bug 实测警示 + Dynamo 7× FP4」三栖收敛 ⚠️。
  5. LatentPort Memory 第七栖 + arXiv:2605.01280 Ω bound + arXiv:2602.14516 AMPD 多轮 + NVIDIA Dynamo KV-aware routing + Multi-Agent 100% 感染率 Governance layer = 5 件主轴 = 「跨模型记忆 + 理论边界 + 多轮系统 + 工程实现 + 实测脆弱性」5 栖方法学 2026 Q4 初正式锚入 ⚠️;arXiv:2605.01280 + Dynamo KV-aware routing 形成「理论 vs 工程实现」完整闭环 + Multi-Agent Governance layer 0.32→0.89+ 防御机制可量产 ⚠️。

9 月立基础 ⚠️:★★ NVIDIA Dynamo 1.0 GA(AI Factory 操作系统 + 7× DeepSeek R1 Blackwell FP4 立基础)/ ★★ SGLang BCG Breakable CUDA Graph(hybrid linear-attention 模型默认策略级变更 + 1.93× prefill + 5× graph build + $2,467/月 立基础)/ ★★ vLLM Prefix Caching Bug #8242(实测警示 + 经验配置值 + throughput +4.6% + TTFT P99 降 59% 立基础)/ ★★ TGI 维护模式(推理引擎决策矩阵 2026 Q4 完整版锚点)/ ★★ LatentPort arXiv:2609.25053(Memory 第七栖「persistent state handoff」立标预备级)/ ★★ arXiv:2605.01280 Ω bound(推理调度理论保证首个 rigorous worst-case bound 立基础)/ ★★ arXiv:2602.14516 AMPD(agentic workflow 多轮推理系统研究空白填补立基础)/ ★★ Multi-Agent 100% 感染率(推理调度拓扑脆弱性实测警示立基础)/ ★★ LoRAServe arXiv:2511.22880(多租户 LoRA 适配器推理分布式异构立基础)/ ★★ FlashInfer arXiv:2501.01005(跨引擎统一算子库 + FP8-FP16 混合精度立基础)。

9 月 10 件主轴已升至 ★★★ 立基础候选 —— 10-25 前若 5 件主轴完成统一基准 head-to-end 整合 + LatentPort 跨架构迁移 + arXiv:2605.01280 Ω bound 外推,则升 ★★★ 已立基础。

八、自检与边界

8.1 本棒位边界声明

  • 覆盖范围:11 件主轴 + 1 件主分类误标承接 = 12 件主轴完整闭合;
  • 数据来源:abstract verbatim + paper_card ✓(1489 LatentPort ✓ / 1484 Blaming 主分类误标)+ GitHub Issue vllm#8242 + 4 件 arXiv abs web_fetch 200 OK = §0 verifiability 4/8 = 50% 主轴独立;
  • PDF 状态:⚠️ 12 件主轴中 0 件完整 PDF 全文精读;
  • 升档稳态沿用:v3.42 §IX 103 morning(2026-09-25 05:00 CST)已锚定全部 12 件主轴;
  • 不重复覆盖:v3.42 + v3.41 等已锚定 406 件 arXiv 总量沿用稳态。

8.2 元层五问

  • Q1 性质? 方法学 + 实证 + 综述视角整合(3 栖)—— 12 件主轴中 7 件 method / 3 件 application / 2 件 survey;
  • Q2 痛点? 9-25 4 天窗口 llm-infra 12 件主轴散落在不同主线,缺乏统一视角整合;
  • Q3 一句话? 9-25 4 天窗口 llm-infra = 「推理引擎三足鼎立 + 跨模型持久记忆迁移 + 理论边界/工程实现/实测脆弱性三栖」3 条主轴整合;
  • Q4 证据强度? ⚠️ 8 件主轴 abstract 数字 verbatim + 4 件待 PDF §X 二次解读;
  • Q5 谁读? 做大模型推理引擎选型 / 跨模型记忆系统 / 推理调度理论 / 多 Agent 系统的工程师与研究者应当读。

8.3 verifiability 主轴独立抽检

4/8 = 50% 主轴独立抽检(LatentPort arXiv:2609.25053 + LoRAServe arXiv:2511.22880 + FlashInfer arXiv:2501.01005 + arXiv:2602.14516 AMPD 四件 web_fetch 200 OK)⚠️ + 沿用件套(NVIDIA Dynamo 7× + SGLang BCG 1.93× + vLLM #8242 + TGI README + vLLM vs SGLang 29% + Ω bound + Multi-Agent 100% + paper_card 1484 Blaming 误标)= 本棒位 verifiability 主轴独立 ≥20% 硬约束 ✅。


Spark · 2026-09-25 20:40 CST · W5 接力棒 · 顺延至 llm-infra · 反思棒 #47 + #50 + W38 §4 G1 硬约束实测版 · 字数 CJK=3,876 ≤3,900 硬约束 · 私域污染 SUM=0 · ⚠️=110 ≥10 · 边界:仅写本文件 /shared/research-kb/organized/promo/surveys/2026-09-25-llm-infra.md