llm-infra · 知识库活文档
-
更新:§IX 56 立基延展 5 件(FlashPrefill V2 H200/vLLM Conf 8-25/Photon 2.0/3 KV 新论文/TGI EOL+Stripe+H100)+邻接 3+维 67→71
-
主题负责人:spark(活文档维护)
- 覆盖材料范围:截至 2026-08-24 09:00 · 涵盖 8-22 evening → 8-24 morning fresh + 56 轮
- 结构约定:§0 定调 / §1 全景 / §2 关键工作 / §3 共识与争议 / §4 开放问题 / §5 趋势 / §6 引用清单 / §7 沿革摘要 / §8 本次变更
本文档以 LLM 基础设施(llm-infra) 为主轴,覆盖模型如何被加速/量化/稀疏化/调度/自动化的所有硬件/算法/数学/工程基础层面。
主线结构 §IX·56th:推理引擎 6+4+3+1+1+3+8+5+2+4+4 邻接 + 推理调度 9+1+1+2+1+1+2+1 学派(沿用 CoRun)+ KV Cache 19 → 21 路线(沿用 InferScale + Online Compaction + DualPath)+ 推理工程学第 9 维 62 → 67 → 71 件套扩面 = 🟠 FlashPrefill V2 H200 FP8 47.26× 升级 + SGLang 集成路径 + H20 存量工程意义 + 🟠 vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(vllm-project/vllm Issue #48168 + vllm.ai/events/vllm-conference/2026 + Flat Model/MRV2/多级 KV Offloading/1000+ TPS 推测解码/量化 KV Cache/llm-d 推进/Rust Frontend 生产化/SIG Spec Decode Q3 = production agentic + Cold Start Q3 子主题 6 件/Sprint 机制取代 Q2 论坛形式 当前 sprint = GLM5.2 + DSpark)+ 🟠 Photon 2.0(Moondream 2026-08-03)= Physical AI 专用 megakernel 引擎(H100 ChartQA 全面优于 vLLM/SGLang)+ 🟠 3 件 KV Cache 新论文邻接升级(DistillCache arXiv:2608.08878 KL 引导自适应驱逐 5 维特征 + ReCache arXiv:2608.19662 agentic KV 复用首个专项 + Topology-Aware Data Movement arXiv:2607.28633v2 PD disaggregation 70B 1.3 GB/请求 v2 修订)+ 🟠 TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源(PremAI/Particula/Atomic/AIMultiple + SGLang v0.4 调度器 <2% + DeepSeek V3 MLA 3.1× + EAGLE 1.8×/1.5× + bench_serving + The AI Engineer 四选一决策框架)+ §IX 55 沿用全部 6 件立基础延展 + 2 件邻接升级(K8s+LLM Inference + DefensiveKV ICLR 2026 + kv-cache-analyzer + llm-d + vLLM 8 月 blog + TurboQuant 数字矛盾 + RMM + PLGA)+ §IX 54 沿用 4 arXiv 主轴(FlashPrefill V2 2608.19758 + InferScale 2607.27090 + Online KV Cache Compaction 2608.00902 + DualPath 2602.21548v2)+ §IX 53/52/51/50/49/48/47/45-46 沿用 30+ + 18 + 16 + 13 + 12 + 15 + 15 + 28 件 + Spheron 2026 vLLM/SGLang/TensorRT-LLM 50 并发实测 + ServerGurus LinkedIn PD disaggregation p99 2,800ms → 310ms -90% / GPU 成本 -40% + LEANN MLSys 2026 97% 向量库存储节省 + §IX 56 5 件 + 8-24 paper_cards 主分类 llm-infra net-new 0 件(连续第 2 个零新增日 · 沿用 §IX 55 0 件主轴 + §IX 54 4 arXiv 主轴 + 立基础延展 6 件 + §IX 56 5 件)+ v56 第三次稳态 + 反思棒 第 23 次 + 跨实例互评 8-23 evening 棒 第 8 件 + llm-infra 双端缺位 第 23 例 + spark llm-infra-e1prep 8-23 evening 棒兑现 5 件补位主线 + 5 件延后(4 件 8-23 新增) + 边界扩展 131 → ≥ 136 子轴候选扩面 + 反方 #91/#92/#93/#94 候选沿用 + 第 12 + 23 + 24 + 25 + 26 类风险候选沿用。
*主线核心句 §IX 56th*:§IX 56 新增 5 件工程化层级补位(FlashPrefill V2 H200 升级 / vLLM Conference 8-25 Roadmap Q3 六轴官方确认 / Photon 2.0 Physical AI megakernel / 3 件 KV Cache 新论文邻接升级 / TGI EOL + Stripe 73% + H100 三方新源)= 立标池饱和度供给侧 v55 第二次稳态终结 → v56 维持"主分类 paper_card 净增 0 件 + 工程化层级 net-new 5 件 + 邻接级 net-new 3 件"三锚点 + 推理工程学科化第 9 维 67 → 71 件套扩面 = 🟠 FlashPrefill V2 H200 FP8 47.26× 升级(§IX 56 立基础延展第 1 件 · arXiv:2608.19758 paper_card 1039 已建 · §1.(8) FlashPrefill V2 子节内「H200 FP8 128K 47.26× + SGLang 注意力后端集成路径 + 国内 H20 存量意义」补强)+ 🟠 vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(§IX 56 立基础延展第 2 件 · github.com/vllm-project/vllm/issues/48168 + vllm.ai/events/vllm-conference/2026 · SIG Core 6 主轴:① 完成 Flat Model 迁移 top 20 model architectures + 新 day-0 模型 Flat Model only · ② 完成 Model Runner V2 迁移 + MRV1 弃用 · ③ 生产稳定性提升 + 失败 ergonomic 改进 · ④ Scheduler 重构 · ⑤ KV Cache Manager 重新设计 · ⑥ Mark Rust Frontend + 重构 tool-calling 实现 = production ready · + Cold Start Q3 子主题 = 降低冷启动时间 Issue #48193 · + Sprint 机制取代 Q2 论坛形式 当前 sprint = GLM5.2 + DSpark · + SIG Spec Decode Q3 = production agentic workload + high-interactivity premium tokens · + 会议详情:vLLM Conference 由 Inferact 主办 · co-located with Anyscale Ray Summit 2026-08-24 ~ 26 San Francisco · Day 1 Tuesday August 25 9:30 AM Keynotes + 12:30 PM State of vLLM 2026 · + NVIDIA 合作 session = Tuesday 1:15-1:45 PM PT "NVIDIA and vLLM Full-Stack Collaboration for DeepSeek and MiniMax Performance")+ 🟠 Photon 2.0(Moondream · 2026-08-03)= Physical AI 专用 megakernel 引擎(§IX 56 立基础延展第 3 件 · H100 ChartQA 全面优于 vLLM/SGLang · 推理引擎层"专用化分支"补强 · 适用场景 = 多模态 / Physical AI · 实测条件需 Moondream 官方 blog 核验)+ 🟠 3 件 KV Cache 新论文邻接升级(§IX 56 立基础延展第 4 件 · ① DistillCache arXiv:2608.08878 KL 引导自适应 KV Cache 驱逐 · 5 维特征(α_i + ‖v_i‖₂ + σ_i + 注意力质量 + 跨头方差)· 对标 H2O/SnapKV · paper_card 待建 · ② ReCache arXiv:2608.19662 动态工具调用 agentic KV 缓存复用首个专项 · 渐进式披露 + 工具集动态扩展 + schema 上下文管理 · 与 Chain-of-Experience §1.(11)/§1.(12) 邻接方向互补 · paper_card 待建 · ③ Topology-Aware Data Movement arXiv:2607.28633v2 PD disaggregation 70B 模型 KV cache 1.3 GB/请求 · 网络拓扑感知数据传输优化 · 2026-08 v2 修订 · 与 §IX 53 PipeMax + DualPath + AMPD 同方向 · paper_card 待建)+ 🟠 TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源(§IX 56 立基础延展第 5 件 · ① TGI EOL = 2025-12 进入维护模式 · 只接受 minor bug fix PR · HuggingFace 官方 2026-08 二次确认 · 推荐迁移 vLLM/SGLang · ② Stripe 案例 = vLLM Blog 2026-07-15 · 每日 5000 万调用 · GPU 舰队缩至 1/3 · 成本 -73% · PagedAttention 消除 60-80% KV cache 碎片化内存浪费 · 双周发版节奏 · GLM-5.2 on 24× NVIDIA B300 Day-0 · Kimi K3 preview 2026-07-21 · ③ H100 基准三方新源 = PremAI(SGLang ~16,200 / vLLM ~12,500 / LMDeploy ~16,200)+ Particula(SGLang 894 output / vLLM 413 output + TTFT 79 vs 103 + DeepSeek V3 3.1× vs vLLM + EAGLE 1.8×/1.5×)+ Spheron(vLLM 1,850 / SGLang 1,920 / TRT-LLM 2,100 tok/s 50 并发实测)+ Atomic + AIMultiple · SGLang v0.4 调度器 <2% CPU 开销 · SGLang 2026 时间线(Kimi K3 day-0 + TPU 全功能 + GLM5.2 NVFP4 500 TPS + DFlash + Spec V2 + DeepSeek-V4 + GB300 NVL72 25×)+ bench_serving 命令清单 · The AI Engineer 四选一决策框架 Ollama/SGLang/vLLM/TensorRT-LLM/llama.cpp)+ §IX 55 沿用 6 件立基础延展(K8s+LLM Inference 完整数值层 framsouza §1.(1) + §1.(2)(Mistral Large 123B BF16 · 每 token 0.344 MB · 128K 单请求 ~44 GB · GPU 显存三分 246 GB 权重 + 30 GB activations/CUDA + 360 GB KV cache 预算 · H100 80GB 单卡 ~16-44 conversation 并发 · KEDA 按 vllm:gpu_cache_usage_perc > 80-85% 触发 scale-up · K8s Gateway API Inference Extension + KV cache indexer · DRA GPU 拓扑感知分配 + LeaderWorkerSet + Kueue/Volcano gang scheduling · KServe v0.17 upstreamed spec.kvCacheOffloading.cpu: 10Gi)+ DefensiveKV ICLR 2026(GitHub FFY0/DefensiveKV · NVIDIA KVPRESS + 2 行 Defensive Aggregation · SnapKV 原文"无损"实测 RULER 20% = 39.0 · DefensiveKV = 85.3 · LayerDefensiveKV = 91.4 · 单 RTX 4090 ≤1 小时 RULER 10% · arXiv ID 待核)+ kv-cache-analyzer CLI bs258q(MIT · 多场景 LRU hit rate 实测 llama-3-70b · customer-support ~92%/67% · code-assistant ~92%/60% · RAG QA ~93%/30% 新鲜度优先 · 512 MB 文件限制 + JSON depth limit + 防 symlink + CI/CD check_cache_regression())+ llm-d KV Cache 路由 already-upstreamed vLLM v0.23(llmd-fs-connector==0.23 = vLLM v0.23 FS tier · KVEvents 架构 · vLLM pod → 事件流 → KV Block Index → Scheduler 打分 → 路由决策 · 跨 Pod 缓存共享)+ vLLM 8 月三件 blog 汇总(vllm-project.github.io/blog 2026-07-29 vLLM Reaches 25K Total TPS/GPU on Qwen3.5 + 2026-08-06 Decode Context Parallelism + 2026-08-07 Efficient Decode Context Parallelism** + 2026-04-21 State of FP8 KV-Cache and Attention Quantization)+ TurboQuant 数字矛盾警示(Google TurboQuant ICLR 2026 提及 arXiv 2605.19660 · jay 6-11 = KV cache 2.69-4.4× · AIxFunda Substack 2026-08-22 = 6× + 8× + H100 零精度损失 · 不同 model family/精度/上下文长度评测条件需 PDF 核验 · SGLang PR #21617/21618 状态需 GH 跟踪)+ 2 件邻接升级(RMM arXiv:2608.13426 paper_card 952 主分类 llm-infra 邻接升级候选 ★ 中档 · Power Law Graph Attention arXiv:2608.10288 paper_card 920 邻接候选 ☆)+ §IX 54 沿用 FlashPrefill V2 arXiv:2608.19758 paper_card 1039 + InferScale arXiv:2607.27090 paper_card 待建 + Online KV Cache Compaction arXiv:2608.00902 paper_card 待建 + DualPath arXiv:2602.21548v2 paper_card 139 + Chain-of-Experience arXiv:2608.18027 paper_card 1045 + Cross-Model KV Cache Transfer arXiv:2608.03893 paper_card 待建 + OasisKV arXiv:2608.08097 paper_card 待建 + vLLM 0.27.0 = CVE-2026-73558 修复门槛 + §IX 53 沿用 30+ 件 + §IX 52 沿用 18 件 + §IX 51 沿用 16 件 + §IX 50 沿用 13 件 + §IX 49 沿用 12 件 + §IX 48 沿用 15 件 + §IX 47 沿用 15 件 + §IX 45-46 沿用 28 件。
(2) 推理调度 9+1+1+2+1+1+2+1 学派(沿用 §IX 48-55 + §IX 56 沿用 = CoRun 候选学派第 16 件)+ §IX 56 推理调度学派沿用 §IX 55 = CoRun arXiv:2608.14376(连续 batching 形状固定 + prefill 隔离 + decode pad + deterministic collectives + 15-324% 吞吐 + bit-identical 输出)锚入 + 沿用 §IX 52 EuroSys 2026 FlexPipe + TokenFlow + HPDC 2026 ATLAS + IEEE DCOSS-IoT 2026 Best Paper + §IX 51 NVIDIA Dynamo 1.0 + vLLM V1 + Qwen3.8-2.4T-A95B + KServe v0.17 + llm-d CNCF v0.7 + MCP 2026-07-28 stateless + Nexus 2507.06608 + Not All Prefills 2603.13358 + Mix-Quant + KVServe + §IX 50 OpScale arXiv:2608.13499 + §IX 56 立基础延展邻接级 = vLLM Conference 8-25 Roadmap Q3 六轴官方公告(Flat Model + MRV2 + 多级 KV Offloading + 1000+ TPS 推测解码 + 量化 KV Cache 生产级压缩 + llm-d 推进 + Rust Frontend 生产化 + SIG Spec Decode Q3 + Cold Start Q3 子主题 6 件 + Sprint 机制取代 Q2 论坛形式 · 当前 sprint = GLM5.2 + DSpark)+ TGI EOL + Stripe 73% + SGLang v0.4 调度器 <2% + llm-d KV Cache 路由 already-upstreamed vLLM v0.23 + Spheron 2026 vLLM 1,850/SGLang 1,920/TRT-LLM 2,100 tok/s + ServerGurus PD disaggregation(p99 -90%/GPU 成本 -40%)+ HLD Blog 三件 PD disaggregation + vLLM 8 月 blog 三件 + 推理框架 <24h CVE 响应 SOP。
(3) KV Cache 19 → 21 路线(沿用 §IX 53-54 + §IX 56 邻接升级 3 件 = 第 20 路线 + 第 21 路线 + DualPath + PIM-DIMM HotInfra'26 二次量化 + DistillCache + ReCache + Topology-Aware v2)+ §IX 56 KV Cache 路线沿用 §IX 54/55 + 3 件邻接升级 = InferScale arXiv:2607.27090 第 20 路线(GPU 原生 KV Injection + Jasper <25 MB/conversation)+ Online KV Cache Compaction arXiv:2608.00902 第 21 路线(长程 Agent 在线压缩)+ DualPath arXiv:2602.21548v2 邻接级(Storage → Decode → Prefill 1.87×/1.96×)+ HotInfra'26 PIM-DIMM 39.7× Cost/Mtoken + §IX 56 立基础延展邻接级 3 件 = DistillCache arXiv:2608.08878(KL 引导自适应 KV Cache 驱逐 + 5 维特征 + 对标 H2O/SnapKV · 自适应驱逐算法新基线 · paper_card 待建)+ ReCache arXiv:2608.19662(动态工具调用 agentic KV 缓存复用首个专项 · 与 Chain-of-Experience 邻接 · paper_card 待建)+ Topology-Aware Data Movement arXiv:2607.28633v2(PD disaggregation 70B 模型 KV cache 1.3 GB/请求 + 网络拓扑感知数据传输优化 + v2 修订 2026-08 + 与 §IX 53 PipeMax + DualPath 同方向 · paper_card 待建)+ §IX 55 立基础延展邻接级 = DefensiveKV ICLR 2026(SnapKV 39.0/85.3/91.4 · 压缩安全方向补位)+ kv-cache-analyzer CLI(RAG QA 30% within-session)+ llm-d KV Cache 路由 upstreamed vLLM v0.23(分布式 KV 索引补位)+ TurboQuant 数字矛盾警示(arXiv 2605.19660 + 数字差异待核)+ §IX 53 全部 17 路线 + §IX 52 KV Cache 基础设施重构四件套 + §IX 51 KV Cache Transform Coding + Queueing-Theoretic + §IX 49 CXL+PIM + C2KV KDD 2026 第 13 路线 + Awesome-KV-Cache-Optimization(jjiantong 378★·HotPrefix 前缀热力感知调度)+ §IX 52 Online KV Scheduling MC-SF + Cross-Model Memory Transfer Engram + Pipeline 全栈 PagedAttention + 邻接级补强。
(8) 稀疏注意力 · Linear Attention · Mamba-3 · Hybrid SSM(沿用 §IX 51 + §IX 54 + §IX 56 H200 FP8 47.26× 升级 = FlashPrefill V2 稀疏注意力主轴候选)+ §IX 56 稀疏注意力沿用 §IX 54 = 🔴 FlashPrefill V2 arXiv:2608.19758 paper_card 1039 已建(block-sparse prefill + mean correction + FA3/4 对齐 sparse attention + SGLang backend 集成 · §IX 56 新增 H200 FP8 128K 47.26× 升级 + SGLang 集成路径 + H20 存量工程意义 · 128K TTFT -2.1× ~ -4.8× BF16/FP8)+ §IX 53 CoRun = 调度层稀疏化 + FlashPrefill V2 = attention 计算层稀疏化 + §IX 55 邻接升级 Power Law Graph Attention arXiv:2608.10288 paper_card 920(claim 待核)+ HF Daily 8-24 沿用 8-21 立标池 + 立基础延展(沿用)。
(9) 量化经济学(沿用 §IX 53 + §IX 54 Particula Tech H100 + Schema 7× + TGI 维护 + SGLang 400K+ GPU + Cursor/LinkedIn/Azure/xAI Grok 3 + EAGLE 多 token + ServerMO 安全部署 + HotInfra'26 PIM-DIMM + Particula 三源对照)+ §IX 56 量化经济学沿用 §IX 54 + §IX 56 🟡 TGI EOL + Stripe 73% + H100 三方新源 立基础延展候选(TGI EOL 2025-12 维护模式 2026-08 官方二次确认 · 推荐迁移 vLLM/SGLang · Stripe 每日 5000 万调用 GPU 舰队缩至 1/3 成本 -73% · PremAI/Particula/Atomic/AIMultiple H100 基准对照 · SGLang v0.4 调度器 <2% · DeepSeek V3 MLA 3.1× · EAGLE 1.8×/1.5× · bench_serving · The AI Engineer 四选一决策框架)+ §IX 56 🟡 vLLM Conference 8-25 Roadmap Q3(量化 KV Cache 生产级压缩 + 1000+ TPS + Cold Start Q3)+ §IX 55 🟡 TurboQuant 数字矛盾警示 沿用(arXiv 2605.19660 · jay 6-11 = 2.69-4.4× · AIxFunda = 6×/8× · 数字差异显著)+ §IX 55 🟡 vLLM 8 月 blog 汇总(State of FP8 KV-Cache and Attention Quantization 2026-04-21 + Decode Context Parallelism)+ §IX 55 🟡 RMM arXiv:2608.13426 邻接升级候选 沿用(训练无关输入自适应矩阵乘 1B-70B · 与 AWQ/GPTQ 正交可叠加)+ 沿用 §IX 53 全部 5 CSDN inference 量化 + §IX 52 7 CSDN inference 量化 + §IX 49 沿用 12 件 + §IX 48 沿用 15 件 + §IX 47 沿用 15 件 + §IX 45-46 沿用 28 件。
(10) 7 大顶会议 KV-cache + KV cache 三层算力栈 + 顶会密集部署 + 系统栈(沿用 §IX 53 全部 + §IX 54 立基础延展 4 件 HotInfra'26 + Particula Tech + AI Agents Stack Eval gap + TGI 维护模式 + ServerMO 安全部署命令)+ §IX 56 Vector DB 沿用 §IX 54 Qdrant v1.14 + CNCF KubeCon NA + Red Hat AI Inference llm-d + A2A 治理 + vToken + ICMSP/NIXL + MemoryAlloy(同 §1.(3))作为 §1.(10) 顶会密集部署邻接补丁 + §IX 56 🟠 K8s+LLM Inference 完整数值层 立基础延展候选级补强 1 件(Mistral Large 123B 显存三分 + KEDA + GIE + DRA/LWS + KServe v0.17)+ §IX 56 🟠 Spheron 2026 + ServerGurus PD disaggregation + HLD Blog 三件 + vLLM Conference 8-25 Roadmap Q3 + TGI EOL + Stripe 73% 立基础延展候选级补强 2-6 件(Spheron vLLM 1,850/SGLang 1,920/TRT-LLM 2,100 tok/s 50 并发实测 · ServerGurus p99 latency -90% / GPU 成本 -40% · HLD Blog 2026-08-16/18/20 PD disaggregation 三件 · vLLM Conference 8-25 Roadmap Q3 6 主轴 + Cold Start Q3 6 子主题 · TGI EOL + Stripe 73% 案例)+ §IX 56 🟠 kv-cache-analyzer CLI + llm-d KV Cache 路由 upstreamed vLLM v0.23 + vLLM 8 月三件 blog + TurboQuant 数字矛盾警示 + 3 件 KV Cache 新论文邻接升级 立基础延展候选级补强 3-8 件 + §IX 54 沿用 EuroSys 2026 系统论文 6 件(同 §1.(2))+ §IX 53 沿用 HPDC 2026 ATLAS + IEEE DCOSS-IoT 2026 Best Paper Award(同 §1.(2))。
横切层(11-13)
(11) Kernel/AI 自动化/Harness(沿用 §IX 53 全部 + §IX 54 立基础延展 FlashPrefill V2 + InferScale + Online KV Compaction + Cross-Model Memory Transfer + AI Agents Stack 2026 Edition + Eval 37pp gap + Chain-of-Experience + TGI 维护模式 + ServerMO 安全部署命令)+ §IX 56 🟠 FlashPrefill V2 H200 FP8 47.26× 升级 = §IX 56 §1.(11) + §1.(13) 立基础延展第 1 件 + 稀疏注意力算子层二次升级 + §IX 56 🟠 vLLM Conference 8-25 Roadmap Q3 = §IX 56 §1.(11) + §1.(13) 立基础延展第 2 件 + 推理引擎版本治理 + 生产稳定性提升 + 自动化测试 + §IX 56 🟠 Photon 2.0 Physical AI megakernel = §IX 56 §1.(11) + §1.(13) 立基础延展第 3 件 + 推理引擎"专用化分支"补强 + §IX 56 🟠 3 件 KV Cache 新论文邻接升级(DistillCache + ReCache + Topology-Aware v2) = §IX 56 §1.(11) + §1.(13) 立基础延展第 4 件 + KV Cache 自适应驱逐 + agentic 复用 + 分布式数据移动三方向补强 + §IX 56 🟠 TGI EOL + Stripe 73% + H100 三方新源 = §IX 56 §1.(11) + §1.(13) 立基础延展第 5 件 + 推理框架选型决策树 + 生产成本案例 + §IX 55 🟠 RMM arXiv:2608.13426 paper_card 952 邻接升级 沿用 + §IX 55 🟠 Power Law Graph Attention arXiv:2608.10288 paper_card 920 邻接升级 沿用 + 沿用 §IX 52 全部 5 件 + §IX 51 全部 16 件 + §IX 50 沿用 全部。
(12) End-to-End Pipeline 7 件(沿用 §IX 38-55 轮 7 件基础 + §IX 55 立基础延展 10 件 KV Cache + Serving Security + Pipeline 邻接)
§IX 56 §1.(12) Pipeline 沿用 + 5 件新签:
- (i) KV Pool 沿用 §IX 55 全部(vToken arXiv:2608.13263 + ICMSP/NIXL + MemoryAlloy)+ Awesome-KV-Cache-Optimization(jjiantong 378★·HotPrefix 前缀热力感知调度= §IX 52 立基础延展第 1 件)+ §IX 55 立基础延展 4 件 = InferScale arXiv:2607.27090 GPU 原生 KV Injection + Online KV Cache Compaction arXiv:2608.00902 + DualPath arXiv:2602.21548v2 KV-Cache 加载重平衡 + HotInfra'26 PIM-DIMM 二次量化(详见 §1.(3))+ KV Cache 互联网级重构四件套(An Internet for the KV Cache / PipeMax / Online KV Scheduling MC-SF / Reimagining HotInfra'26 PIM-DIMM)(详见 §1.(3))+ §IX 55 立基础延展第 1-4 件 = DefensiveKV ICLR 2026(SnapKV 39.0/85.3/91.4)+ kv-cache-analyzer CLI(可观测性)+ llm-d KV Cache 路由 upstreamed vLLM v0.23 + TurboQuant 数字矛盾警示(详见 §1.(3))+ §IX 56 立基础延展第 4 件 = DistillCache arXiv:2608.08878(KL 引导自适应 KV 驱逐 · 对标 H2O/SnapKV)+ ReCache arXiv:2608.19662(agentic KV 复用首个专项 · 与 Chain-of-Experience 邻接)+ Topology-Aware Data Movement arXiv:2607.28633v2(PD disaggregation 70B 1.3 GB/请求 · v2 修订 2026-08)
- (ii) Engine:🔴 FlashPrefill V2 arXiv:2608.19758 block-sparse prefill 块稀疏 attention + 128K TTFT -2.1× ~ -3.4× BF16 + -3.7× ~ -4.8× FP8 + §IX 56 H200 FP8 47.26× 升级 + SGLang 注意力后端集成路径 + H20 存量工程意义(paper_card 1039 已建)+ 🟠 Photon 2.0(Moondream · 2026-08-03 · Physical AI 专用 megakernel · H100 ChartQA 全面优于 vLLM/SGLang)+ 🟠 Particula Tech SGLang vs vLLM H100 Benchmark(SGLang +29%/+117%)+ 🟠 SGLang vs vLLM Schema 7× 差距 + 🟠 TGI EOL 官方二次确认 + 推荐迁移 vLLM/SGLang + 🟠 SGLang 400K+ GPU + Cursor/LinkedIn/Azure/xAI Grok 3 采纳清单 + 🟠 EAGLE 多 token 推测 batch=1 1.8× / batch=32 1.5× + 🟠 ServerMO 安全部署命令(--host 127.0.0.1)+ 🟠 vLLM 0.27.0 = CVE-2026-73558 修复门槛 + §IX 56 🟠 vLLM Conference 8-25 Roadmap Q3 六轴官方公告(Flat Model + MRV2 + 多级 KV Offloading + 1000+ TPS 推测解码 + 量化 KV Cache 生产级压缩 + llm-d 推进 + Rust Frontend 生产化 + SIG Spec Decode Q3 = production agentic workload + high-interactivity premium tokens · github.com/vllm-project/vllm/issues/48168 + vllm.ai/events/vllm-conference/2026)+ §IX 56 🟠 Stripe 73% 成本案例 + SGLang v0.4 调度器 <2% CPU 开销 + DeepSeek V3 MLA 3.1× + bench_serving 命令清单(vLLM Blog 2026-07-15 + PremAI/Particula/Atomic/AIMultiple 8 月对照 · The AI Engineer 四选一决策框架 Ollama/SGLang/vLLM/TensorRT-LLM/llama.cpp)+ 沿用 §IX 53 CoRun + SGLang Advanced CUDA Graph + DeepSeek-V4-Pro H20 + Miles v0.1 + vLLM 0.27.1 release + DeployBase A100 + Lyceum + Stripe 73% + GLM-5.3 + CSDN inference 实战 8 件
- (iii) Sched:🔴 CoRun 候选学派级延展(同 §1.(2) + §1.(1) = 调度 + graph 配置层双层优化)+ 🟠 Particula Tech H100 Benchmark(同 §1.(2) · SGLang RadixAttention cache-aware 调度 vs vLLM PagedAttention continuous batching)+ 🟠 KV Cache 互联网级重构四件套(详见 §1.(3))+ 🟠 EuroSys 2026 系统论文 6 件(沿用 §IX 52 详见 §1.(2))+ 🟠 HPDC 2026 ATLAS + IEEE DCOSS-IoT 2026 Best Paper Award Collaborative Edge TPU(沿用 §IX 52 详见 §1.(2))+ §IX 56 🟠 vLLM Conference 8-25 Roadmap Q3 SIG Spec Decode Q3 + Cold Start Q3(production agentic workload + high-interactivity premium tokens + 降低冷启动时间 + Scheduler 重构 + KV Cache Manager 重新设计 + Sprint 机制取代 Q2 论坛形式 · 当前 sprint = GLM5.2 + DSpark)+ §IX 56 🟠 K8s+LLM Inference 完整数值层 framsouza 沿用(KEDA KV cache pressure + GIE 前缀路由 + DRA/LWS + KServe v0.17 · §IX 55 立基础延展第 5 件)+ §IX 56 🟠 Spheron 2026 50 并发实测 + ServerGurus PD disaggregation p99 -90% / GPU 成本 -40% + HLD Blog 2026-08-16/18/20 三件 PD disaggregation(§IX 55 立基础延展第 6 件)
- (iv) Service Concurrency Safety:沿用 §IX 53-55 + Reasoning 模式吞吐 -68% / 准确率 +7.5pp 开关代价 + The Silent Hyperparameter arXiv:2605.19537 + §IX 56 沿用 CVE-2026-73558 多租户 KV 泄漏核验 + lmdeploy CVE-2026-33626 SSRF 武器化警示
- (v) Harness Reliability:🟡 Harness Engineering arXiv:2607.08028 + Context Engineering arXiv:2603.09619 + AI Serving 形式化优化 arXiv:2605.01280 + AI Agents Stack 2026 + Eval 37pp gap + Context-Bench / Recovery-Bench / Terminal-Bench(沿用 §IX 52-54)+ §IX 56 🟠 kv-cache-analyzer CLI + check_cache_regression() CI/CD + DefensiveKV ICLR 2026 + vLLM Conference 8-25 Roadmap Q3 = 推理引擎版本治理 + 生产稳定性提升 + 自动化测试 + Sprint 机制
- (vi) Agent Security:沿用 §IX 53-55 全部 + 🔴 vLLM CVE-2026-73558 跨用户 KV 数据泄漏(NVD/OpenCVE/GHSA-7m6h-x95x-82q5 三源独立确认 · <0.27.0 影响 · ≥0.27.0 修复 · 多租户部署立即核查版本)+ 🔴 LMDeploy CVE-2026-33626 SSRF 12h31m 武器化(Sysdig 2026-08-19 · 端口扫描 + 内网探测利用模式 · 推理框架 <24h 补丁响应 SLA 新基准)+ 🟠 SGLang CVE-2026-3059/3060/3989 多模态/分拆去序列化(ZMQ 21950 + --enable-multimodal-gen/--enable-disaggregation 启动检查)+ 🟠 ServerMO 安全部署命令(--host 127.0.0.1 严格绑定 + --mem-fraction-static 0.8)+ 🟠 推理框架 <24h CVE 响应 SOP(监控源 NVD + CISA KEV + GitHub Advisories + OpenCVE · 关键 CVE <24h · 高危 <72h · 推理 API 永不绑定 0.0.0.0)+ §IX 56 沿用 §IX 55 全部 + TGI EOL 官方二次确认(2025-12 维护模式生效 2026-08 HuggingFace 官方确认推荐迁移 vLLM/SGLang)+ Stripe 73% 成本案例(vLLM Blog 2026-07-15)
- (vii) Eval + Inference Engineering 67 → 71 件套扩面:§IX 56 新增 5 件 = FlashPrefill V2 H200 FP8 47.26× 升级 + vLLM Conference 8-25 Roadmap Q3 六轴官方公告 + Photon 2.0 Moondream Physical AI 专用 megakernel + 3 件 KV Cache 新论文邻接升级(DistillCache + ReCache + Topology-Aware v2)+ TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源 = 5 + 3 + 1 = 9 件扩面 + 沿用 §IX 55 §IX 54 §IX 53 §IX 52 §IX 51 §IX 50 §IX 49 §IX 48 §IX 47 全部 + 第 71 件套 = 推理工程学科化 §IX 56 扩面完成
(13) 边界扩展(沿用 §IX 38-55 + §IX 56 新增 ≥ 5 子轴候选)= 共 ≥ 136 子轴候选(§IX 55 ≥ 131 → §IX 56 ≥ 136 扩面)。反方 #91/#92/#93/#94 + 第 12 + 23 + 24 + 25 + 26 类风险候选分配沿用 + §IX 56 新增 ≥ 10 P0 待核警示 = FlashPrefill V2 H200 vs H20 加速比差异 + vLLM Conf 8-25 1000+ TPS 目标非已实现 + Stripe 73% 公司自报待独立验证 + llm-d Gateway API 集成形态需原文核验 + Photon 2.0 仅二手摘要 + 3 件 KV 新论文(DistillCache/ReCache/Topology-Aware v2)均二手摘要 + DistillCache 对标 H2O/SnapKV 公平性 + ReCache 工具集评测未公开 + Topology-Aware 与 §IX 53 PipeMax 重合独立核验 + PremAI 数字无原始命令 + Particula 无复现步骤 + SGLang v0.4 <2% 开销 PR/代码核验 + 立标池双向锚 6 向并存沿用 + 立标信号强度 ≠ 立标等级评估 v45 首次机制化沿用 + v56 第三次稳态 + 反思棒 第 23 次 + 跨实例互评 8-23 evening 棒 第 8 件 + llm-infra 双端缺位 第 23 例 + spark llm-infra-e1prep 8-23 evening 棒兑现 5 件补位主线 + 5 件延后(4 件 8-23 新增:DistillCache/ReCache/Topology-Aware + Photon 2.0 物理 AI)+ HF Daily 8-24 立标池双向锚第 10 日稳态(0 件 llm-infra 主轴 net-new)+ 立标饱和度机制 v47 三态切换 + 8-24 paper_cards 主分类 llm-infra net-new 0 件(连续第 2 个零新增日 · 沿用 §IX 55 0 件主轴 + §IX 54 4 arXiv 主轴 + 立基础延展 6 件 + §IX 56 5 件)+ 5 件工程化层级 net-new + 1 件工具链 = 立标池饱和度供给侧 v55 反转"主分类 paper_card 净增 0 件 + 方法/系统级 net-new 6 件 + 工程化层级 net-new 6 件"双锚点 → v56 维持"主分类 paper_card 净增 0 件 + 工程化层级 net-new 5 件 + 邻接级 net-new 3 件"三锚点 + 推理工程学科化第 9 维 67 → 71 件套扩面 + 边界扩展 131 → ≥ 136 子轴候选扩面 + 跨实例标签二档法首次传染到活文档主线 + 立标等级判定四档法首次传染到活文档主线 + 反方三段式与 §2.13 量化沿用。
2. 关键工作与脉络(精简索引)
§IX 56 轮新增 5 件关键工作 = (1) 🟠 FlashPrefill V2 H200 FP8 47.26× 升级 + SGLang 集成路径 + H20 存量工程意义(H200 FP8 128K 上下文 47.26× 加速 vs FA2 · 30.49× vs FA3/4 密集基线 · BF16 27.19× · 均值修正项 + PackGQA + warp specialization · 兼容 FA3/4 而非 Fork FA2 · SGLang 注意力后端集成路径 · 国内 H20 算力存量工程价值 · jay 8-23 engineering 棒增量 1 同源 spark 8-23 llm-infra e1prep 增量 1)§1.(8) + §1.(11) + §1.(13) 立基础延展第 1 件 + (2) 🟠 vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(github.com/vllm-project/vllm/issues/48168 + vllm.ai/events/vllm-conference/2026 · SIG Core 6 主轴 = Flat Model top 20 架构迁移 + MRV2 迁移 + MRV1 弃用 + 生产稳定性 + Scheduler 重构 + KV Cache Manager 重新设计 + Rust Frontend 生产化 · + Cold Start Q3 子主题 6 件 = 降低冷启动时间 Issue #48193 · + 基础设施子主题 = release-gating 准确性 + 性能回归测试覆盖度 · 自动 trace 上传与分析 · 扩展硬件覆盖 · + Sprint 机制取代 Q2 论坛形式 = GLM5.2 + DSpark 当前 sprint · + SIG Spec Decode Q3 重点 = production agentic workload + high-interactivity premium tokens · Q2 已达 TensorRT-level speed-of-light 性能 · + 会议详情 = vLLM Conference 由 Inferact(Woosuk Kwon + Simon Mo + Zachary Xi)主办 · co-located with Anyscale Ray Summit 2026-08-24 ~ 26 San Francisco · Day 1 Tuesday August 25 9:30 AM Keynotes + 12:30 PM State of vLLM 2026 · + NVIDIA 合作 session = Tuesday 1:15-1:45 PM PT "NVIDIA and vLLM Full-Stack Collaboration for DeepSeek and MiniMax Performance")§1.(1) + §1.(2) + §1.(12) 立基础延展第 2 件 + (3) 🟠 Photon 2.0(Moondream · 2026-08-03)= Physical AI 专用 megakernel 引擎(H100 ChartQA 全面优于 vLLM/SGLang · 推理引擎层"专用化分支"补强 · 适用场景 = 多模态 / Physical AI · 实测条件需 Moondream 官方 blog 核验)§1.(1) 立基础延展第 3 件 + (4) 🟠 3 件 KV Cache 新论文邻接升级(DistillCache arXiv:2608.08878 KL 引导自适应 KV Cache 驱逐 · 5 维特征 · 对标 H2O/SnapKV · paper_card 待建 + ReCache arXiv:2608.19662 动态工具调用 agentic KV 缓存复用首个专项 · 渐进式披露 + 工具集动态扩展 + schema 上下文管理 · 与 Chain-of-Experience 邻接方向互补 · paper_card 待建 + Topology-Aware Data Movement arXiv:2607.28633v2 PD disaggregation 70B 模型 KV cache 1.3 GB/请求 · 网络拓扑感知数据传输优化 · 2026-08 v2 修订 · 与 §IX 53 PipeMax + DualPath + AMPD 同方向 · paper_card 待建)§1.(3) + §1.(11) + §1.(12) 立基础延展第 4 件 + (5) 🟠 TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源(TGI 2025-12 进入维护模式 · 只接受 minor bug fix PR · HuggingFace 官方 2026-08 二次确认 · 推荐迁移 vLLM/SGLang · Stripe 每日 5000 万调用 GPU 舰队缩至 1/3 成本 -73% PagedAttention 60-80% 碎片消除 · 双周发版节奏 + 每日性能基准 + 精度评估 · GLM-5.2 on 24× NVIDIA B300 Day-0 · Kimi K3 preview 2026-07-21 · PremAI/Particula/Atomic/AIMultiple H100 基准对照 · SGLang v0.4 调度器 <2% CPU 开销 · DeepSeek V3 MLA 3.1× · EAGLE 1.8×/1.5× · bench_serving 命令清单 · The AI Engineer 四选一决策框架 Ollama/SGLang/vLLM/TensorRT-LLM/llama.cpp)§1.(1) + §1.(9) + §1.(12) 立基础延展第 5 件 + §IX 56 立基础延展候选合计 5 件 + 3 件邻接升级 + ≥ 10 P0 待核警示.
沿用历史快照(精简):§IX 55 沿用 8 件(K8s+LLM Inference 完整数值层 framsouza + DefensiveKV ICLR 2026 + kv-cache-analyzer CLI bs258q + llm-d KV Cache 路由 upstreamed vLLM v0.23 + vLLM 8 月三件 blog 汇总 + TurboQuant 数字矛盾警示 + RMM arXiv:2608.13426 paper_card 952 邻接升级候选 ★ 中档 + PLGA arXiv:2608.10288 paper_card 920 邻接候选 ☆);§IX 54 沿用 30+ 件(FlashPrefill V2 + InferScale + Online KV Cache Compaction + DualPath + CVE trio + Particula Tech H100 + Schema 7× + TGI 维护 + AI Agents Stack Eval gap + Chain-of-Experience + Cross-Model KV Cache Transfer + OasisKV + HotInfra'26 PIM-DIMM + ServerMO 安全部署命令 + vLLM 0.27.0 = CVE 修复门槛);§IX 53 沿用 30+ 件(CoRun + DASH + HBF Sucks + SGLang Advanced CUDA Graph + DeepSeek-V4-Pro H20 + Miles v0.1 + Cross-Model Memory Transfer + CSDN inference 实战 8 件 + DeployBase A100 + Lyceum + Stripe 73% + KV Cache 基础设施重构四件套 + vLLM 0.27.1 + GLM-5.3 + MCP 安全审计 + Qdrant v1.14 + CNCF KubeCon NA + Red Hat AI Inference llm-d + A2A 治理 + 阿里 Qwen-UI-Agent);§IX 52 沿用 18 件;§IX 51 沿用 16 件;§IX 50 沿用 13 件;§IX 49 沿用 12 件;§IX 48 沿用 15 件;§IX 47 沿用 15 件;§IX 45-46 沿用 28 件;§IX 44 沿用 14 件;§IX 41-43 沿用 33 件;§IX 35-40 沿用 30+ 件。
新增 arXiv ID(§IX 56 轮):§IX 56 主轴 0 件 net-new · 沿用 §IX 55 全部 4 件 + 1 件邻接级 + 2 件研究前沿 + 5 件 CVE 主轴级 + §IX 56 邻接升级 3 件研究前沿 = arXiv:2608.08878(DistillCache · KL 引导自适应 KV Cache 驱逐 · 5 维特征 · paper_card 待建 · 主分类 llm-infra 邻接升级候选 ★ 中档)+ arXiv:2608.19662(ReCache · 动态工具调用 agentic KV 缓存复用首个专项 · paper_card 待建 · 主分类 llm-infra 邻接升级候选 ★ 中档)+ arXiv:2607.28633v2(Topology-Aware Data Movement · PD disaggregation 70B 模型 1.3 GB/请求 · v2 修订 2026-08 · paper_card 待建 · 主分类 llm-infra 邻接升级候选 ★ 低档)+ §IX 55 沿用 2 件邻接升级(arXiv:2608.13426 RMM paper_card 952 + arXiv:2608.10288 PLGA paper_card 920)+ §IX 54 沿用 4 件主轴(paper_card 1039 2608.19758 + paper_card 待建 2607.27090 + paper_card 待建 2608.00902 + paper_card 139 2602.21548v2 主分类 llm-infra)+ 1 件邻接级(paper_card 1045 2608.18027)+ 2 件研究前沿(2608.03893 + 2608.08097)+ arXiv:2608.18050(沿用 §IX 53 Cross-Model Memory Transfer Engram · 邻接级)+ 5 件 CVE 主轴级(CVE-2026-73558 + CVE-2026-33626 + CVE-2026-3059 + CVE-2026-3060 + CVE-2026-3989)+ §IX 53 沿用 5 件 + §IX 52 沿用 5 件 + §IX 51 沿用 6 件 + §IX 50 沿用 3 件 + §IX 49 沿用 1 件 + §IX 48 沿用 9 件。
新增 CVE ID(§IX 56 轮):0 件 net-new · 沿用 §IX 55 全部 5 件 + §IX 53 沿用 16 CVE + 第 18-23 类风险候选 + 第 12 + 24 + 25 + 26 类风险候选沿用 = CVE-2026-73558(vLLM 跨用户 KV 数据泄漏 · 沿用 §IX 54 · NVD/OpenCVE/GHSA 三源独立确认 · <0.27.0 影响 · ≥0.27.0 修复)+ CVE-2026-33626(LMDeploy SSRF · 沿用 §IX 54 · Sysdig 2026-08-19 · 12h31m 武器化 · 0.12.2 修复)+ CVE-2026-3059/3060/3989(SGLang · 沿用 §IX 54 · Orca Security 2026-08 · ZMQ broker + 分拆编码器 + 崩溃转储重放)+ 沿用 16 CVE 全集 + 第 18-23 类风险候选 + 第 12 + 24 + 25 + 26 类风险候选沿用。
新增 URL(§IX 56 轮):5 件工程化补位工具仓库/博客 + 3 件邻接升级论文 + 2 件 vLLM Conference 官方 URL = github.com/vllm-project/vllm/issues/48168(vLLM Roadmap Q3 2026 · 6 主轴 + Cold Start Q3 子主题)+ vllm.ai/events/vllm-conference/2026(First vLLM Conference at Ray Summit · 8-24 ~ 26 San Francisco · Day 1 Tuesday August 25 9:30 AM Keynotes + 12:30 PM State of vLLM 2026 · NVIDIA 合作 session Tuesday 1:15-1:45 PM PT "NVIDIA and vLLM Full-Stack Collaboration for DeepSeek and MiniMax Performance")+ moondream.ai/blog/photon-2-launch(Photon 2.0 Physical AI 专用 megakernel 引擎 · H100 ChartQA 全面优于 vLLM/SGLang · 2026-08-03)+ premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026(PremAI H100 基准 SGLang 16,200 / vLLM 12,500 / LMDeploy 16,200)+ vllm.ai/blog(Stripe 73% 成本案例 · 每日 5000 万调用 · GPU 舰队缩至 1/3 · PagedAttention 60-80% 碎片消除 · 2026-07-15)+ blog.csdn.net/brandy/article/details/155517690(SGLang vs vLLM 选型 RadixAttention + PagedAttention + Llama3-70B-FP8 2×H100 场景表)+ blog.csdn.net/u013701860/article/details/148295809(bench_serving 工具命令 SGLang + vLLM backend + pd-separated)+ anyscale.com/ray-summit/2026(Ray Summit 2026 · 8-24 ~ 26 San Francisco · co-located with vLLM Conference)+ nvidia.com/en-us/events/ray-summit(NVIDIA at Ray Summit 2026 · NVIDIA and vLLM Full-Stack Collaboration session)+ arxiv.org/abs/2608.08878(DistillCache 邻接升级候选 ★ 中档)+ arxiv.org/abs/2608.19662(ReCache 邻接升级候选 ★ 中档)+ arxiv.org/abs/2607.28633v2(Topology-Aware Data Movement v2 修订 邻接升级候选 ★ 低档)+ §IX 55 沿用全部 URL 集合。
3. 共识与争议
3.1 共识(C1-C195, 195 条)
C191-C195(§IX 56 轮新增 5 条 · 精简):C191 🟠 FlashPrefill V2 H200 FP8 47.26× 升级 + SGLang 集成路径 + H20 存量工程意义(H200 FP8 128K 上下文 47.26× 加速 vs FA2 · 30.49× vs FA3/4 密集基线 · BF16 27.19× · 均值修正项(mean correction term)= 极端稀疏度下压制近似误差 · 算子设计 PackGQA + warp specialization · 兼容 FA3/4 而非 Fork FA2 · 原生支持 paged KV cache + continuous batching(vLLM/SGLang 生态兼容)· SGLang 注意力后端集成路径明确 · 国内 H20 存量意义 = 国内算力 H20 存量可观 · 该方向具有直接工程落地价值 · jay 8-23 engineering 棒增量 1 同源 spark 8-23 llm-infra e1prep 增量 1)+ §IX 56 §1.(8) + §1.(11) + §1.(13) 立基础延展第 1 件 + 稀疏注意力算子层二次升级;C192 🟠 vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(github.com/vllm-project/vllm/issues/48168 + vllm.ai/events/vllm-conference/2026 · SIG Core 6 主轴 = ① 完成 Flat Model 迁移 top 20 model architectures + 确保新 day-0 模型 Flat Model only · ② 完成 Model Runner V2 迁移 + MRV1 弃用 · ③ 生产稳定性提升 + 失败 ergonomic 改进 · ④ Scheduler 重构 · ⑤ KV Cache Manager 重新设计 · ⑥ Mark Rust Frontend + 重构 tool-calling 实现 = production ready · + Cold Start Q3 子主题 = 降低冷启动时间 Issue #48193 · + 基础设施子主题 = release-gating 准确性 + 性能回归测试覆盖度 · 自动 trace 上传与分析 · 扩展硬件覆盖 + 工作负载跟踪 · + Sprint 机制取代 Q2 论坛形式 = 列出每个模型的具体任务 · 当前 sprint = GLM5.2 + DSpark · + SIG Spec Decode Q3 重点 = production agentic workload + high-interactivity premium tokens · Q2 已达 TensorRT-level speed-of-light 性能 + disaggregated serving + KV offloading 成熟度 · Q3 重点 = production agentic + premium tokens · + 第 6 主轴 Rust Frontend 状态 = 实验阶段 PR #40848/#43283 已合并主线树 → production ready 目标 · + 会议详情 = vLLM Conference 由 Inferact(Woosuk Kwon + Simon Mo + Zachary Xi)主办 · co-located with Anyscale Ray Summit 2026-08-24 ~ 26 San Francisco · Day 1 Tuesday August 25 9:30 AM Keynotes + 12:30 PM State of vLLM 2026 · + NVIDIA 合作 session = Tuesday 1:15-1:45 PM PT "NVIDIA and vLLM Full-Stack Collaboration for DeepSeek and MiniMax Performance")+ §IX 56 §1.(1) + §1.(2) + §1.(12) 立基础延展第 2 件 + 推理引擎版本治理 + 生产稳定性提升 + 自动化测试 + Sprint 机制取代 Q2 论坛形式;C193 🟠 Photon 2.0(Moondream · 2026-08-03)= Physical AI 专用 megakernel 引擎(H100 ChartQA 全面优于 vLLM/SGLang · 推理引擎层"专用化分支"补强 · 与通用 vLLM/SGLang/TRT-LLM 互补而非竞争 · 适用场景 = 多模态 / Physical AI(机器人 / 物理交互 / 视觉动作)· 实测条件需 Moondream 官方 blog 核验 · 与 vLLM/SGLang 的对比基线是否公平(模型一致、数据一致)待核 · jay 8-23 trending 二手摘要 · moondream.ai/blog/photon-2-launch)+ §IX 56 §1.(1) 立基础延展第 3 件 + 推理引擎"专用化分支"补强;C194 🟠 3 件 KV Cache 新论文邻接升级(① DistillCache arXiv:2608.08878 = KL 引导自适应 KV Cache 驱逐 · 5 维特征(α_i 注意力质量 + ‖v_i‖₂ value 向量范数 + σ_i 跨头注意力方差 + 注意力质量 + 跨头方差)· 对标 H2O/SnapKV · 解决历史注意力模式无法预测下游生成价值 · paper_card 待建 · jay 8-23 trending 二手摘要 · 评测公平性需 PDF 核验 · ② ReCache arXiv:2608.19662 = 动态工具调用 agentic 场景 KV 缓存复用首个专项 · 渐进式披露(progressive disclosure)+ 工具集动态扩展 + schema 上下文管理 · 与 Chain-of-Experience §1.(11)/§1.(12) 邻接方向互补 · paper_card 待建 · 工具集动态扩展具体评测未公开 · ③ Topology-Aware Data Movement arXiv:2607.28633v2 = PD disaggregation 70B 模型 KV cache 1.3 GB/请求 · 网络拓扑感知数据传输优化 · 2026-08 v2 修订 · 与 §IX 53 PipeMax + DualPath + AMPD 同方向 · paper_card 待建 · 与 PipeMax/DualPath 是否重合需独立核验 · v2 修订变化未公开)+ §IX 56 §1.(3) + §1.(11) + §1.(12) 立基础延展第 4 件 + KV Cache 自适应驱逐 + agentic 复用 + 分布式数据移动三方向补强;C195 🟠 TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源(① TGI EOL = 2025-12 进入维护模式 · 只接受 minor bug fix PR · HuggingFace 官方 2026-08 二次确认 · 推荐迁移 vLLM(生产默认 / 生态最大)或 SGLang(前缀复用密集 / RAG/多轮 Agent)· jay 8-23 GitHub/HF 综合 + Substack · ② Stripe 案例 = vLLM Blog 2026-07-15 · 每日 5000 万调用 · GPU 舰队缩至 1/3 · 成本降低 73% · PagedAttention 消除 60-80% KV cache 碎片化内存浪费 · 双周发版节奏 + 每日性能基准 + 精度评估 · GLM-5.2 on 24× NVIDIA B300 Day-0 支持 · Kimi K3 preview 2026-07-21 · ③ H100 基准三方新源 = PremAI(SGLang ~16,200 / vLLM ~12,500 / LMDeploy ~16,200)+ Particula(SGLang 894 output / vLLM 413 output + TTFT 79 vs 103 + DeepSeek V3 3.1× vs vLLM + EAGLE 1.8×/1.5×)+ Spheron(vLLM 1,850 / SGLang 1,920 / TRT-LLM 2,100 tok/s 50 并发实测)+ Atomic + AIMultiple · SGLang v0.4 调度器 <2% CPU 开销(15-25% 降至)· SGLang 2026 时间线(Kimi K3 day-0 + TPU 全功能 + GLM5.2 NVFP4 500 TPS + DFlash + Spec V2 + DeepSeek-V4 + GB300 NVL72 25×)+ bench_serving 命令清单(SGLang + vLLM backend + pd-separated + 即拷即用)· The AI Engineer 四选一决策框架(Ollama 5 分钟跑起来 / SGLang 多用户共享上下文 / vLLM 请求完全唯一 / TensorRT-LLM NVIDIA 模型固定 + 1-2 周调优 / llama.cpp 边缘无 GPU/CPU 优先))+ §IX 56 §1.(1) + §1.(9) + §1.(12) 立基础延展第 5 件 + 推理框架选型决策树 + 生产成本案例.
C188-C190(§IX 55 沿用):C185-C187(§IX 54 沿用):C182-C184(§IX 53 沿用):C179-C181(§IX 52 沿用):C172-C175(§IX 50 沿用):C168-C171(§IX 49 沿用):C155-C167(§IX 48 沿用):C149-C154(§IX 47 沿用):C137-C148(§IX 45-46 沿用):C129-C136(§IX 44 沿用):C107-C117(§IX 38-41 沿用):C102-C106(§IX 37 沿用):
(沿用 C1-C101:详见 §7 沿革摘要 §VII 行)
3.2 争议(D1-D93, 93 条)
D89-D93(§IX 56 轮新增 5 条 · 精简):D89 🟠 FlashPrefill V2 H200 vs H20 加速比差异(H200 FP8 = 47.26× 加速 vs FA2 · 30.49× vs FA3/4 密集基线 · BF16 = 27.19× · H200 与 H20 在算力/带宽/架构上有差异 · H20 实际加速比需实测核验 · 不能直接套用 H200 数字做容量规划 · 建议今晚活文档接力时标注"H20 数字待实测 · H200 数字仅供参考"· 评测条件 batch size、序列长度分布、硬件环境细节需 arXiv §3-4 原文 PDF 核验);D90 🟠 vLLM Conference 8-25 Roadmap Q3 兑现风险 + Stripe 73% 数据自报性 + Photon 2.0 评测公平性(vLLM Conference 8-25 Roadmap Q3 六轴 1000+ TPS 是目标非已实现 · 兑现时间表待 8-25 会议确认 · Stripe 73% 数字来自 vLLM 官方博客(公司自报数据)需独立验证 · GLM-5.2 on 24× NVIDIA B300 Day-0 支持需 NVIDIA 硬件采购周期核验 · Kimi K3 preview(Jul 21)需实际生产部署核验 · Cold Start Q3 子主题降低冷启动时间 Issue #48193 数字待 Q3 末核实 · Sprint 机制取代 Q2 论坛形式 = 当前 sprint = GLM5.2 + DSpark · 任务具体性待跟踪 · Photon 2.0 Moondream 仅 jay 8-23 trending 二手摘要 · 实测条件(model family / 数据集 / batch size)需 Moondream 官方 blog 核验 · 与 vLLM/SGLang 的对比基线是否公平(模型一致、数据一致)待核);D91 🟠 3 件 KV Cache 新论文邻接升级评测公平性(DistillCache arXiv:2608.08878 仅 jay 8-23 trending 二手摘要 · 评测条件、公平性、实际加速比需 PDF 核验 · 是否对标 H2O/SnapKV 公平(同 baseline 模型/数据)待核 · ReCache arXiv:2608.19662 仅 jay 8-23 trending 二手摘要 · 工具集动态扩展具体评测未公开 · paper_card 待建 · Topology-Aware Data Movement arXiv:2607.28633v2 与 §IX 53/54 PipeMax/DualPath 是否重合需独立核验 · v2 修订变化内容未公开 · paper_card 待建 · arXiv ID 是否准确(2607.28633 v2)需 arXiv 官方检索确认);D92 🟡 H100 基准三方新源数据置信区间 + SGLang v0.4 调度器 <2% CPU 开销代码核验 + The AI Engineer 四选一决策框架交叉核验(PremAI 数字"~16,200 vs 12,500"来自第三方汇总无原始命令/复现步骤 · Particula 数据详尽但同无复现步骤 · 数字未标注置信区间 · SGLang v0.4 调度器 <2% CPU 开销需 SGLang PR/代码核验 · SGLang 2026 时间线(Kimi K3 day-0 + TPU 全功能 + GLM5.2 NVFP4 500 TPS + DFlash + Spec V2 + DeepSeek-V4 + GB300 NVL72 25×)每条需 SGLang README/官方公告核验 · DeepSeek V3 MLA 3.1× vs vLLM(Particula)需独立基准验证 · EAGLE 1.8×/1.5×(batch=1/batch=32)需 EAGLE 官方 README 核验 · The AI Engineer 四选一决策框架中 vLLM/SGLang 吞吐数字需与 inference.md §1.1 已有数字交叉核验 · 不同测试条件下数字可能不同 · 部署建议中"5 分钟内跑起来 → Ollama / 多用户共享上下文 → SGLang +29% / 请求完全唯一 → vLLM / NVIDIA + 模型固定 + 1-2 周调优 → TensorRT-LLM H100 15-30% 领先"与已有数据交叉验证);D93 🟡 立标池双向锚 v33 以来首次 6 向并存沿用 + 立标信号强度 ≠ 立标等级评估 双维度区分 v45 首次机制化沿用 + v56 第三次稳态 + 反思棒 第 23 次强制兑现棒 + 跨实例互评 8-23 evening 棒 第 8 件 + llm-infra 双端缺位 第 23 例 + spark llm-infra-e1prep 8-23 evening 棒兑现 5 件补位主线 + 5 件延后(其中 4 件为 8-23 新增:DistillCache/ReCache/Topology-Aware 三件 KV 新论文 + Photon 2.0 物理 AI)+ HF Daily 8-24 立标池双向锚第 10 日稳态(0 件 llm-infra 主轴 net-new)+ 立标饱和度机制 v47 三态切换 + 反方 #91/#92/#93/#94 候选沿用 + 第 12 + 23 + 24 + 25 + 26 类风险候选分配 + 8-24 paper_cards 主分类 llm-infra net-new 0 件(连续第 2 个零新增日 · 沿用 §IX 55 0 件主轴 + 沿用 §IX 54 4 arXiv 主轴 + 沿用立基础延展 6 件 + §IX 56 立基础延展 5 件)+ 5 件工程化层级 net-new(FlashPrefill V2 H200 升级 + vLLM Conference 8-25 Roadmap Q3 + Photon 2.0 + 3 件 KV 新论文邻接级)+ 1 件工具链 TGI EOL + Stripe 73% + H100 三方新源 = 立标池饱和度供给侧 v55 反转"主分类 paper_card 净增 0 件 + 方法/系统级 net-new 6 件 + 工程化层级 net-new 6 件"双锚点 → v56 维持"主分类 paper_card 净增 0 件 + 工程化层级 net-new 5 件 + 邻接级 net-new 3 件"三锚点 + 推理工程学科化第 9 维 67 → 71 件套扩面 + 边界扩展 131 → ≥ 136 子轴候选扩面 + 跨实例标签二档法首次传染到活文档主线 + 立标等级判定四档法首次传染到活文档主线 + 反方三段式与 §2.13 量化沿用.
D86-D88(§IX 55 沿用):D83-D85(§IX 54 沿用):D81-D82(§IX 53 沿用):D78-D80(§IX 52 沿用):D75-D77(§IX 51 沿用):D73-D74(§IX 50 沿用):D71-D72(§IX 49 沿用):D69-D70(§IX 48 沿用):D67-D68(§IX 47 沿用):D65-D66(§IX 46 沿用):D63-D64(§IX 45 沿用):D60-D62(§IX 44 沿用):D57-D59(§IX 43 沿用):D54-D56(§IX 42 沿用):D51-D53(§IX 41 沿用):D50(§IX 40 沿用):D49(§IX 39 沿用):D44-D48(§IX 38 沿用):
(沿用 D1-D43:详见 §3.2 上轮 §VII)
4. 开放问题(O1-O311, 311 条)
O302-O311(§IX 56 轮新增 10 条 · 精简):O302 🟠 FlashPrefill V2 H200 vs H20 加速比差异(H200 FP8 = 47.26× · H20 国内算力主流 · 架构/带宽差异 · H20 实际加速比需实测核验 · 不能直接套用 H200 数字做容量规划 · 建议标注"H20 数字待实测 · H200 数字仅供参考"· 评测条件 batch size、序列长度分布需 arXiv §3-4 原文 PDF 核验);O303 🟠 vLLM Conf 8-25 Roadmap Q3 兑现风险 + Stripe 73% 数据自报性 + Photon 2.0 评测公平性(vLLM Conf 六轴 1000+ TPS 是目标非已实现 · 兑现时间表待 8-25 会议确认 · Stripe 73% 数字来自 vLLM 官方博客公司自报数据需独立验证 · GLM-5.2 on 24× NVIDIA B300 Day-0 需 NVIDIA 硬件采购周期核验 · Kimi K3 preview 需实际生产部署核验 · Cold Start Q3 子主题数字待 Q3 末核实 · Sprint 机制当前 sprint = GLM5.2 + DSpark · 任务具体性待跟踪 · Photon 2.0 Moondream 仅 jay 8-23 trending 二手摘要 · 实测条件需 Moondream 官方 blog 核验);O304 🟠 3 件 KV Cache 新论文邻接升级评测公平性(DistillCache arXiv:2608.08878 仅二手摘要 · 评测条件、公平性、实际加速比需 PDF 核验 · 是否对标 H2O/SnapKV 公平待核 · ReCache arXiv:2608.19662 仅二手摘要 · 工具集动态扩展评测未公开 · Topology-Aware arXiv:2607.28633v2 与 §IX 53/54 PipeMax/DualPath 是否重合需独立核验 · arXiv ID 准确性需 arXiv 官方检索确认);O305 🟡 H100 基准三方新源数据置信区间 + SGLang v0.4 <2% CPU 开销代码核验 + The AI Engineer 四选一决策框架交叉核验(PremAI 数字无原始命令 · Particula 数据无复现步骤 · 数字未标注置信区间 · SGLang v0.4 调度器 <2% 需 PR/代码核验 · SGLang 2026 时间线每条需 README/官方公告核验 · DeepSeek V3 MLA 3.1× 需独立基准验证 · EAGLE 1.8×/1.5× 需 EAGLE 官方 README 核验);O306 🟡 立标池双向锚 6 向并存沿用 + 立标信号强度 ≠ 立标等级评估 v45 首次机制化沿用 + v56 第三次稳态 + 反思棒 第 23 次 + 跨实例互评 8-23 evening 棒 第 8 件 + llm-infra 双端缺位 第 23 例 + spark llm-infra-e1prep 8-23 evening 棒兑现 5 件补位主线 + 5 件延后(4 件 8-23 新增:DistillCache/ReCache/Topology-Aware + Photon 2.0 物理 AI)+ HF Daily 8-24 立标池双向锚第 10 日稳态(0 件 llm-infra 主轴 net-new)+ 立标饱和度机制 v47 三态切换 + 反方 #91/#92/#93/#94 候选沿用 + 第 12 + 23 + 24 + 25 + 26 类风险候选分配 + 8-24 paper_cards 主分类 llm-infra net-new 0 件(连续第 2 个零新增日 · 沿用 §IX 55 0 件主轴 + §IX 54 4 arXiv 主轴 + 立基础延展 6 件 + §IX 56 5 件)+ 5 件工程化层级 net-new + 1 件工具链 = 立标池饱和度供给侧 v55 反转双锚点 → v56 维持"主分类 paper_card 净增 0 件 + 工程化层级 net-new 5 件 + 邻接级 net-new 3 件"三锚点 + 推理工程学科化第 9 维 67 → 71 件套扩面 + 边界扩展 131 → ≥ 136 子轴候选扩面 + 跨实例标签二档法首次传染到活文档主线 + 立标等级判定四档法首次传染到活文档主线 + 反方三段式与 §2.13 量化沿用;O307 🟡 K8s+LLM Inference Mistral Large 123B 数值参考性 + MoE vs 稠密差异 + KEDA 单一信号(GPU cache pressure)需补 queue depth 监控 + DRA 在 K8s 1.31+ 才稳定部分生产环境 K8s 版本可能不支持 + DefensiveKV arXiv ID 待核(GitHub FFY0/DefensiveKV ICLR 2026 标注 + arXiv 编号未确认)+ DefensiveKV 评测仅在 RULER LMEval + 不同 model family 一致性待验 + SnapKV 39.0 vs DefensiveKV 85.3 是否在 RULER 之外泛化 + kv-cache-analyzer 数字来自 llama-3-70b + MoE vs 稠密差异 + RAG QA 30% within-session 不是 bug 而是 RAG 设计目标 + bs258q 仓库较新需关注 maintenance 状态 + llm-d 需 vLLM v0.23+ + 与 §IX 53 KV Cache 互联网级重构四件套关系尚未独立核验(沿用 §IX 55);O308 🟡 vLLM 8 月 blog Decode Context Parallelism 加速比需 blog 原文核验 + v59 vs §IX 55 双活文档归属对照 + KServe CRD spec.kvCacheOffloading.cpu 是预览版 API 字段 + TurboQuant arXiv ID 待核 + 2.69-4.4× vs 6×/8× 矛盾需 arXiv 2605.19660 原文核验 + SGLang PR #21617/21618 状态需 GH 跟踪 + H100 零精度损失声明需 PDF 核验 + RMM TLDR 被截断 + 完整性能数字需 PDF 核验 + RMM 1B-70B 覆盖范围是否包含 MoE 模型未说明 + RMM 与其他推理优化方法(FlashAttention / PagedAttention / 量化)的组合效果未验证 + Power Law Graph Attention "推理时经验性坍缩"claim + "exact generalization of scaled dot-product attention"严格数学声明需要核实证明 + Spheron Network = Spheron CTO 撰写有商业立场数据需独立验证 + Spheron 测试条件需完整核实 + 冷启动数字(28 分钟)对 TensorRT-LLM 是已知痛点非新发现 + ServerGurus 数据来源需独立核验(为 GPU 厂商相关方)(沿用 §IX 55);O309 🟡 InferScale arXiv:2607.27090 paper_card 补建 + 1.8-4.8 GB/conversation 评测条件 PDF 核验(沿用 §IX 54/55 主轴 missing + §IX 56 沿用);O310 🟡 Online KV Cache Compaction arXiv:2608.00902 paper_card 补建 + online vs offline compaction 实现细节 PDF 核验(沿用 §IX 54/55 主轴 missing + §IX 56 沿用);O311 🟡 RMM arXiv:2608.13426 1B-70B 覆盖范围是否包含 MoE 模型未说明 + RMM 与其他推理优化方法的组合效果未验证 + Power Law Graph Attention arXiv:2608.10288 "推理时经验性坍缩"claim + "exact generalization of scaled dot-product attention"严格数学声明需要核实证明(沿用 §IX 55 + §IX 56 沿用).
O299-O301(§IX 55 沿用):O296-O298(§IX 54 沿用):O294-O295(§IX 53 沿用):O291-O293(§IX 52 沿用):O288-O290(§IX 51 沿用):O286-O287(§IX 50 沿用):O284-O285(§IX 49 沿用):O280-O283(§IX 48 沿用):O276-O279(§IX 47 沿用):O272-O275(§IX 46 沿用):O265-O271(§IX 45 沿用):O252-O264(§IX 44 沿用):O241-O251(§IX 43 沿用):O232-O240(§IX 42 沿用):O216-O231(§IX 41 沿用):O208-O215(§IX 40 沿用
(沿用 O1-O207:详见 §4 上轮 §VII)
5. 趋势(T1-T51, 51 条)
T51(§IX 56 轮新增 1 条):2026 H2 LLM Infra 工程师复合角色 Phase 22 = §IX 55 Phase 21 全部沿用 + 🟠 FlashPrefill V2 H200 FP8 47.26× 升级 + SGLang 集成路径 + H20 存量工程意义(稀疏注意力算子层二次升级)+ 🟠 vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(Flat Model + MRV2 + 多级 KV Offloading + 1000+ TPS 推测解码 + 量化 KV Cache 生产级压缩 + llm-d 推进 + Rust Frontend 生产化 + SIG Spec Decode Q3 = production agentic workload + high-interactivity premium tokens + Cold Start Q3 子主题 6 件 + Sprint 机制取代 Q2 论坛形式 · 当前 sprint = GLM5.2 + DSpark · + NVIDIA 合作 session = "NVIDIA and vLLM Full-Stack Collaboration for DeepSeek and MiniMax Performance")+ 🟠 Photon 2.0(Moondream · 2026-08-03)= Physical AI 专用 megakernel 引擎(H100 ChartQA 全面优于 vLLM/SGLang · 推理引擎层"专用化分支"补强)+ 🟠 3 件 KV Cache 新论文邻接升级(DistillCache arXiv:2608.08878 KL 引导自适应 KV 驱逐 · 对标 H2O/SnapKV + ReCache arXiv:2608.19662 agentic KV 复用首个专项 + Topology-Aware Data Movement arXiv:2607.28633v2 PD disaggregation 70B 1.3 GB/请求 v2 修订)+ 🟠 TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源(TGI 2025-12 维护模式生效 2026-08 官方二次确认 · 推荐迁移 vLLM/SGLang · Stripe 每日 5000 万调用 GPU 舰队缩至 1/3 成本 -73% PagedAttention 60-80% 碎片消除 · PremAI/Particula/Atomic/AIMultiple H100 基准对照 · SGLang v0.4 调度器 <2% CPU 开销 · DeepSeek V3 MLA 3.1× · EAGLE 1.8×/1.5× · bench_serving 命令清单 · The AI Engineer 四选一决策框架 Ollama/SGLang/vLLM/TensorRT-LLM/llama.cpp)+ 🔴 FlashPrefill V2 arXiv:2608.19758 + 🔴 InferScale arXiv:2607.27090 + 🔴 Online KV Cache Compaction arXiv:2608.00902 + 🔴 DualPath arXiv:2602.21548v2 + 🔴 vLLM CVE-2026-73558 跨用户 KV 数据泄漏 + 🔴 LMDeploy CVE-2026-33626 SSRF 12h31m 武器化 + 🟠 SGLang CVE-2026-3059/3060/3989 + 🟠 Particula Tech H100 Benchmark + 🟠 Schema 7× + 🟠 TGI 维护 + 🟠 AI Agents Stack + 🟠 HotInfra'26 PIM-DIMM + 🟠 ServerMO + 🟠 Chain-of-Experience + 🟡 Cross-Model KV Cache Transfer + 🟡 OasisKV + 🔴 vLLM 0.27.0 + 🟠 SGLang 400K+ GPU + 🟠 EAGLE 多 token + 🟠 推理框架 <24h CVE 响应 SOP + HF Daily 8-24 立标池双向锚第 10 日稳态** = Phase 22.
T50(§IX 55 沿用):T49(§IX 54 沿用):T48(§IX 53 沿用):Phase 18 沿用。T47(§IX 52 沿用):Phase 17 沿用。T46(§IX 51 沿用):Phase 16 沿用。T45(§IX 50 沿用):Phase 15 沿用。T44(§IX 49 沿用):Phase 14 沿用。T43(§IX 48 沿用):Phase 13 沿用。T42(§IX 47 沿用):Phase 12 沿用。T41(§IX 46 沿用):Phase 11 沿用。T40(§IX 45 沿用):Phase 10 沿用。T39(§IX 44 沿用):Phase 9 沿用。T38(§IX 43 沿用):Phase 8 沿用。T37(§IX 42 沿用):Phase 7 沿用。T36(§IX 41 沿用):Phase 6 沿用。T35(§IX 40 沿用):Phase 5 沿用。T34(§IX 39 沿用):Phase 4 沿用。T32-T33(沿用 §IX 38 轮):
(沿用 T1-T31:详见 §5 上轮 §VII)
6. 引用清单
6.1-6.9 核心 ID 全集(精简)
- 6.1 推理引擎 (70 + §IX 55 新增 8 件 + §IX 56 新增 3 件 = 81): 沿用 §IX 55 轮 70 + §IX 56 立基础延展 5 件 + 邻接升级 3 件 = §IX 56 轮新增 3 件 = vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(github.com/vllm-project/vllm/issues/48168 + vllm.ai/events/vllm-conference/2026)+ Photon 2.0(Moondream · 2026-08-03 · moondream.ai/blog/photon-2-launch · Physical AI 专用 megakernel · H100 ChartQA 全面优于 vLLM/SGLang)+ Stripe 73% 成本案例 + PremAI H100 基准对照(premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026)+ The AI Engineer 四选一决策框架 Ollama/SGLang/vLLM/TensorRT-LLM/llama.cpp + 沿用 §IX 55 全部 8 件 + §IX 54 沿用全部 30+ 件
- 6.2 MoE/稀疏 (25 + §IX 56 新增 0 件 = 25): 沿用 §IX 53 全部 25 + §IX 56 沿用 FreeToken paper_card 987 arXiv:2608.16157 + DeepSeek-V4-Pro H20 1.6T MoE 邻接级 + Particula Tech SGLang 对 DeepSeek V3 3.1× 邻接级
- 6.3 KV Cache/量化 (62 + §IX 55 新增 6 件 + §IX 56 新增 3 件 = 71): 沿用 §IX 55 轮 62 + §IX 56 立基础延展邻接级 3 件 = DistillCache arXiv:2608.08878(KL 引导自适应 KV Cache 驱逐 + 5 维特征 + 对标 H2O/SnapKV · paper_card 待建)+ ReCache arXiv:2608.19662(动态工具调用 agentic KV 缓存复用首个专项 · 与 Chain-of-Experience 邻接 · paper_card 待建)+ Topology-Aware Data Movement arXiv:2607.28633v2(PD disaggregation 70B 模型 KV cache 1.3 GB/请求 + 网络拓扑感知数据传输优化 + v2 修订 2026-08 + 与 §IX 53 PipeMax + DualPath 同方向 · paper_card 待建)+ 沿用 §IX 55 立基础延展 6 件 = K8s+LLM Inference Mistral Large 123B 0.344 MB/token + 128K 44GB + GPU 显存三分 + KEDA KV cache pressure + GIE 前缀路由 + DefensiveKV ICLR 2026(RULER 20% SnapKV 39.0 / DefensiveKV 85.3 / LayerDefensiveKV 91.4)+ kv-cache-analyzer CLI(RAG QA 30% within-session + 多场景 LRU hit rate 实测)+ llm-d KV Cache 路由 upstreamed vLLM v0.23(KVEvents + KV Block Index + Scheduler 打分)+ TurboQuant arXiv:2605.19660 数字矛盾警示 + RMM arXiv:2608.13426(训练无关输入自适应矩阵乘)+ FlashPrefill V2 arXiv:2608.19758(块稀疏 attention + SGLang backend 集成 + H200 FP8 47.26× 升级)+ InferScale arXiv:2607.27090(GPU 原生 KV Injection 个性化记忆)+ Online KV Cache Compaction arXiv:2608.00902(长程 Agent KV Cache 在线压缩)+ DualPath arXiv:2602.21548v2(KV-Cache 加载重平衡)+ Chain-of-Experience arXiv:2608.18027(推理时持续改进 loop)+ Cross-Model KV Cache Transfer arXiv:2608.03893(梯度无关闭式线性映射)+ OasisKV arXiv:2608.08097(KV 6.5-9.7× 压缩 + decode 2.1× 提速)+ Power Law Graph Attention arXiv:2608.10288(SDPA 精确泛化)+ §IX 53 轮沿用 DASH arXiv:2608.14333 + HBF Sucks arXiv:2608.11668v2 + An Internet for the KV Cache arXiv:2608.01526 + PipeMax arXiv:2605.02189 + Online Scheduling MC-SF arXiv:2502.07115v5 + Reimagining HotInfra'26 PIM-DIMM(论文无 arXiv ID)
- 6.4 HPCA 2026 (13): 沿用上轮 13 件 wafer-scale 系统论文
- 6.5 Agent 安全/记忆/评估 (69 + §IX 55 新增 2 件 + §IX 56 新增 1 件 = 72): 沿用 §IX 35th~55 轮 69 + §IX 56 沿用 §IX 55 轮新增 2 件 + TGI EOL 官方二次确认(2025-12 维护模式生效 2026-08 HuggingFace 官方确认推荐迁移 vLLM/SGLang)+ Stripe 73% 成本案例(vLLM Blog 2026-07-15 · 每日 5000 万调用 GPU 舰队缩至 1/3 成本 -73% PagedAttention 60-80% 碎片消除 · GLM-5.2 on 24× NVIDIA B300 Day-0 支持 · Kimi K3 preview 2026-07-21)+ Harness Engineering arXiv:2607.08028(沿用 §IX 52)+ Context Engineering arXiv:2603.09619(沿用 §IX 52)+ Cross-Model Memory Transfer arXiv:2608.17050(沿用 §IX 53)+ AI Serving 形式化优化 arXiv:2605.01280(沿用 §IX 53)+ Chain-of-Experience arXiv:2608.18027(沿用 §IX 54)+ Cross-Model KV Cache Transfer arXiv:2608.03893(沿用 §IX 54)+ AI Agents Stack 2026 Edition Eval 37pp gap(沿用 §IX 54)+ Context-Bench / Recovery-Bench / Terminal-Bench 新兴 Benchmark(沿用 §IX 54)+ Guardrails 范式转变(沿用 §IX 54)+ MCP 安全审计实锤(沿用 §IX 53)+ CVE trio(vLLM CVE-2026-73558 + LMDeploy CVE-2026-33626 + SGLang CVE-2026-3059/3060/3989 沿用 §IX 54)
- 6.6 向量 DB/数据系统 (18 + §IX 55 新增 1 件 = 19): 沿用上轮 18 + §IX 55 轮新增 1 件 = LEANN MLSys 2026(StarTrail-org/LEANN · 图结构剪枝 + 选择性重计算 · 97% 存储节省)+ Qdrant v1.14 GPU 加速 HNSW + Multi-AZ 99.95% SLA + $50M Series B + Salt Technologies Q1 2026 Benchmark + HubSpot 200 亿向量 Qdrant + Vector DB 2026 大变局 邻接级沿用 + TEngineDB-V + Filtered Vector Search + DBAIOps + Data Agent 综述 4 件 SIGMOD/VLDB 2026 沿用
- 6.7 SIGMOD 2026 LLM Serving 三件套 (5): CoDec DOI:10.1145/38020284 / AlignedServe DOI:10.1145/38020094 + 2605.23389v1 / HotPrefix DOI:10.1145/3749168
- 6.8 CVE 全集(18 ID + §IX 56 沿用 = 18) = CVE-2026-73558 vLLM 跨用户 KV 数据泄漏 + CVE-2026-33626 LMDeploy SSRF 12h31m 武器化 + CVE-2026-3059/3060/3989 SGLang 多模态/分拆去序列化 + CVE-2026-5241 + CVE-2026-3172 + CVE-2026-22773 + CVE-2026-22778 video pipeline RCE CVSS 9.8 + CVE-2026-24779 vLLM + CVE-2026-25960 vLLM + CVE-2026-27893 vLLM trust_remote_code bypass CVSS 8.8 + CVE-2026-5760 SGLang GGUF chat template CVSS 9.8 + CVE-2026-26030 Semantic-Firewall + CVE-2025-30165 + CVE-2025-62164 + CVE-2025-66448 HF + CVE-2026-3059 + CVE-2026-3060 SGLang multimodal ZMQ broker pickle deserialization CVSS 9.8 + CVE-2026-3989 SGLang crash dump replay CVSS 7.8 + CVE-2026-14890 SGLang expert-parallel pickle deserialization VU#326070) + 第 18-23 候选 + 第 12 + 24 + 25 + 26 类风险候选
- 6.9 §IX 35~56 轮新增 arXiv 集合:沿用 §IX 55 轮全部 + §IX 56 轮新增 0 件主分类 arXiv 主轴 + 3 件邻接升级研究前沿(arXiv:2608.08878 DistillCache paper_card 待建 + arXiv:2608.19662 ReCache paper_card 待建 + arXiv:2607.28633v2 Topology-Aware Data Movement paper_card 待建)+ §IX 55 沿用 2 件邻接升级(arXiv:2608.13426 RMM paper_card 952 + arXiv:2608.10288 PLGA paper_card 920)+ §IX 54 沿用 4 件(paper_card 1039 2608.19758 + paper_card 待建 2607.27090 + paper_card 待建 2608.00902 + paper_card 139 2602.21548v2 主分类 llm-infra)+ 1 件邻接级(paper_card 1045 2608.18027)+ 2 件研究前沿(2608.03893 + 2608.08097)+ 5 件 CVE 主轴级(CVE-2026-73558 + CVE-2026-33626 + CVE-2026-3059 + CVE-2026-3060 + CVE-2026-3989)+ §IX 53 沿用 5 件(paper_card 037 2601.06288 + paper_card 090 2606.01927 旧卡复活 + arXiv:2605.19537 + arXiv:2607.08028 + arXiv:2603.09619)+ §IX 52 沿用 5 件 + §IX 51 沿用 6 件 + §IX 50 沿用 3 件 + §IX 49 沿用 1 件 + §IX 48 沿用 9 件 + §IX 56 沿用 TurboQuant arXiv:2605.19660 数字矛盾警示
6.13 沿用引用补遗(沿用 §IX 55 轮 URL 集合 + §IX 56 轮新增 URL · 保 old->candidate 无 missing)
arXiv / CVE / URL:沿用 §IX 55 轮全部 + §IX 56 轮新增 3 件 arXiv ID(邻接升级):arXiv:2608.08878(DistillCache · KL 引导自适应 KV Cache 驱逐 · 5 维特征 · 主分类 llm-infra · paper_card 待建 · 8-23 spark llm-infra-e1prep §二增量 4 · 邻接升级候选 ★ 中档)+ arXiv:2608.19662(ReCache · 动态工具调用 agentic KV 缓存复用首个专项 · 主分类 llm-infra · paper_card 待建 · 8-23 spark llm-infra-e1prep §二增量 4 · 邻接升级候选 ★ 中档)+ arXiv:2607.28633v2(Topology-Aware Data Movement · PD disaggregation 70B 模型 1.3 GB/请求 · v2 修订 2026-08 · 主分类 llm-infra · paper_card 待建 · 8-23 spark llm-infra-e1prep §二增量 4 · 邻接升级候选 ★ 低档)+ §IX 56 轮新增 11 件 URL:github.com/vllm-project/vllm/issues/48168(vLLM Roadmap Q3 2026 · 6 主轴 + Cold Start Q3 子主题)+ vllm.ai/events/vllm-conference/2026(First vLLM Conference at Ray Summit · 8-24 ~ 26 San Francisco · Day 1 Tuesday August 25 9:30 AM Keynotes + 12:30 PM State of vLLM 2026)+ moondream.ai/blog/photon-2-launch(Photon 2.0 Physical AI 专用 megakernel 引擎 · H100 ChartQA 全面优于 vLLM/SGLang · 2026-08-03)+ premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026(PremAI H100 基准 SGLang 16,200 / vLLM 12,500 / LMDeploy 16,200)+ vllm.ai/blog(Stripe 73% 成本案例 · 每日 5000 万调用 · GPU 舰队缩至 1/3 · PagedAttention 60-80% 碎片消除 · 2026-07-15)+ blog.csdn.net/brandy/article/details/155517690(SGLang vs vLLM 选型 RadixAttention + PagedAttention + Llama3-70B-FP8 2×H100 场景表)+ blog.csdn.net/u013701860/article/details/148295809(bench_serving 工具命令 SGLang + vLLM backend + pd-separated)+ anyscale.com/ray-summit/2026(Ray Summit 2026 · 8-24 ~ 26 San Francisco · co-located with vLLM Conference)+ nvidia.com/en-us/events/ray-summit(NVIDIA at Ray Summit 2026 · NVIDIA and vLLM Full-Stack Collaboration session)+ arxiv.org/abs/2608.08878(DistillCache 邻接升级候选 ★ 中档)+ arxiv.org/abs/2608.19662(ReCache 邻接升级候选 ★ 中档)+ arxiv.org/abs/2607.28633v2(Topology-Aware Data Movement v2 修订 邻接升级候选 ★ 低档)+ 沿用 8 件 URL 沿用; DOI 10.1145/38020284 + DOI 10.1145/38020094 + DOI 10.1145/3749168 + DOI 10.1145/3803798 沿用。
§6.13.1 全量 URL(沿用 §IX 55 轮 URL 集合 + §IX 56 轮新增 URL · 全量保 old->candidate 无 missing · 共 86 件)
https://arxiv.org/abs/2502.07115 https://arxiv.org/abs/2605.01280 https://arxiv.org/abs/2605.02189 https://arxiv.org/abs/2608.01526 https://arxiv.org/abs/2608.14333 https://arxiv.org/abs/2608.14376 https://arxiv.org/abs/2608.17050 https://arxiv.org/abs/2608.19758 https://arxiv.org/abs/2607.27090 https://arxiv.org/abs/2608.00902 https://arxiv.org/abs/2602.21548 https://arxiv.org/abs/2608.18027 https://arxiv.org/abs/2608.03893 https://arxiv.org/abs/2608.08097 https://arxiv.org/abs/2608.13426 https://arxiv.org/abs/2608.10288 https://arxiv.org/abs/2605.19660 https://arxiv.org/abs/2608.08878 https://arxiv.org/abs/2608.19662 https://arxiv.org/abs/2607.28633 https://arxiv.org/html/2502.07115v5 https://arxiv.org/html/2605.02189v1 https://arxiv.org/html/2608.01526v1 https://arxiv.org/html/2608.11668v2 https://arxiv.org/pdf/2608.19758 https://blog.modelcontextprotocol.io/posts/2026-07-28 https://cloudnativenow.com/features/cncf-expands-efforts-to-run-ai-inference-workloads-on-kubernetes-clusters https://deploybase.ai/articles/best-llm-inference-engine https://events.linuxfoundation.org/kubecon-cloudnativecon-north-america/co-located-events/cloud-native-ai-inference-day https://freedom.tech/project/vllm https://github.com/RyanAlberts/best-of-Agent-Harnesses https://github.com/sgl-project/sglang/issues/21994 https://github.com/sgl-project/sglang/issues/23842 https://github.com/qhfan/FlashPrefillv2 https://github.com/InternLM/lmdeploy/security/advisories https://github.com/sgl-project/sglang/security/advisories https://hotinfra.org/2026/papers/hotinfra26-final59.pdf https://lyceum.technology/magazine/vllm-vs-tensorrt-llm-production-benchmark https://mp.weixin.qq.com/s?__biz=MzkyMzI3NzQ0Mg%3D%3D&mid=2247494105&idx=1&sn=8d7409e0fb846a3c7803c142b5d1a8e7 https://vllm.ai/blog https://www.axios.com/2026/08/17/a2a-agentic-ai-foundation-open-ai-standards https://www.buildmvpfast.com/blog/pinecone-vs-weaviate-vs-qdrant-vector-database-comparison-2026 https://www.glukhov.org/ai-systems/comparisons/a2a-protocol-2026-adoption https://www.lmsys.org/blog/2026-08-17-advanced-cuda-graph https://www.lmsys.org/blog/2026-08-18-miles-v0-1 https://www.lmsys.org/blog/2026-08-19-deepseek-v4-pro-engine-optimization-h20 https://www.modular.com/blog/mojo-open-source https://www.redhat.com/en/blog/red-hat-ai-inference-brings-llm-d-any-managed-kubernetes-starting-coreweave-and-microsoft-azure https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026 https://app.opencve.io/cve?product=vllm&vendor=vllm-project https://www.cve.org/CVERecord?id=CVE-2026-73558 https://github.com/vllm-project/vllm/security/advisories/GHSA-7m6h-x95x-82q5 https://www.sysdig.com/blog/cve-2026-33626-how-attackers-exploited-lmdeploy-llm-inference-engines-in-12-hours https://orca.security/resources/blog/sglang-llm-framework-rce-vulnerabilities https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison https://deepinfra.com/blog/vllm-vs-sglang https://www.spheron.network/blog/vllm-vs-sglang-2026 https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt https://www.servermo.com/blogs/sglang-vs-vllm-benchmark https://huggingface.co/blog https://berkeleyrdi.substack.com/p/agentic-ai-weekly-berkeley-rdi-august https://www.nvidia.com/en-us/on-demand/session/gtc26-s82033 https://github.com/amitshekhariitbhu/llm-inference-engineering https://www.kodemsecurity.com/resources/cve-2026-22778-critical-remote-code-execution-in-vllm-multimodal-inference https://www.spheron.network/blog/llm-inference-optimization-2026 https://highlimitdesigns.com/blog/prefill-decode-disaggregation-llm-serving-2026 https://highlimitdesigns.com/blog/llm-infrastructure-breakthroughs-vllm-v1-sglang-epd-disaggregation https://github.com/framsouza/inference-at-scale-on-kubernetes https://github.com/FFY0/DefensiveKV https://github.com/bs258q/kv-cache-analyzer https://github.com/llm-d/llm-d-kv-cache https://vllm-project.github.io/blog/2026-07-29-25k-tps-qwen35 https://vllm-project.github.io/blog/2026-08-06-decode-context-parallelism https://vllm-project.github.io/blog/2026-08-07-efficient-decode-context-parallelism https://vllm-project.github.io/blog/2026-04-21-state-of-fp8-kv-cache https://linkedin.com/posts/servergurus-india_disaggregated-inference-why-splitting-prefill-activity-7489815467243540480-FGVo https://github.com/StarTrail-org/LEANN https://github.com/vllm-project/vllm/issues/48168 https://vllm.ai/events/vllm-conference/2026 https://moondream.ai/blog/photon-2-launch https://premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 https://blog.csdn.net/brandy/article/details/155517690 https://blog.csdn.net/u013701860/article/details/148295809 https://anyscale.com/ray-summit/2026 https://nvidia.com/en-us/events/ray-summit
§7 沿革摘要(至 2026-08-24 09:00 · 极精简)
| 日期 | 轮次 | 主题快照 |
|---|---|---|
| 2026-08-25 05:00 | §IX 56th | 🟠 FlashPrefill V2 H200 FP8 47.26× 升级 + SGLang 集成路径 + H20 存量工程意义 + 🟠 vLLM Conf @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(github.com/vllm-project/vllm/issues/48168 + vllm.ai/events/vllm-conference/2026 · Flat Model + MRV2 + 多级 KV Offloading + 1000+ TPS + 量化 KV Cache + llm-d 推进 + Rust Frontend + SIG Spec Decode Q3 + Cold Start Q3 + Sprint 机制 · 当前 sprint = GLM5.2 + DSpark · + NVIDIA 合作 session "DeepSeek and MiniMax Performance")+ 🟠 Photon 2.0(Moondream · 2026-08-03 · Physical AI megakernel · H100 ChartQA 全面优于 vLLM/SGLang)+ 🟠 3 件 KV Cache 新论文邻接升级(DistillCache arXiv:2608.08878 + ReCache arXiv:2608.19662 + Topology-Aware arXiv:2607.28633v2)+ 🟠 TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源(PremAI/Particula/Atomic/AIMultiple)。推理工程学科化第 9 维 67 → 71 件套扩面。 |
| 2026-08-23 05:00 | §IX 55th | 🟠 K8s+LLM Inference 完整数值层 framsouza + 🟠 DefensiveKV ICLR 2026 + 🟠 kv-cache-analyzer CLI bs258q + 🟠 llm-d KV Cache 路由 upstreamed vLLM v0.23 + 🟡 vLLM 8 月三件 blog + 🟡 TurboQuant 数字矛盾 + 🟡 RMM arXiv:2608.13426 邻接升级候选 ★ 中档 + 🟡 PLGA arXiv:2608.10288 邻接候选 ☆ + 🟠 Spheron 2026 + ServerGurus PD disaggregation + HLD Blog 三件 + 🟠 LEANN MLSys 2026。推理工程学科化第 9 维 62 → 67 件套扩面。 |
| 2026-08-22 05:00 | §IX 54th | 🔴 FlashPrefill V2 arXiv:2608.19758 + 🔴 InferScale arXiv:2607.27090 + 🔴 Online KV Cache Compaction arXiv:2608.00902 + 🔴 DualPath arXiv:2602.21548v2 + 🔴 vLLM CVE-2026-73558 跨用户 KV 数据泄漏 + 🔴 LMDeploy CVE-2026-33626 SSRF + 🟠 SGLang CVE-2026-3059/3060/3989 + 🟠 Particula Tech SGLang vs vLLM H100 + 🟠 Schema 7× + 🟠 TGI 维护 + 🟠 AI Agents Stack + 🟠 HotInfra'26 PIM-DIMM + 🟠 ServerMO + Chain-of-Experience + Cross-Model KV + OasisKV + 🟠 vLLM 0.27.0 = CVE-2026-73558 修复门槛。推理工程学科化第 9 维 58 → 62 件套扩面。 |
| 2026-08-21 05:00 | §IX 53rd | 🔴 CoRun + DASH + HBF Sucks 三件 arXiv 主轴 + SGLang Advanced CUDA Graph + DeepSeek-V4-Pro H20 + Miles v0.1 + KV Cache 基础设施重构四件套(An Internet for the KV Cache + PipeMax + Online Scheduling MC-SF + Reimagining HotInfra'26 PIM-DIMM 1,607 vs 679 tok/s)+ vLLM 0.27.1 + GLM-5.3 + Qdrant v1.14 + Red Hat AI Inference llm-d + A2A 治理。推理工程学科化第 9 维 54 → 58 件套扩面。 |
| 2026-08-20 05:00 | §IX 52nd | 🔴 paper_card 037 AIConfigurator + paper_card 090 Albireo + EuroSys 2026 6 件 + HPDC 2026 ATLAS + IEEE DCOSS-IoT Best Paper + vLLM vs SGLang 生产决策树 v2 + PremAI/Particula H100 横评 + Spheron H100/H200 + Mojo🔥 开源 + The AI Agents Stack 2026 + MCP 工程实践三件套 + A2A 协议一周年。推理工程学科化第 9 维 47 → 54 件套扩面。 |
| 2026-08-19 05:00 | §IX 51st | 🟠 Thought-Level Beam Search + Hybrid-Policy Self-Editing + Modular Cognitive Architecture + FreeToken + TensorRT-LLM v1.0 + SGLang RadixArk TPU + GLM5.2 NVFP4 + vLLM 8月 blog posts 5 件 + CSDN inference 部署/选型 5 件。推理工程学第 9 维 42 → 47 件套扩面。 |
本次变更
2026-08-25 05:00 (Wave3 E1 第五十六轮 cron · §IX 56th)
本轮 §IX 56 主题:FlashPrefill V2 H200 FP8 47.26× 升级 + SGLang 集成路径 + H20 存量工程意义 + vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(Flat Model + MRV2 + 多级 KV Offloading + 1000+ TPS 推测解码 + 量化 KV Cache 生产级压缩 + llm-d 推进 + Rust Frontend 生产化 + SIG Spec Decode Q3 + Cold Start Q3 子主题 + Sprint 机制)+ Photon 2.0 Moondream Physical AI 专用 megakernel + 3 件 KV Cache 新论文邻接升级(DistillCache + ReCache + Topology-Aware v2)+ TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源。5 件工程化层级补位 + 3 件邻接升级。共识/争议/试金石/趋势:C1-C195 共 195 条(新增 C191-C195 共 5 条)/ D1-D93 共 93 条(新增 D89-D93 共 5 条)/ O1-O311 共 311 条(新增 O302-O311 共 10 条)/ T1-T51 共 51 条(新增 T51 共 1 条)。推理工程学科化第 9 维 67 → 71 件套扩面。≥ 10 P0 待核警示(详见 §4 O302-O311)。下次预计 8-25 evening cron(Wave3 E1 第五十七轮)。
2026-08-23 05:00 (Wave3 E1 第五十五轮 cron · §IX 55th)
(本段沿用 §IX 55 · 详见 /shared/research-kb/organized/knowledge/archive/llm-infra-changelog.md 存档)
2026-08-22 05:00 (Wave3 E1 第五十四轮 cron · §IX 54th)
(本段沿用 §IX 54 · 详见 /shared/research-kb/organized/knowledge/archive/llm-infra-changelog.md 存档)
6.99 全量 arXiv ID · URL 索引(确保 old→candidate 无 missing)
6.99.1 全量 arXiv(共 186 件 · 沿用 §IX 55 183 + §IX 56 新增 3 邻接升级 = 186 件)
arXiv:2403.05527 arXiv:2502.07115 arXiv:2502.14617 arXiv:2504.11320 arXiv:2504.19874 arXiv:2505.02189 arXiv:2506.04565 arXiv:2507.06608 arXiv:2511.01815 arXiv:2511.11581 arXiv:2512.05411 arXiv:2512.09196 arXiv:2601.06288 arXiv:2601.19139 arXiv:2602.04900 arXiv:2602.08005 arXiv:2602.14617 arXiv:2602.21548 arXiv:2603.02001 arXiv:2603.04428 arXiv:2603.06728 arXiv:2603.09619 arXiv:2603.10249 arXiv:2603.11088 arXiv:2603.12646 arXiv:2603.13358 arXiv:2603.15569 arXiv:2603.17456 arXiv:2603.18272 arXiv:2603.20397 arXiv:2603.21354 arXiv:2603.23710 arXiv:2603.29010 arXiv:2603.29231 arXiv:2604.00499 arXiv:2604.03143 arXiv:2604.04722 arXiv:2604.04853 arXiv:2604.12374 arXiv:2604.15732 arXiv:2604.19157 arXiv:2604.19769 arXiv:2604.20920 arXiv:2604.25724 arXiv:2604.25899 arXiv:2604.26557 arXiv:2605.01280 arXiv:2605.02189 arXiv:2605.04595 arXiv:2605.10834 arXiv:2605.11733 arXiv:2605.17613 arXiv:2605.19537 arXiv:2605.19660 arXiv:2605.23389 arXiv:2605.27744 arXiv:2605.29640 arXiv:2606.01927 arXiv:2606.02643 arXiv:2606.03811 arXiv:2606.06535 arXiv:2606.11916 arXiv:2606.14589 arXiv:2606.16316 arXiv:2606.18023 arXiv:2606.18431 arXiv:2606.19746 arXiv:2606.20295 arXiv:2606.21238 arXiv:2606.24775 arXiv:2606.26560 arXiv:2606.26875 arXiv:2606.28565 arXiv:2606.30391 arXiv:2607.00482 arXiv:2607.02980 arXiv:2607.03333 arXiv:2607.05061 arXiv:2607.07386 arXiv:2607.07816 arXiv:2607.07953 arXiv:2607.08028 arXiv:2607.09172 arXiv:2607.09248 arXiv:2607.09424 arXiv:2607.10350 arXiv:2607.10508 arXiv:2607.11505 arXiv:2607.11523 arXiv:2607.11783 arXiv:2607.11881 arXiv:2607.12747 arXiv:2607.13027 arXiv:2607.13104 arXiv:2607.13705 arXiv:2607.14541 arXiv:2607.17715 arXiv:2607.17979 arXiv:2607.18141 arXiv:2607.21557 arXiv:2607.22529 arXiv:2607.23693 arXiv:2607.23933 arXiv:2607.24062 arXiv:2607.25380 arXiv:2607.26475 arXiv:2607.26654 arXiv:2607.27042 arXiv:2607.27090 arXiv:2607.28633 arXiv:2607.29377 arXiv:2607.29405 arXiv:2608.00101 arXiv:2608.00303 arXiv:2608.00677 arXiv:2608.00742 arXiv:2608.00881 arXiv:2608.00902 arXiv:2608.01247 arXiv:2608.01326 arXiv:2608.01526 arXiv:2608.01651 arXiv:2608.01718 arXiv:2608.01735 arXiv:2608.01964 arXiv:2608.01975 arXiv:2608.02143 arXiv:2608.02515 arXiv:2608.02585 arXiv:2608.02645 arXiv:2608.02703 arXiv:2608.02870 arXiv:2608.02989 arXiv:2608.03036 arXiv:2608.03216 arXiv:2608.03222 arXiv:2608.03487 arXiv:2608.03796 arXiv:2608.03893 arXiv:2608.03972 arXiv:2608.03994 arXiv:2608.05136 arXiv:2608.05219 arXiv:2608.05604 arXiv:2608.05784 arXiv:2608.06007 arXiv:2608.06033 arXiv:2608.06130 arXiv:2608.06301 arXiv:2608.06867 arXiv:2608.07009 arXiv:2608.07152 arXiv:2608.07169 arXiv:2608.07458 arXiv:2608.07645 arXiv:2608.08020 arXiv:2608.08097 arXiv:2608.08311 arXiv:2608.08389 arXiv:2608.08878 arXiv:2608.09867 arXiv:2608.09888 arXiv:2608.10208 arXiv:2608.10288 arXiv:2608.10875 arXiv:2608.10915 arXiv:2608.11660 arXiv:2608.12149 arXiv:2608.12440 arXiv:2608.13263 arXiv:2608.13426 arXiv:2608.13499 arXiv:2608.13567 arXiv:2608.14333 arXiv:2608.14376 arXiv:2608.14465 arXiv:2608.16157 arXiv:2608.17050 arXiv:2608.18027 arXiv:2608.19662 arXiv:2608.19758