llm-infra · 知识库活文档

  • 更新:§IX 56 立基延展 5 件(FlashPrefill V2 H200/vLLM Conf 8-25/Photon 2.0/3 KV 新论文/TGI EOL+Stripe+H100)+邻接 3+维 67→71

  • 主题负责人:spark(活文档维护)

  • 覆盖材料范围:截至 2026-08-24 09:00 · 涵盖 8-22 evening → 8-24 morning fresh + 56 轮
  • 结构约定:§0 定调 / §1 全景 / §2 关键工作 / §3 共识与争议 / §4 开放问题 / §5 趋势 / §6 引用清单 / §7 沿革摘要 / §8 本次变更

本文档以 LLM 基础设施(llm-infra) 为主轴,覆盖模型如何被加速/量化/稀疏化/调度/自动化的所有硬件/算法/数学/工程基础层面。

主线结构 §IX·56th:推理引擎 6+4+3+1+1+3+8+5+2+4+4 邻接 + 推理调度 9+1+1+2+1+1+2+1 学派(沿用 CoRun)+ KV Cache 19 → 21 路线(沿用 InferScale + Online Compaction + DualPath)+ 推理工程学第 9 维 62 → 67 → 71 件套扩面 = 🟠 FlashPrefill V2 H200 FP8 47.26× 升级 + SGLang 集成路径 + H20 存量工程意义 + 🟠 vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(vllm-project/vllm Issue #48168 + vllm.ai/events/vllm-conference/2026 + Flat Model/MRV2/多级 KV Offloading/1000+ TPS 推测解码/量化 KV Cache/llm-d 推进/Rust Frontend 生产化/SIG Spec Decode Q3 = production agentic + Cold Start Q3 子主题 6 件/Sprint 机制取代 Q2 论坛形式 当前 sprint = GLM5.2 + DSpark)+ 🟠 Photon 2.0(Moondream 2026-08-03)= Physical AI 专用 megakernel 引擎(H100 ChartQA 全面优于 vLLM/SGLang)+ 🟠 3 件 KV Cache 新论文邻接升级(DistillCache arXiv:2608.08878 KL 引导自适应驱逐 5 维特征 + ReCache arXiv:2608.19662 agentic KV 复用首个专项 + Topology-Aware Data Movement arXiv:2607.28633v2 PD disaggregation 70B 1.3 GB/请求 v2 修订)+ 🟠 TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源(PremAI/Particula/Atomic/AIMultiple + SGLang v0.4 调度器 <2% + DeepSeek V3 MLA 3.1× + EAGLE 1.8×/1.5× + bench_serving + The AI Engineer 四选一决策框架)+ §IX 55 沿用全部 6 件立基础延展 + 2 件邻接升级(K8s+LLM Inference + DefensiveKV ICLR 2026 + kv-cache-analyzer + llm-d + vLLM 8 月 blog + TurboQuant 数字矛盾 + RMM + PLGA)+ §IX 54 沿用 4 arXiv 主轴(FlashPrefill V2 2608.19758 + InferScale 2607.27090 + Online KV Cache Compaction 2608.00902 + DualPath 2602.21548v2)+ §IX 53/52/51/50/49/48/47/45-46 沿用 30+ + 18 + 16 + 13 + 12 + 15 + 15 + 28 件 + Spheron 2026 vLLM/SGLang/TensorRT-LLM 50 并发实测 + ServerGurus LinkedIn PD disaggregation p99 2,800ms → 310ms -90% / GPU 成本 -40% + LEANN MLSys 2026 97% 向量库存储节省 + §IX 56 5 件 + 8-24 paper_cards 主分类 llm-infra net-new 0 件(连续第 2 个零新增日 · 沿用 §IX 55 0 件主轴 + §IX 54 4 arXiv 主轴 + 立基础延展 6 件 + §IX 56 5 件)+ v56 第三次稳态 + 反思棒 第 23 次 + 跨实例互评 8-23 evening 棒 第 8 件 + llm-infra 双端缺位 第 23 例 + spark llm-infra-e1prep 8-23 evening 棒兑现 5 件补位主线 + 5 件延后(4 件 8-23 新增) + 边界扩展 131 → ≥ 136 子轴候选扩面 + 反方 #91/#92/#93/#94 候选沿用 + 第 12 + 23 + 24 + 25 + 26 类风险候选沿用。

*主线核心句 §IX 56th*:§IX 56 新增 5 件工程化层级补位(FlashPrefill V2 H200 升级 / vLLM Conference 8-25 Roadmap Q3 六轴官方确认 / Photon 2.0 Physical AI megakernel / 3 件 KV Cache 新论文邻接升级 / TGI EOL + Stripe 73% + H100 三方新源)= 立标池饱和度供给侧 v55 第二次稳态终结 → v56 维持"主分类 paper_card 净增 0 件 + 工程化层级 net-new 5 件 + 邻接级 net-new 3 件"三锚点 + 推理工程学科化第 9 维 67 → 71 件套扩面 = 🟠 FlashPrefill V2 H200 FP8 47.26× 升级(§IX 56 立基础延展第 1 件 · arXiv:2608.19758 paper_card 1039 已建 · §1.(8) FlashPrefill V2 子节内「H200 FP8 128K 47.26× + SGLang 注意力后端集成路径 + 国内 H20 存量意义」补强)+ 🟠 vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(§IX 56 立基础延展第 2 件 · github.com/vllm-project/vllm/issues/48168 + vllm.ai/events/vllm-conference/2026 · SIG Core 6 主轴:① 完成 Flat Model 迁移 top 20 model architectures + 新 day-0 模型 Flat Model only · ② 完成 Model Runner V2 迁移 + MRV1 弃用 · ③ 生产稳定性提升 + 失败 ergonomic 改进 · ④ Scheduler 重构 · ⑤ KV Cache Manager 重新设计 · ⑥ Mark Rust Frontend + 重构 tool-calling 实现 = production ready · + Cold Start Q3 子主题 = 降低冷启动时间 Issue #48193 · + Sprint 机制取代 Q2 论坛形式 当前 sprint = GLM5.2 + DSpark · + SIG Spec Decode Q3 = production agentic workload + high-interactivity premium tokens · + 会议详情:vLLM Conference 由 Inferact 主办 · co-located with Anyscale Ray Summit 2026-08-24 ~ 26 San Francisco · Day 1 Tuesday August 25 9:30 AM Keynotes + 12:30 PM State of vLLM 2026 · + NVIDIA 合作 session = Tuesday 1:15-1:45 PM PT "NVIDIA and vLLM Full-Stack Collaboration for DeepSeek and MiniMax Performance")+ 🟠 Photon 2.0(Moondream · 2026-08-03)= Physical AI 专用 megakernel 引擎(§IX 56 立基础延展第 3 件 · H100 ChartQA 全面优于 vLLM/SGLang · 推理引擎层"专用化分支"补强 · 适用场景 = 多模态 / Physical AI · 实测条件需 Moondream 官方 blog 核验)+ 🟠 3 件 KV Cache 新论文邻接升级(§IX 56 立基础延展第 4 件 · ① DistillCache arXiv:2608.08878 KL 引导自适应 KV Cache 驱逐 · 5 维特征(α_i + ‖v_i‖₂ + σ_i + 注意力质量 + 跨头方差)· 对标 H2O/SnapKV · paper_card 待建 · ② ReCache arXiv:2608.19662 动态工具调用 agentic KV 缓存复用首个专项 · 渐进式披露 + 工具集动态扩展 + schema 上下文管理 · 与 Chain-of-Experience §1.(11)/§1.(12) 邻接方向互补 · paper_card 待建 · ③ Topology-Aware Data Movement arXiv:2607.28633v2 PD disaggregation 70B 模型 KV cache 1.3 GB/请求 · 网络拓扑感知数据传输优化 · 2026-08 v2 修订 · 与 §IX 53 PipeMax + DualPath + AMPD 同方向 · paper_card 待建)+ 🟠 TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源(§IX 56 立基础延展第 5 件 · ① TGI EOL = 2025-12 进入维护模式 · 只接受 minor bug fix PR · HuggingFace 官方 2026-08 二次确认 · 推荐迁移 vLLM/SGLang · ② Stripe 案例 = vLLM Blog 2026-07-15 · 每日 5000 万调用 · GPU 舰队缩至 1/3 · 成本 -73% · PagedAttention 消除 60-80% KV cache 碎片化内存浪费 · 双周发版节奏 · GLM-5.2 on 24× NVIDIA B300 Day-0 · Kimi K3 preview 2026-07-21 · ③ H100 基准三方新源 = PremAI(SGLang ~16,200 / vLLM ~12,500 / LMDeploy ~16,200)+ Particula(SGLang 894 output / vLLM 413 output + TTFT 79 vs 103 + DeepSeek V3 3.1× vs vLLM + EAGLE 1.8×/1.5×)+ Spheron(vLLM 1,850 / SGLang 1,920 / TRT-LLM 2,100 tok/s 50 并发实测)+ Atomic + AIMultiple · SGLang v0.4 调度器 <2% CPU 开销 · SGLang 2026 时间线(Kimi K3 day-0 + TPU 全功能 + GLM5.2 NVFP4 500 TPS + DFlash + Spec V2 + DeepSeek-V4 + GB300 NVL72 25×)+ bench_serving 命令清单 · The AI Engineer 四选一决策框架 Ollama/SGLang/vLLM/TensorRT-LLM/llama.cpp)+ §IX 55 沿用 6 件立基础延展(K8s+LLM Inference 完整数值层 framsouza §1.(1) + §1.(2)(Mistral Large 123B BF16 · 每 token 0.344 MB · 128K 单请求 ~44 GB · GPU 显存三分 246 GB 权重 + 30 GB activations/CUDA + 360 GB KV cache 预算 · H100 80GB 单卡 ~16-44 conversation 并发 · KEDA 按 vllm:gpu_cache_usage_perc > 80-85% 触发 scale-up · K8s Gateway API Inference Extension + KV cache indexer · DRA GPU 拓扑感知分配 + LeaderWorkerSet + Kueue/Volcano gang scheduling · KServe v0.17 upstreamed spec.kvCacheOffloading.cpu: 10Gi)+ DefensiveKV ICLR 2026(GitHub FFY0/DefensiveKV · NVIDIA KVPRESS + 2 行 Defensive Aggregation · SnapKV 原文"无损"实测 RULER 20% = 39.0 · DefensiveKV = 85.3 · LayerDefensiveKV = 91.4 · 单 RTX 4090 ≤1 小时 RULER 10% · arXiv ID 待核)+ kv-cache-analyzer CLI bs258q(MIT · 多场景 LRU hit rate 实测 llama-3-70b · customer-support ~92%/67% · code-assistant ~92%/60% · RAG QA ~93%/30% 新鲜度优先 · 512 MB 文件限制 + JSON depth limit + 防 symlink + CI/CD check_cache_regression())+ llm-d KV Cache 路由 already-upstreamed vLLM v0.23(llmd-fs-connector==0.23 = vLLM v0.23 FS tier · KVEvents 架构 · vLLM pod → 事件流 → KV Block Index → Scheduler 打分 → 路由决策 · 跨 Pod 缓存共享)+ vLLM 8 月三件 blog 汇总(vllm-project.github.io/blog 2026-07-29 vLLM Reaches 25K Total TPS/GPU on Qwen3.5 + 2026-08-06 Decode Context Parallelism + 2026-08-07 Efficient Decode Context Parallelism** + 2026-04-21 State of FP8 KV-Cache and Attention Quantization)+ TurboQuant 数字矛盾警示(Google TurboQuant ICLR 2026 提及 arXiv 2605.19660 · jay 6-11 = KV cache 2.69-4.4× · AIxFunda Substack 2026-08-22 = 6× + 8× + H100 零精度损失 · 不同 model family/精度/上下文长度评测条件需 PDF 核验 · SGLang PR #21617/21618 状态需 GH 跟踪)+ 2 件邻接升级(RMM arXiv:2608.13426 paper_card 952 主分类 llm-infra 邻接升级候选 ★ 中档 · Power Law Graph Attention arXiv:2608.10288 paper_card 920 邻接候选 ☆)+ §IX 54 沿用 FlashPrefill V2 arXiv:2608.19758 paper_card 1039 + InferScale arXiv:2607.27090 paper_card 待建 + Online KV Cache Compaction arXiv:2608.00902 paper_card 待建 + DualPath arXiv:2602.21548v2 paper_card 139 + Chain-of-Experience arXiv:2608.18027 paper_card 1045 + Cross-Model KV Cache Transfer arXiv:2608.03893 paper_card 待建 + OasisKV arXiv:2608.08097 paper_card 待建 + vLLM 0.27.0 = CVE-2026-73558 修复门槛 + §IX 53 沿用 30+ 件 + §IX 52 沿用 18 件 + §IX 51 沿用 16 件 + §IX 50 沿用 13 件 + §IX 49 沿用 12 件 + §IX 48 沿用 15 件 + §IX 47 沿用 15 件 + §IX 45-46 沿用 28 件。

(2) 推理调度 9+1+1+2+1+1+2+1 学派(沿用 §IX 48-55 + §IX 56 沿用 = CoRun 候选学派第 16 件)+ §IX 56 推理调度学派沿用 §IX 55 = CoRun arXiv:2608.14376(连续 batching 形状固定 + prefill 隔离 + decode pad + deterministic collectives + 15-324% 吞吐 + bit-identical 输出)锚入 + 沿用 §IX 52 EuroSys 2026 FlexPipe + TokenFlow + HPDC 2026 ATLAS + IEEE DCOSS-IoT 2026 Best Paper + §IX 51 NVIDIA Dynamo 1.0 + vLLM V1 + Qwen3.8-2.4T-A95B + KServe v0.17 + llm-d CNCF v0.7 + MCP 2026-07-28 stateless + Nexus 2507.06608 + Not All Prefills 2603.13358 + Mix-Quant + KVServe + §IX 50 OpScale arXiv:2608.13499 + §IX 56 立基础延展邻接级 = vLLM Conference 8-25 Roadmap Q3 六轴官方公告(Flat Model + MRV2 + 多级 KV Offloading + 1000+ TPS 推测解码 + 量化 KV Cache 生产级压缩 + llm-d 推进 + Rust Frontend 生产化 + SIG Spec Decode Q3 + Cold Start Q3 子主题 6 件 + Sprint 机制取代 Q2 论坛形式 · 当前 sprint = GLM5.2 + DSpark)+ TGI EOL + Stripe 73% + SGLang v0.4 调度器 <2% + llm-d KV Cache 路由 already-upstreamed vLLM v0.23 + Spheron 2026 vLLM 1,850/SGLang 1,920/TRT-LLM 2,100 tok/s + ServerGurus PD disaggregation(p99 -90%/GPU 成本 -40%)+ HLD Blog 三件 PD disaggregation + vLLM 8 月 blog 三件 + 推理框架 <24h CVE 响应 SOP。

(3) KV Cache 19 → 21 路线(沿用 §IX 53-54 + §IX 56 邻接升级 3 件 = 第 20 路线 + 第 21 路线 + DualPath + PIM-DIMM HotInfra'26 二次量化 + DistillCache + ReCache + Topology-Aware v2)+ §IX 56 KV Cache 路线沿用 §IX 54/55 + 3 件邻接升级 = InferScale arXiv:2607.27090 第 20 路线(GPU 原生 KV Injection + Jasper <25 MB/conversation)+ Online KV Cache Compaction arXiv:2608.00902 第 21 路线(长程 Agent 在线压缩)+ DualPath arXiv:2602.21548v2 邻接级(Storage → Decode → Prefill 1.87×/1.96×)+ HotInfra'26 PIM-DIMM 39.7× Cost/Mtoken + §IX 56 立基础延展邻接级 3 件 = DistillCache arXiv:2608.08878(KL 引导自适应 KV Cache 驱逐 + 5 维特征 + 对标 H2O/SnapKV · 自适应驱逐算法新基线 · paper_card 待建)+ ReCache arXiv:2608.19662(动态工具调用 agentic KV 缓存复用首个专项 · 与 Chain-of-Experience 邻接 · paper_card 待建)+ Topology-Aware Data Movement arXiv:2607.28633v2(PD disaggregation 70B 模型 KV cache 1.3 GB/请求 + 网络拓扑感知数据传输优化 + v2 修订 2026-08 + 与 §IX 53 PipeMax + DualPath 同方向 · paper_card 待建)+ §IX 55 立基础延展邻接级 = DefensiveKV ICLR 2026(SnapKV 39.0/85.3/91.4 · 压缩安全方向补位)+ kv-cache-analyzer CLI(RAG QA 30% within-session)+ llm-d KV Cache 路由 upstreamed vLLM v0.23(分布式 KV 索引补位)+ TurboQuant 数字矛盾警示(arXiv 2605.19660 + 数字差异待核)+ §IX 53 全部 17 路线 + §IX 52 KV Cache 基础设施重构四件套 + §IX 51 KV Cache Transform Coding + Queueing-Theoretic + §IX 49 CXL+PIM + C2KV KDD 2026 第 13 路线 + Awesome-KV-Cache-Optimization(jjiantong 378★·HotPrefix 前缀热力感知调度)+ §IX 52 Online KV Scheduling MC-SF + Cross-Model Memory Transfer Engram + Pipeline 全栈 PagedAttention + 邻接级补强。

(8) 稀疏注意力 · Linear Attention · Mamba-3 · Hybrid SSM(沿用 §IX 51 + §IX 54 + §IX 56 H200 FP8 47.26× 升级 = FlashPrefill V2 稀疏注意力主轴候选)+ §IX 56 稀疏注意力沿用 §IX 54 = 🔴 FlashPrefill V2 arXiv:2608.19758 paper_card 1039 已建(block-sparse prefill + mean correction + FA3/4 对齐 sparse attention + SGLang backend 集成 · §IX 56 新增 H200 FP8 128K 47.26× 升级 + SGLang 集成路径 + H20 存量工程意义 · 128K TTFT -2.1× ~ -4.8× BF16/FP8)+ §IX 53 CoRun = 调度层稀疏化 + FlashPrefill V2 = attention 计算层稀疏化 + §IX 55 邻接升级 Power Law Graph Attention arXiv:2608.10288 paper_card 920(claim 待核)+ HF Daily 8-24 沿用 8-21 立标池 + 立基础延展(沿用)。

(9) 量化经济学(沿用 §IX 53 + §IX 54 Particula Tech H100 + Schema 7× + TGI 维护 + SGLang 400K+ GPU + Cursor/LinkedIn/Azure/xAI Grok 3 + EAGLE 多 token + ServerMO 安全部署 + HotInfra'26 PIM-DIMM + Particula 三源对照)+ §IX 56 量化经济学沿用 §IX 54 + §IX 56 🟡 TGI EOL + Stripe 73% + H100 三方新源 立基础延展候选(TGI EOL 2025-12 维护模式 2026-08 官方二次确认 · 推荐迁移 vLLM/SGLang · Stripe 每日 5000 万调用 GPU 舰队缩至 1/3 成本 -73% · PremAI/Particula/Atomic/AIMultiple H100 基准对照 · SGLang v0.4 调度器 <2% · DeepSeek V3 MLA 3.1× · EAGLE 1.8×/1.5× · bench_serving · The AI Engineer 四选一决策框架)+ §IX 56 🟡 vLLM Conference 8-25 Roadmap Q3(量化 KV Cache 生产级压缩 + 1000+ TPS + Cold Start Q3)+ §IX 55 🟡 TurboQuant 数字矛盾警示 沿用(arXiv 2605.19660 · jay 6-11 = 2.69-4.4× · AIxFunda = 6×/8× · 数字差异显著)+ §IX 55 🟡 vLLM 8 月 blog 汇总(State of FP8 KV-Cache and Attention Quantization 2026-04-21 + Decode Context Parallelism)+ §IX 55 🟡 RMM arXiv:2608.13426 邻接升级候选 沿用(训练无关输入自适应矩阵乘 1B-70B · 与 AWQ/GPTQ 正交可叠加)+ 沿用 §IX 53 全部 5 CSDN inference 量化 + §IX 52 7 CSDN inference 量化 + §IX 49 沿用 12 件 + §IX 48 沿用 15 件 + §IX 47 沿用 15 件 + §IX 45-46 沿用 28 件。

(10) 7 大顶会议 KV-cache + KV cache 三层算力栈 + 顶会密集部署 + 系统栈(沿用 §IX 53 全部 + §IX 54 立基础延展 4 件 HotInfra'26 + Particula Tech + AI Agents Stack Eval gap + TGI 维护模式 + ServerMO 安全部署命令)+ §IX 56 Vector DB 沿用 §IX 54 Qdrant v1.14 + CNCF KubeCon NA + Red Hat AI Inference llm-d + A2A 治理 + vToken + ICMSP/NIXL + MemoryAlloy(同 §1.(3))作为 §1.(10) 顶会密集部署邻接补丁 + §IX 56 🟠 K8s+LLM Inference 完整数值层 立基础延展候选级补强 1 件(Mistral Large 123B 显存三分 + KEDA + GIE + DRA/LWS + KServe v0.17)+ §IX 56 🟠 Spheron 2026 + ServerGurus PD disaggregation + HLD Blog 三件 + vLLM Conference 8-25 Roadmap Q3 + TGI EOL + Stripe 73% 立基础延展候选级补强 2-6 件(Spheron vLLM 1,850/SGLang 1,920/TRT-LLM 2,100 tok/s 50 并发实测 · ServerGurus p99 latency -90% / GPU 成本 -40% · HLD Blog 2026-08-16/18/20 PD disaggregation 三件 · vLLM Conference 8-25 Roadmap Q3 6 主轴 + Cold Start Q3 6 子主题 · TGI EOL + Stripe 73% 案例)+ §IX 56 🟠 kv-cache-analyzer CLI + llm-d KV Cache 路由 upstreamed vLLM v0.23 + vLLM 8 月三件 blog + TurboQuant 数字矛盾警示 + 3 件 KV Cache 新论文邻接升级 立基础延展候选级补强 3-8 件 + §IX 54 沿用 EuroSys 2026 系统论文 6 件(同 §1.(2))+ §IX 53 沿用 HPDC 2026 ATLAS + IEEE DCOSS-IoT 2026 Best Paper Award(同 §1.(2))。

横切层(11-13)

(11) Kernel/AI 自动化/Harness(沿用 §IX 53 全部 + §IX 54 立基础延展 FlashPrefill V2 + InferScale + Online KV Compaction + Cross-Model Memory Transfer + AI Agents Stack 2026 Edition + Eval 37pp gap + Chain-of-Experience + TGI 维护模式 + ServerMO 安全部署命令)+ §IX 56 🟠 FlashPrefill V2 H200 FP8 47.26× 升级 = §IX 56 §1.(11) + §1.(13) 立基础延展第 1 件 + 稀疏注意力算子层二次升级 + §IX 56 🟠 vLLM Conference 8-25 Roadmap Q3 = §IX 56 §1.(11) + §1.(13) 立基础延展第 2 件 + 推理引擎版本治理 + 生产稳定性提升 + 自动化测试 + §IX 56 🟠 Photon 2.0 Physical AI megakernel = §IX 56 §1.(11) + §1.(13) 立基础延展第 3 件 + 推理引擎"专用化分支"补强 + §IX 56 🟠 3 件 KV Cache 新论文邻接升级(DistillCache + ReCache + Topology-Aware v2) = §IX 56 §1.(11) + §1.(13) 立基础延展第 4 件 + KV Cache 自适应驱逐 + agentic 复用 + 分布式数据移动三方向补强 + §IX 56 🟠 TGI EOL + Stripe 73% + H100 三方新源 = §IX 56 §1.(11) + §1.(13) 立基础延展第 5 件 + 推理框架选型决策树 + 生产成本案例 + §IX 55 🟠 RMM arXiv:2608.13426 paper_card 952 邻接升级 沿用 + §IX 55 🟠 Power Law Graph Attention arXiv:2608.10288 paper_card 920 邻接升级 沿用 + 沿用 §IX 52 全部 5 件 + §IX 51 全部 16 件 + §IX 50 沿用 全部。

(12) End-to-End Pipeline 7 件(沿用 §IX 38-55 轮 7 件基础 + §IX 55 立基础延展 10 件 KV Cache + Serving Security + Pipeline 邻接)

§IX 56 §1.(12) Pipeline 沿用 + 5 件新签: - (i) KV Pool 沿用 §IX 55 全部(vToken arXiv:2608.13263 + ICMSP/NIXL + MemoryAlloy)+ Awesome-KV-Cache-Optimization(jjiantong 378★·HotPrefix 前缀热力感知调度= §IX 52 立基础延展第 1 件)+ §IX 55 立基础延展 4 件 = InferScale arXiv:2607.27090 GPU 原生 KV Injection + Online KV Cache Compaction arXiv:2608.00902 + DualPath arXiv:2602.21548v2 KV-Cache 加载重平衡 + HotInfra'26 PIM-DIMM 二次量化(详见 §1.(3))+ KV Cache 互联网级重构四件套(An Internet for the KV Cache / PipeMax / Online KV Scheduling MC-SF / Reimagining HotInfra'26 PIM-DIMM)(详见 §1.(3))+ §IX 55 立基础延展第 1-4 件 = DefensiveKV ICLR 2026(SnapKV 39.0/85.3/91.4)+ kv-cache-analyzer CLI(可观测性)+ llm-d KV Cache 路由 upstreamed vLLM v0.23 + TurboQuant 数字矛盾警示(详见 §1.(3))+ §IX 56 立基础延展第 4 件 = DistillCache arXiv:2608.08878(KL 引导自适应 KV 驱逐 · 对标 H2O/SnapKV)+ ReCache arXiv:2608.19662(agentic KV 复用首个专项 · 与 Chain-of-Experience 邻接)+ Topology-Aware Data Movement arXiv:2607.28633v2(PD disaggregation 70B 1.3 GB/请求 · v2 修订 2026-08) - (ii) Engine:🔴 FlashPrefill V2 arXiv:2608.19758 block-sparse prefill 块稀疏 attention + 128K TTFT -2.1× ~ -3.4× BF16 + -3.7× ~ -4.8× FP8 + §IX 56 H200 FP8 47.26× 升级 + SGLang 注意力后端集成路径 + H20 存量工程意义(paper_card 1039 已建)+ 🟠 Photon 2.0(Moondream · 2026-08-03 · Physical AI 专用 megakernel · H100 ChartQA 全面优于 vLLM/SGLang)+ 🟠 Particula Tech SGLang vs vLLM H100 Benchmark(SGLang +29%/+117%)+ 🟠 SGLang vs vLLM Schema 7× 差距 + 🟠 TGI EOL 官方二次确认 + 推荐迁移 vLLM/SGLang + 🟠 SGLang 400K+ GPU + Cursor/LinkedIn/Azure/xAI Grok 3 采纳清单 + 🟠 EAGLE 多 token 推测 batch=1 1.8× / batch=32 1.5× + 🟠 ServerMO 安全部署命令(--host 127.0.0.1)+ 🟠 vLLM 0.27.0 = CVE-2026-73558 修复门槛 + §IX 56 🟠 vLLM Conference 8-25 Roadmap Q3 六轴官方公告(Flat Model + MRV2 + 多级 KV Offloading + 1000+ TPS 推测解码 + 量化 KV Cache 生产级压缩 + llm-d 推进 + Rust Frontend 生产化 + SIG Spec Decode Q3 = production agentic workload + high-interactivity premium tokens · github.com/vllm-project/vllm/issues/48168 + vllm.ai/events/vllm-conference/2026)+ §IX 56 🟠 Stripe 73% 成本案例 + SGLang v0.4 调度器 <2% CPU 开销 + DeepSeek V3 MLA 3.1× + bench_serving 命令清单(vLLM Blog 2026-07-15 + PremAI/Particula/Atomic/AIMultiple 8 月对照 · The AI Engineer 四选一决策框架 Ollama/SGLang/vLLM/TensorRT-LLM/llama.cpp)+ 沿用 §IX 53 CoRun + SGLang Advanced CUDA Graph + DeepSeek-V4-Pro H20 + Miles v0.1 + vLLM 0.27.1 release + DeployBase A100 + Lyceum + Stripe 73% + GLM-5.3 + CSDN inference 实战 8 件 - (iii) Sched:🔴 CoRun 候选学派级延展(同 §1.(2) + §1.(1) = 调度 + graph 配置层双层优化)+ 🟠 Particula Tech H100 Benchmark(同 §1.(2) · SGLang RadixAttention cache-aware 调度 vs vLLM PagedAttention continuous batching)+ 🟠 KV Cache 互联网级重构四件套(详见 §1.(3))+ 🟠 EuroSys 2026 系统论文 6 件(沿用 §IX 52 详见 §1.(2))+ 🟠 HPDC 2026 ATLAS + IEEE DCOSS-IoT 2026 Best Paper Award Collaborative Edge TPU(沿用 §IX 52 详见 §1.(2))+ §IX 56 🟠 vLLM Conference 8-25 Roadmap Q3 SIG Spec Decode Q3 + Cold Start Q3(production agentic workload + high-interactivity premium tokens + 降低冷启动时间 + Scheduler 重构 + KV Cache Manager 重新设计 + Sprint 机制取代 Q2 论坛形式 · 当前 sprint = GLM5.2 + DSpark)+ §IX 56 🟠 K8s+LLM Inference 完整数值层 framsouza 沿用(KEDA KV cache pressure + GIE 前缀路由 + DRA/LWS + KServe v0.17 · §IX 55 立基础延展第 5 件)+ §IX 56 🟠 Spheron 2026 50 并发实测 + ServerGurus PD disaggregation p99 -90% / GPU 成本 -40% + HLD Blog 2026-08-16/18/20 三件 PD disaggregation(§IX 55 立基础延展第 6 件) - (iv) Service Concurrency Safety:沿用 §IX 53-55 + Reasoning 模式吞吐 -68% / 准确率 +7.5pp 开关代价 + The Silent Hyperparameter arXiv:2605.19537 + §IX 56 沿用 CVE-2026-73558 多租户 KV 泄漏核验 + lmdeploy CVE-2026-33626 SSRF 武器化警示 - (v) Harness Reliability:🟡 Harness Engineering arXiv:2607.08028 + Context Engineering arXiv:2603.09619 + AI Serving 形式化优化 arXiv:2605.01280 + AI Agents Stack 2026 + Eval 37pp gap + Context-Bench / Recovery-Bench / Terminal-Bench(沿用 §IX 52-54)+ §IX 56 🟠 kv-cache-analyzer CLI + check_cache_regression() CI/CD + DefensiveKV ICLR 2026 + vLLM Conference 8-25 Roadmap Q3 = 推理引擎版本治理 + 生产稳定性提升 + 自动化测试 + Sprint 机制 - (vi) Agent Security:沿用 §IX 53-55 全部 + 🔴 vLLM CVE-2026-73558 跨用户 KV 数据泄漏(NVD/OpenCVE/GHSA-7m6h-x95x-82q5 三源独立确认 · <0.27.0 影响 · ≥0.27.0 修复 · 多租户部署立即核查版本)+ 🔴 LMDeploy CVE-2026-33626 SSRF 12h31m 武器化(Sysdig 2026-08-19 · 端口扫描 + 内网探测利用模式 · 推理框架 <24h 补丁响应 SLA 新基准)+ 🟠 SGLang CVE-2026-3059/3060/3989 多模态/分拆去序列化(ZMQ 21950 + --enable-multimodal-gen/--enable-disaggregation 启动检查)+ 🟠 ServerMO 安全部署命令(--host 127.0.0.1 严格绑定 + --mem-fraction-static 0.8)+ 🟠 推理框架 <24h CVE 响应 SOP(监控源 NVD + CISA KEV + GitHub Advisories + OpenCVE · 关键 CVE <24h · 高危 <72h · 推理 API 永不绑定 0.0.0.0)+ §IX 56 沿用 §IX 55 全部 + TGI EOL 官方二次确认(2025-12 维护模式生效 2026-08 HuggingFace 官方确认推荐迁移 vLLM/SGLang)+ Stripe 73% 成本案例(vLLM Blog 2026-07-15) - (vii) Eval + Inference Engineering 67 → 71 件套扩面:§IX 56 新增 5 件 = FlashPrefill V2 H200 FP8 47.26× 升级 + vLLM Conference 8-25 Roadmap Q3 六轴官方公告 + Photon 2.0 Moondream Physical AI 专用 megakernel + 3 件 KV Cache 新论文邻接升级(DistillCache + ReCache + Topology-Aware v2)+ TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源 = 5 + 3 + 1 = 9 件扩面 + 沿用 §IX 55 §IX 54 §IX 53 §IX 52 §IX 51 §IX 50 §IX 49 §IX 48 §IX 47 全部 + 第 71 件套 = 推理工程学科化 §IX 56 扩面完成

(13) 边界扩展(沿用 §IX 38-55 + §IX 56 新增 ≥ 5 子轴候选)= 共 ≥ 136 子轴候选(§IX 55 ≥ 131 → §IX 56 ≥ 136 扩面)。反方 #91/#92/#93/#94 + 第 12 + 23 + 24 + 25 + 26 类风险候选分配沿用 + §IX 56 新增 ≥ 10 P0 待核警示 = FlashPrefill V2 H200 vs H20 加速比差异 + vLLM Conf 8-25 1000+ TPS 目标非已实现 + Stripe 73% 公司自报待独立验证 + llm-d Gateway API 集成形态需原文核验 + Photon 2.0 仅二手摘要 + 3 件 KV 新论文(DistillCache/ReCache/Topology-Aware v2)均二手摘要 + DistillCache 对标 H2O/SnapKV 公平性 + ReCache 工具集评测未公开 + Topology-Aware 与 §IX 53 PipeMax 重合独立核验 + PremAI 数字无原始命令 + Particula 无复现步骤 + SGLang v0.4 <2% 开销 PR/代码核验 + 立标池双向锚 6 向并存沿用 + 立标信号强度 ≠ 立标等级评估 v45 首次机制化沿用 + v56 第三次稳态 + 反思棒 第 23 次 + 跨实例互评 8-23 evening 棒 第 8 件 + llm-infra 双端缺位 第 23 例 + spark llm-infra-e1prep 8-23 evening 棒兑现 5 件补位主线 + 5 件延后(4 件 8-23 新增:DistillCache/ReCache/Topology-Aware + Photon 2.0 物理 AI)+ HF Daily 8-24 立标池双向锚第 10 日稳态(0 件 llm-infra 主轴 net-new)+ 立标饱和度机制 v47 三态切换 + 8-24 paper_cards 主分类 llm-infra net-new 0 件(连续第 2 个零新增日 · 沿用 §IX 55 0 件主轴 + §IX 54 4 arXiv 主轴 + 立基础延展 6 件 + §IX 56 5 件)+ 5 件工程化层级 net-new + 1 件工具链 = 立标池饱和度供给侧 v55 反转"主分类 paper_card 净增 0 件 + 方法/系统级 net-new 6 件 + 工程化层级 net-new 6 件"双锚点 → v56 维持"主分类 paper_card 净增 0 件 + 工程化层级 net-new 5 件 + 邻接级 net-new 3 件"三锚点 + 推理工程学科化第 9 维 67 → 71 件套扩面 + 边界扩展 131 → ≥ 136 子轴候选扩面 + 跨实例标签二档法首次传染到活文档主线 + 立标等级判定四档法首次传染到活文档主线 + 反方三段式与 §2.13 量化沿用。

2. 关键工作与脉络(精简索引)

§IX 56 轮新增 5 件关键工作 = (1) 🟠 FlashPrefill V2 H200 FP8 47.26× 升级 + SGLang 集成路径 + H20 存量工程意义(H200 FP8 128K 上下文 47.26× 加速 vs FA2 · 30.49× vs FA3/4 密集基线 · BF16 27.19× · 均值修正项 + PackGQA + warp specialization · 兼容 FA3/4 而非 Fork FA2 · SGLang 注意力后端集成路径 · 国内 H20 算力存量工程价值 · jay 8-23 engineering 棒增量 1 同源 spark 8-23 llm-infra e1prep 增量 1)§1.(8) + §1.(11) + §1.(13) 立基础延展第 1 件 + (2) 🟠 vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(github.com/vllm-project/vllm/issues/48168 + vllm.ai/events/vllm-conference/2026 · SIG Core 6 主轴 = Flat Model top 20 架构迁移 + MRV2 迁移 + MRV1 弃用 + 生产稳定性 + Scheduler 重构 + KV Cache Manager 重新设计 + Rust Frontend 生产化 · + Cold Start Q3 子主题 6 件 = 降低冷启动时间 Issue #48193 · + 基础设施子主题 = release-gating 准确性 + 性能回归测试覆盖度 · 自动 trace 上传与分析 · 扩展硬件覆盖 · + Sprint 机制取代 Q2 论坛形式 = GLM5.2 + DSpark 当前 sprint · + SIG Spec Decode Q3 重点 = production agentic workload + high-interactivity premium tokens · Q2 已达 TensorRT-level speed-of-light 性能 · + 会议详情 = vLLM Conference 由 Inferact(Woosuk Kwon + Simon Mo + Zachary Xi)主办 · co-located with Anyscale Ray Summit 2026-08-24 ~ 26 San Francisco · Day 1 Tuesday August 25 9:30 AM Keynotes + 12:30 PM State of vLLM 2026 · + NVIDIA 合作 session = Tuesday 1:15-1:45 PM PT "NVIDIA and vLLM Full-Stack Collaboration for DeepSeek and MiniMax Performance")§1.(1) + §1.(2) + §1.(12) 立基础延展第 2 件 + (3) 🟠 Photon 2.0(Moondream · 2026-08-03)= Physical AI 专用 megakernel 引擎(H100 ChartQA 全面优于 vLLM/SGLang · 推理引擎层"专用化分支"补强 · 适用场景 = 多模态 / Physical AI · 实测条件需 Moondream 官方 blog 核验)§1.(1) 立基础延展第 3 件 + (4) 🟠 3 件 KV Cache 新论文邻接升级(DistillCache arXiv:2608.08878 KL 引导自适应 KV Cache 驱逐 · 5 维特征 · 对标 H2O/SnapKV · paper_card 待建 + ReCache arXiv:2608.19662 动态工具调用 agentic KV 缓存复用首个专项 · 渐进式披露 + 工具集动态扩展 + schema 上下文管理 · 与 Chain-of-Experience 邻接方向互补 · paper_card 待建 + Topology-Aware Data Movement arXiv:2607.28633v2 PD disaggregation 70B 模型 KV cache 1.3 GB/请求 · 网络拓扑感知数据传输优化 · 2026-08 v2 修订 · 与 §IX 53 PipeMax + DualPath + AMPD 同方向 · paper_card 待建)§1.(3) + §1.(11) + §1.(12) 立基础延展第 4 件 + (5) 🟠 TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源(TGI 2025-12 进入维护模式 · 只接受 minor bug fix PR · HuggingFace 官方 2026-08 二次确认 · 推荐迁移 vLLM/SGLang · Stripe 每日 5000 万调用 GPU 舰队缩至 1/3 成本 -73% PagedAttention 60-80% 碎片消除 · 双周发版节奏 + 每日性能基准 + 精度评估 · GLM-5.2 on 24× NVIDIA B300 Day-0 · Kimi K3 preview 2026-07-21 · PremAI/Particula/Atomic/AIMultiple H100 基准对照 · SGLang v0.4 调度器 <2% CPU 开销 · DeepSeek V3 MLA 3.1× · EAGLE 1.8×/1.5× · bench_serving 命令清单 · The AI Engineer 四选一决策框架 Ollama/SGLang/vLLM/TensorRT-LLM/llama.cpp)§1.(1) + §1.(9) + §1.(12) 立基础延展第 5 件 + §IX 56 立基础延展候选合计 5 件 + 3 件邻接升级 + ≥ 10 P0 待核警示.

沿用历史快照(精简):§IX 55 沿用 8 件(K8s+LLM Inference 完整数值层 framsouza + DefensiveKV ICLR 2026 + kv-cache-analyzer CLI bs258q + llm-d KV Cache 路由 upstreamed vLLM v0.23 + vLLM 8 月三件 blog 汇总 + TurboQuant 数字矛盾警示 + RMM arXiv:2608.13426 paper_card 952 邻接升级候选 ★ 中档 + PLGA arXiv:2608.10288 paper_card 920 邻接候选 ☆);§IX 54 沿用 30+ 件(FlashPrefill V2 + InferScale + Online KV Cache Compaction + DualPath + CVE trio + Particula Tech H100 + Schema 7× + TGI 维护 + AI Agents Stack Eval gap + Chain-of-Experience + Cross-Model KV Cache Transfer + OasisKV + HotInfra'26 PIM-DIMM + ServerMO 安全部署命令 + vLLM 0.27.0 = CVE 修复门槛);§IX 53 沿用 30+ 件(CoRun + DASH + HBF Sucks + SGLang Advanced CUDA Graph + DeepSeek-V4-Pro H20 + Miles v0.1 + Cross-Model Memory Transfer + CSDN inference 实战 8 件 + DeployBase A100 + Lyceum + Stripe 73% + KV Cache 基础设施重构四件套 + vLLM 0.27.1 + GLM-5.3 + MCP 安全审计 + Qdrant v1.14 + CNCF KubeCon NA + Red Hat AI Inference llm-d + A2A 治理 + 阿里 Qwen-UI-Agent);§IX 52 沿用 18 件;§IX 51 沿用 16 件;§IX 50 沿用 13 件;§IX 49 沿用 12 件;§IX 48 沿用 15 件;§IX 47 沿用 15 件;§IX 45-46 沿用 28 件;§IX 44 沿用 14 件;§IX 41-43 沿用 33 件;§IX 35-40 沿用 30+ 件。

新增 arXiv ID(§IX 56 轮):§IX 56 主轴 0 件 net-new · 沿用 §IX 55 全部 4 件 + 1 件邻接级 + 2 件研究前沿 + 5 件 CVE 主轴级 + §IX 56 邻接升级 3 件研究前沿 = arXiv:2608.08878(DistillCache · KL 引导自适应 KV Cache 驱逐 · 5 维特征 · paper_card 待建 · 主分类 llm-infra 邻接升级候选 ★ 中档)+ arXiv:2608.19662(ReCache · 动态工具调用 agentic KV 缓存复用首个专项 · paper_card 待建 · 主分类 llm-infra 邻接升级候选 ★ 中档)+ arXiv:2607.28633v2(Topology-Aware Data Movement · PD disaggregation 70B 模型 1.3 GB/请求 · v2 修订 2026-08 · paper_card 待建 · 主分类 llm-infra 邻接升级候选 ★ 低档)+ §IX 55 沿用 2 件邻接升级(arXiv:2608.13426 RMM paper_card 952 + arXiv:2608.10288 PLGA paper_card 920)+ §IX 54 沿用 4 件主轴(paper_card 1039 2608.19758 + paper_card 待建 2607.27090 + paper_card 待建 2608.00902 + paper_card 139 2602.21548v2 主分类 llm-infra)+ 1 件邻接级(paper_card 1045 2608.18027)+ 2 件研究前沿(2608.03893 + 2608.08097)+ arXiv:2608.18050(沿用 §IX 53 Cross-Model Memory Transfer Engram · 邻接级)+ 5 件 CVE 主轴级(CVE-2026-73558 + CVE-2026-33626 + CVE-2026-3059 + CVE-2026-3060 + CVE-2026-3989)+ §IX 53 沿用 5 件 + §IX 52 沿用 5 件 + §IX 51 沿用 6 件 + §IX 50 沿用 3 件 + §IX 49 沿用 1 件 + §IX 48 沿用 9 件。

新增 CVE ID(§IX 56 轮):0 件 net-new · 沿用 §IX 55 全部 5 件 + §IX 53 沿用 16 CVE + 第 18-23 类风险候选 + 第 12 + 24 + 25 + 26 类风险候选沿用 = CVE-2026-73558(vLLM 跨用户 KV 数据泄漏 · 沿用 §IX 54 · NVD/OpenCVE/GHSA 三源独立确认 · <0.27.0 影响 · ≥0.27.0 修复)+ CVE-2026-33626(LMDeploy SSRF · 沿用 §IX 54 · Sysdig 2026-08-19 · 12h31m 武器化 · 0.12.2 修复)+ CVE-2026-3059/3060/3989(SGLang · 沿用 §IX 54 · Orca Security 2026-08 · ZMQ broker + 分拆编码器 + 崩溃转储重放)+ 沿用 16 CVE 全集 + 第 18-23 类风险候选 + 第 12 + 24 + 25 + 26 类风险候选沿用。

新增 URL(§IX 56 轮):5 件工程化补位工具仓库/博客 + 3 件邻接升级论文 + 2 件 vLLM Conference 官方 URL = github.com/vllm-project/vllm/issues/48168(vLLM Roadmap Q3 2026 · 6 主轴 + Cold Start Q3 子主题)+ vllm.ai/events/vllm-conference/2026(First vLLM Conference at Ray Summit · 8-24 ~ 26 San Francisco · Day 1 Tuesday August 25 9:30 AM Keynotes + 12:30 PM State of vLLM 2026 · NVIDIA 合作 session Tuesday 1:15-1:45 PM PT "NVIDIA and vLLM Full-Stack Collaboration for DeepSeek and MiniMax Performance")+ moondream.ai/blog/photon-2-launch(Photon 2.0 Physical AI 专用 megakernel 引擎 · H100 ChartQA 全面优于 vLLM/SGLang · 2026-08-03)+ premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026(PremAI H100 基准 SGLang 16,200 / vLLM 12,500 / LMDeploy 16,200)+ vllm.ai/blog(Stripe 73% 成本案例 · 每日 5000 万调用 · GPU 舰队缩至 1/3 · PagedAttention 60-80% 碎片消除 · 2026-07-15)+ blog.csdn.net/brandy/article/details/155517690(SGLang vs vLLM 选型 RadixAttention + PagedAttention + Llama3-70B-FP8 2×H100 场景表)+ blog.csdn.net/u013701860/article/details/148295809(bench_serving 工具命令 SGLang + vLLM backend + pd-separated)+ anyscale.com/ray-summit/2026(Ray Summit 2026 · 8-24 ~ 26 San Francisco · co-located with vLLM Conference)+ nvidia.com/en-us/events/ray-summit(NVIDIA at Ray Summit 2026 · NVIDIA and vLLM Full-Stack Collaboration session)+ arxiv.org/abs/2608.08878(DistillCache 邻接升级候选 ★ 中档)+ arxiv.org/abs/2608.19662(ReCache 邻接升级候选 ★ 中档)+ arxiv.org/abs/2607.28633v2(Topology-Aware Data Movement v2 修订 邻接升级候选 ★ 低档)+ §IX 55 沿用全部 URL 集合。

3. 共识与争议

3.1 共识(C1-C195, 195 条)

C191-C195(§IX 56 轮新增 5 条 · 精简):C191 🟠 FlashPrefill V2 H200 FP8 47.26× 升级 + SGLang 集成路径 + H20 存量工程意义(H200 FP8 128K 上下文 47.26× 加速 vs FA2 · 30.49× vs FA3/4 密集基线 · BF16 27.19× · 均值修正项(mean correction term)= 极端稀疏度下压制近似误差 · 算子设计 PackGQA + warp specialization · 兼容 FA3/4 而非 Fork FA2 · 原生支持 paged KV cache + continuous batching(vLLM/SGLang 生态兼容)· SGLang 注意力后端集成路径明确 · 国内 H20 存量意义 = 国内算力 H20 存量可观 · 该方向具有直接工程落地价值 · jay 8-23 engineering 棒增量 1 同源 spark 8-23 llm-infra e1prep 增量 1)+ §IX 56 §1.(8) + §1.(11) + §1.(13) 立基础延展第 1 件 + 稀疏注意力算子层二次升级;C192 🟠 vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(github.com/vllm-project/vllm/issues/48168 + vllm.ai/events/vllm-conference/2026 · SIG Core 6 主轴 = ① 完成 Flat Model 迁移 top 20 model architectures + 确保新 day-0 模型 Flat Model only · ② 完成 Model Runner V2 迁移 + MRV1 弃用 · ③ 生产稳定性提升 + 失败 ergonomic 改进 · ④ Scheduler 重构 · ⑤ KV Cache Manager 重新设计 · ⑥ Mark Rust Frontend + 重构 tool-calling 实现 = production ready · + Cold Start Q3 子主题 = 降低冷启动时间 Issue #48193 · + 基础设施子主题 = release-gating 准确性 + 性能回归测试覆盖度 · 自动 trace 上传与分析 · 扩展硬件覆盖 + 工作负载跟踪 · + Sprint 机制取代 Q2 论坛形式 = 列出每个模型的具体任务 · 当前 sprint = GLM5.2 + DSpark · + SIG Spec Decode Q3 重点 = production agentic workload + high-interactivity premium tokens · Q2 已达 TensorRT-level speed-of-light 性能 + disaggregated serving + KV offloading 成熟度 · Q3 重点 = production agentic + premium tokens · + 第 6 主轴 Rust Frontend 状态 = 实验阶段 PR #40848/#43283 已合并主线树 → production ready 目标 · + 会议详情 = vLLM Conference 由 Inferact(Woosuk Kwon + Simon Mo + Zachary Xi)主办 · co-located with Anyscale Ray Summit 2026-08-24 ~ 26 San Francisco · Day 1 Tuesday August 25 9:30 AM Keynotes + 12:30 PM State of vLLM 2026 · + NVIDIA 合作 session = Tuesday 1:15-1:45 PM PT "NVIDIA and vLLM Full-Stack Collaboration for DeepSeek and MiniMax Performance")+ §IX 56 §1.(1) + §1.(2) + §1.(12) 立基础延展第 2 件 + 推理引擎版本治理 + 生产稳定性提升 + 自动化测试 + Sprint 机制取代 Q2 论坛形式;C193 🟠 Photon 2.0(Moondream · 2026-08-03)= Physical AI 专用 megakernel 引擎(H100 ChartQA 全面优于 vLLM/SGLang · 推理引擎层"专用化分支"补强 · 与通用 vLLM/SGLang/TRT-LLM 互补而非竞争 · 适用场景 = 多模态 / Physical AI(机器人 / 物理交互 / 视觉动作)· 实测条件需 Moondream 官方 blog 核验 · 与 vLLM/SGLang 的对比基线是否公平(模型一致、数据一致)待核 · jay 8-23 trending 二手摘要 · moondream.ai/blog/photon-2-launch)+ §IX 56 §1.(1) 立基础延展第 3 件 + 推理引擎"专用化分支"补强;C194 🟠 3 件 KV Cache 新论文邻接升级(① DistillCache arXiv:2608.08878 = KL 引导自适应 KV Cache 驱逐 · 5 维特征(α_i 注意力质量 + ‖v_i‖₂ value 向量范数 + σ_i 跨头注意力方差 + 注意力质量 + 跨头方差)· 对标 H2O/SnapKV · 解决历史注意力模式无法预测下游生成价值 · paper_card 待建 · jay 8-23 trending 二手摘要 · 评测公平性需 PDF 核验 · ② ReCache arXiv:2608.19662 = 动态工具调用 agentic 场景 KV 缓存复用首个专项 · 渐进式披露(progressive disclosure)+ 工具集动态扩展 + schema 上下文管理 · 与 Chain-of-Experience §1.(11)/§1.(12) 邻接方向互补 · paper_card 待建 · 工具集动态扩展具体评测未公开 · ③ Topology-Aware Data Movement arXiv:2607.28633v2 = PD disaggregation 70B 模型 KV cache 1.3 GB/请求 · 网络拓扑感知数据传输优化 · 2026-08 v2 修订 · 与 §IX 53 PipeMax + DualPath + AMPD 同方向 · paper_card 待建 · 与 PipeMax/DualPath 是否重合需独立核验 · v2 修订变化未公开)+ §IX 56 §1.(3) + §1.(11) + §1.(12) 立基础延展第 4 件 + KV Cache 自适应驱逐 + agentic 复用 + 分布式数据移动三方向补强;C195 🟠 TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源(① TGI EOL = 2025-12 进入维护模式 · 只接受 minor bug fix PR · HuggingFace 官方 2026-08 二次确认 · 推荐迁移 vLLM(生产默认 / 生态最大)或 SGLang(前缀复用密集 / RAG/多轮 Agent)· jay 8-23 GitHub/HF 综合 + Substack · ② Stripe 案例 = vLLM Blog 2026-07-15 · 每日 5000 万调用 · GPU 舰队缩至 1/3 · 成本降低 73% · PagedAttention 消除 60-80% KV cache 碎片化内存浪费 · 双周发版节奏 + 每日性能基准 + 精度评估 · GLM-5.2 on 24× NVIDIA B300 Day-0 支持 · Kimi K3 preview 2026-07-21 · ③ H100 基准三方新源 = PremAI(SGLang ~16,200 / vLLM ~12,500 / LMDeploy ~16,200)+ Particula(SGLang 894 output / vLLM 413 output + TTFT 79 vs 103 + DeepSeek V3 3.1× vs vLLM + EAGLE 1.8×/1.5×)+ Spheron(vLLM 1,850 / SGLang 1,920 / TRT-LLM 2,100 tok/s 50 并发实测)+ Atomic + AIMultiple · SGLang v0.4 调度器 <2% CPU 开销(15-25% 降至)· SGLang 2026 时间线(Kimi K3 day-0 + TPU 全功能 + GLM5.2 NVFP4 500 TPS + DFlash + Spec V2 + DeepSeek-V4 + GB300 NVL72 25×)+ bench_serving 命令清单(SGLang + vLLM backend + pd-separated + 即拷即用)· The AI Engineer 四选一决策框架(Ollama 5 分钟跑起来 / SGLang 多用户共享上下文 / vLLM 请求完全唯一 / TensorRT-LLM NVIDIA 模型固定 + 1-2 周调优 / llama.cpp 边缘无 GPU/CPU 优先))+ §IX 56 §1.(1) + §1.(9) + §1.(12) 立基础延展第 5 件 + 推理框架选型决策树 + 生产成本案例.

C188-C190(§IX 55 沿用)C185-C187(§IX 54 沿用)C182-C184(§IX 53 沿用)C179-C181(§IX 52 沿用)C172-C175(§IX 50 沿用)C168-C171(§IX 49 沿用)C155-C167(§IX 48 沿用)C149-C154(§IX 47 沿用)C137-C148(§IX 45-46 沿用)C129-C136(§IX 44 沿用)C107-C117(§IX 38-41 沿用)C102-C106(§IX 37 沿用)

(沿用 C1-C101:详见 §7 沿革摘要 §VII 行)

3.2 争议(D1-D93, 93 条)

D89-D93(§IX 56 轮新增 5 条 · 精简):D89 🟠 FlashPrefill V2 H200 vs H20 加速比差异(H200 FP8 = 47.26× 加速 vs FA2 · 30.49× vs FA3/4 密集基线 · BF16 = 27.19× · H200 与 H20 在算力/带宽/架构上有差异 · H20 实际加速比需实测核验 · 不能直接套用 H200 数字做容量规划 · 建议今晚活文档接力时标注"H20 数字待实测 · H200 数字仅供参考"· 评测条件 batch size、序列长度分布、硬件环境细节需 arXiv §3-4 原文 PDF 核验);D90 🟠 vLLM Conference 8-25 Roadmap Q3 兑现风险 + Stripe 73% 数据自报性 + Photon 2.0 评测公平性(vLLM Conference 8-25 Roadmap Q3 六轴 1000+ TPS 是目标非已实现 · 兑现时间表待 8-25 会议确认 · Stripe 73% 数字来自 vLLM 官方博客(公司自报数据)需独立验证 · GLM-5.2 on 24× NVIDIA B300 Day-0 支持需 NVIDIA 硬件采购周期核验 · Kimi K3 preview(Jul 21)需实际生产部署核验 · Cold Start Q3 子主题降低冷启动时间 Issue #48193 数字待 Q3 末核实 · Sprint 机制取代 Q2 论坛形式 = 当前 sprint = GLM5.2 + DSpark · 任务具体性待跟踪 · Photon 2.0 Moondream 仅 jay 8-23 trending 二手摘要 · 实测条件(model family / 数据集 / batch size)需 Moondream 官方 blog 核验 · 与 vLLM/SGLang 的对比基线是否公平(模型一致、数据一致)待核);D91 🟠 3 件 KV Cache 新论文邻接升级评测公平性(DistillCache arXiv:2608.08878 仅 jay 8-23 trending 二手摘要 · 评测条件、公平性、实际加速比需 PDF 核验 · 是否对标 H2O/SnapKV 公平(同 baseline 模型/数据)待核 · ReCache arXiv:2608.19662 仅 jay 8-23 trending 二手摘要 · 工具集动态扩展具体评测未公开 · paper_card 待建 · Topology-Aware Data Movement arXiv:2607.28633v2 与 §IX 53/54 PipeMax/DualPath 是否重合需独立核验 · v2 修订变化内容未公开 · paper_card 待建 · arXiv ID 是否准确(2607.28633 v2)需 arXiv 官方检索确认);D92 🟡 H100 基准三方新源数据置信区间 + SGLang v0.4 调度器 <2% CPU 开销代码核验 + The AI Engineer 四选一决策框架交叉核验(PremAI 数字"~16,200 vs 12,500"来自第三方汇总无原始命令/复现步骤 · Particula 数据详尽但同无复现步骤 · 数字未标注置信区间 · SGLang v0.4 调度器 <2% CPU 开销需 SGLang PR/代码核验 · SGLang 2026 时间线(Kimi K3 day-0 + TPU 全功能 + GLM5.2 NVFP4 500 TPS + DFlash + Spec V2 + DeepSeek-V4 + GB300 NVL72 25×)每条需 SGLang README/官方公告核验 · DeepSeek V3 MLA 3.1× vs vLLM(Particula)需独立基准验证 · EAGLE 1.8×/1.5×(batch=1/batch=32)需 EAGLE 官方 README 核验 · The AI Engineer 四选一决策框架中 vLLM/SGLang 吞吐数字需与 inference.md §1.1 已有数字交叉核验 · 不同测试条件下数字可能不同 · 部署建议中"5 分钟内跑起来 → Ollama / 多用户共享上下文 → SGLang +29% / 请求完全唯一 → vLLM / NVIDIA + 模型固定 + 1-2 周调优 → TensorRT-LLM H100 15-30% 领先"与已有数据交叉验证);D93 🟡 立标池双向锚 v33 以来首次 6 向并存沿用 + 立标信号强度 ≠ 立标等级评估 双维度区分 v45 首次机制化沿用 + v56 第三次稳态 + 反思棒 第 23 次强制兑现棒 + 跨实例互评 8-23 evening 棒 第 8 件 + llm-infra 双端缺位 第 23 例 + spark llm-infra-e1prep 8-23 evening 棒兑现 5 件补位主线 + 5 件延后(其中 4 件为 8-23 新增:DistillCache/ReCache/Topology-Aware 三件 KV 新论文 + Photon 2.0 物理 AI)+ HF Daily 8-24 立标池双向锚第 10 日稳态(0 件 llm-infra 主轴 net-new)+ 立标饱和度机制 v47 三态切换 + 反方 #91/#92/#93/#94 候选沿用 + 第 12 + 23 + 24 + 25 + 26 类风险候选分配 + 8-24 paper_cards 主分类 llm-infra net-new 0 件(连续第 2 个零新增日 · 沿用 §IX 55 0 件主轴 + 沿用 §IX 54 4 arXiv 主轴 + 沿用立基础延展 6 件 + §IX 56 立基础延展 5 件)+ 5 件工程化层级 net-new(FlashPrefill V2 H200 升级 + vLLM Conference 8-25 Roadmap Q3 + Photon 2.0 + 3 件 KV 新论文邻接级)+ 1 件工具链 TGI EOL + Stripe 73% + H100 三方新源 = 立标池饱和度供给侧 v55 反转"主分类 paper_card 净增 0 件 + 方法/系统级 net-new 6 件 + 工程化层级 net-new 6 件"双锚点 → v56 维持"主分类 paper_card 净增 0 件 + 工程化层级 net-new 5 件 + 邻接级 net-new 3 件"三锚点 + 推理工程学科化第 9 维 67 → 71 件套扩面 + 边界扩展 131 → ≥ 136 子轴候选扩面 + 跨实例标签二档法首次传染到活文档主线 + 立标等级判定四档法首次传染到活文档主线 + 反方三段式与 §2.13 量化沿用.

D86-D88(§IX 55 沿用)D83-D85(§IX 54 沿用)D81-D82(§IX 53 沿用)D78-D80(§IX 52 沿用)D75-D77(§IX 51 沿用)D73-D74(§IX 50 沿用)D71-D72(§IX 49 沿用)D69-D70(§IX 48 沿用)D67-D68(§IX 47 沿用)D65-D66(§IX 46 沿用)D63-D64(§IX 45 沿用)D60-D62(§IX 44 沿用)D57-D59(§IX 43 沿用)D54-D56(§IX 42 沿用)D51-D53(§IX 41 沿用)D50(§IX 40 沿用)D49(§IX 39 沿用)D44-D48(§IX 38 沿用)

(沿用 D1-D43:详见 §3.2 上轮 §VII)

4. 开放问题(O1-O311, 311 条)

O302-O311(§IX 56 轮新增 10 条 · 精简):O302 🟠 FlashPrefill V2 H200 vs H20 加速比差异(H200 FP8 = 47.26× · H20 国内算力主流 · 架构/带宽差异 · H20 实际加速比需实测核验 · 不能直接套用 H200 数字做容量规划 · 建议标注"H20 数字待实测 · H200 数字仅供参考"· 评测条件 batch size、序列长度分布需 arXiv §3-4 原文 PDF 核验);O303 🟠 vLLM Conf 8-25 Roadmap Q3 兑现风险 + Stripe 73% 数据自报性 + Photon 2.0 评测公平性(vLLM Conf 六轴 1000+ TPS 是目标非已实现 · 兑现时间表待 8-25 会议确认 · Stripe 73% 数字来自 vLLM 官方博客公司自报数据需独立验证 · GLM-5.2 on 24× NVIDIA B300 Day-0 需 NVIDIA 硬件采购周期核验 · Kimi K3 preview 需实际生产部署核验 · Cold Start Q3 子主题数字待 Q3 末核实 · Sprint 机制当前 sprint = GLM5.2 + DSpark · 任务具体性待跟踪 · Photon 2.0 Moondream 仅 jay 8-23 trending 二手摘要 · 实测条件需 Moondream 官方 blog 核验);O304 🟠 3 件 KV Cache 新论文邻接升级评测公平性(DistillCache arXiv:2608.08878 仅二手摘要 · 评测条件、公平性、实际加速比需 PDF 核验 · 是否对标 H2O/SnapKV 公平待核 · ReCache arXiv:2608.19662 仅二手摘要 · 工具集动态扩展评测未公开 · Topology-Aware arXiv:2607.28633v2 与 §IX 53/54 PipeMax/DualPath 是否重合需独立核验 · arXiv ID 准确性需 arXiv 官方检索确认);O305 🟡 H100 基准三方新源数据置信区间 + SGLang v0.4 <2% CPU 开销代码核验 + The AI Engineer 四选一决策框架交叉核验(PremAI 数字无原始命令 · Particula 数据无复现步骤 · 数字未标注置信区间 · SGLang v0.4 调度器 <2% 需 PR/代码核验 · SGLang 2026 时间线每条需 README/官方公告核验 · DeepSeek V3 MLA 3.1× 需独立基准验证 · EAGLE 1.8×/1.5× 需 EAGLE 官方 README 核验);O306 🟡 立标池双向锚 6 向并存沿用 + 立标信号强度 ≠ 立标等级评估 v45 首次机制化沿用 + v56 第三次稳态 + 反思棒 第 23 次 + 跨实例互评 8-23 evening 棒 第 8 件 + llm-infra 双端缺位 第 23 例 + spark llm-infra-e1prep 8-23 evening 棒兑现 5 件补位主线 + 5 件延后(4 件 8-23 新增:DistillCache/ReCache/Topology-Aware + Photon 2.0 物理 AI)+ HF Daily 8-24 立标池双向锚第 10 日稳态(0 件 llm-infra 主轴 net-new)+ 立标饱和度机制 v47 三态切换 + 反方 #91/#92/#93/#94 候选沿用 + 第 12 + 23 + 24 + 25 + 26 类风险候选分配 + 8-24 paper_cards 主分类 llm-infra net-new 0 件(连续第 2 个零新增日 · 沿用 §IX 55 0 件主轴 + §IX 54 4 arXiv 主轴 + 立基础延展 6 件 + §IX 56 5 件)+ 5 件工程化层级 net-new + 1 件工具链 = 立标池饱和度供给侧 v55 反转双锚点 → v56 维持"主分类 paper_card 净增 0 件 + 工程化层级 net-new 5 件 + 邻接级 net-new 3 件"三锚点 + 推理工程学科化第 9 维 67 → 71 件套扩面 + 边界扩展 131 → ≥ 136 子轴候选扩面 + 跨实例标签二档法首次传染到活文档主线 + 立标等级判定四档法首次传染到活文档主线 + 反方三段式与 §2.13 量化沿用;O307 🟡 K8s+LLM Inference Mistral Large 123B 数值参考性 + MoE vs 稠密差异 + KEDA 单一信号(GPU cache pressure)需补 queue depth 监控 + DRA 在 K8s 1.31+ 才稳定部分生产环境 K8s 版本可能不支持 + DefensiveKV arXiv ID 待核(GitHub FFY0/DefensiveKV ICLR 2026 标注 + arXiv 编号未确认)+ DefensiveKV 评测仅在 RULER LMEval + 不同 model family 一致性待验 + SnapKV 39.0 vs DefensiveKV 85.3 是否在 RULER 之外泛化 + kv-cache-analyzer 数字来自 llama-3-70b + MoE vs 稠密差异 + RAG QA 30% within-session 不是 bug 而是 RAG 设计目标 + bs258q 仓库较新需关注 maintenance 状态 + llm-d 需 vLLM v0.23+ + 与 §IX 53 KV Cache 互联网级重构四件套关系尚未独立核验(沿用 §IX 55);O308 🟡 vLLM 8 月 blog Decode Context Parallelism 加速比需 blog 原文核验 + v59 vs §IX 55 双活文档归属对照 + KServe CRD spec.kvCacheOffloading.cpu 是预览版 API 字段 + TurboQuant arXiv ID 待核 + 2.69-4.4× vs 6×/8× 矛盾需 arXiv 2605.19660 原文核验 + SGLang PR #21617/21618 状态需 GH 跟踪 + H100 零精度损失声明需 PDF 核验 + RMM TLDR 被截断 + 完整性能数字需 PDF 核验 + RMM 1B-70B 覆盖范围是否包含 MoE 模型未说明 + RMM 与其他推理优化方法(FlashAttention / PagedAttention / 量化)的组合效果未验证 + Power Law Graph Attention "推理时经验性坍缩"claim + "exact generalization of scaled dot-product attention"严格数学声明需要核实证明 + Spheron Network = Spheron CTO 撰写有商业立场数据需独立验证 + Spheron 测试条件需完整核实 + 冷启动数字(28 分钟)对 TensorRT-LLM 是已知痛点非新发现 + ServerGurus 数据来源需独立核验(为 GPU 厂商相关方)(沿用 §IX 55);O309 🟡 InferScale arXiv:2607.27090 paper_card 补建 + 1.8-4.8 GB/conversation 评测条件 PDF 核验(沿用 §IX 54/55 主轴 missing + §IX 56 沿用);O310 🟡 Online KV Cache Compaction arXiv:2608.00902 paper_card 补建 + online vs offline compaction 实现细节 PDF 核验(沿用 §IX 54/55 主轴 missing + §IX 56 沿用);O311 🟡 RMM arXiv:2608.13426 1B-70B 覆盖范围是否包含 MoE 模型未说明 + RMM 与其他推理优化方法的组合效果未验证 + Power Law Graph Attention arXiv:2608.10288 "推理时经验性坍缩"claim + "exact generalization of scaled dot-product attention"严格数学声明需要核实证明(沿用 §IX 55 + §IX 56 沿用).

O299-O301(§IX 55 沿用)O296-O298(§IX 54 沿用)O294-O295(§IX 53 沿用)O291-O293(§IX 52 沿用)O288-O290(§IX 51 沿用)O286-O287(§IX 50 沿用)O284-O285(§IX 49 沿用)O280-O283(§IX 48 沿用)O276-O279(§IX 47 沿用)O272-O275(§IX 46 沿用)O265-O271(§IX 45 沿用)O252-O264(§IX 44 沿用)O241-O251(§IX 43 沿用)O232-O240(§IX 42 沿用)O216-O231(§IX 41 沿用)O208-O215(§IX 40 沿用

(沿用 O1-O207:详见 §4 上轮 §VII)

5. 趋势(T1-T51, 51 条)

T51(§IX 56 轮新增 1 条):2026 H2 LLM Infra 工程师复合角色 Phase 22 = §IX 55 Phase 21 全部沿用 + 🟠 FlashPrefill V2 H200 FP8 47.26× 升级 + SGLang 集成路径 + H20 存量工程意义(稀疏注意力算子层二次升级)+ 🟠 vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(Flat Model + MRV2 + 多级 KV Offloading + 1000+ TPS 推测解码 + 量化 KV Cache 生产级压缩 + llm-d 推进 + Rust Frontend 生产化 + SIG Spec Decode Q3 = production agentic workload + high-interactivity premium tokens + Cold Start Q3 子主题 6 件 + Sprint 机制取代 Q2 论坛形式 · 当前 sprint = GLM5.2 + DSpark · + NVIDIA 合作 session = "NVIDIA and vLLM Full-Stack Collaboration for DeepSeek and MiniMax Performance")+ 🟠 Photon 2.0(Moondream · 2026-08-03)= Physical AI 专用 megakernel 引擎(H100 ChartQA 全面优于 vLLM/SGLang · 推理引擎层"专用化分支"补强)+ 🟠 3 件 KV Cache 新论文邻接升级(DistillCache arXiv:2608.08878 KL 引导自适应 KV 驱逐 · 对标 H2O/SnapKV + ReCache arXiv:2608.19662 agentic KV 复用首个专项 + Topology-Aware Data Movement arXiv:2607.28633v2 PD disaggregation 70B 1.3 GB/请求 v2 修订)+ 🟠 TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源(TGI 2025-12 维护模式生效 2026-08 官方二次确认 · 推荐迁移 vLLM/SGLang · Stripe 每日 5000 万调用 GPU 舰队缩至 1/3 成本 -73% PagedAttention 60-80% 碎片消除 · PremAI/Particula/Atomic/AIMultiple H100 基准对照 · SGLang v0.4 调度器 <2% CPU 开销 · DeepSeek V3 MLA 3.1× · EAGLE 1.8×/1.5× · bench_serving 命令清单 · The AI Engineer 四选一决策框架 Ollama/SGLang/vLLM/TensorRT-LLM/llama.cpp)+ 🔴 FlashPrefill V2 arXiv:2608.19758 + 🔴 InferScale arXiv:2607.27090 + 🔴 Online KV Cache Compaction arXiv:2608.00902 + 🔴 DualPath arXiv:2602.21548v2 + 🔴 vLLM CVE-2026-73558 跨用户 KV 数据泄漏 + 🔴 LMDeploy CVE-2026-33626 SSRF 12h31m 武器化 + 🟠 SGLang CVE-2026-3059/3060/3989 + 🟠 Particula Tech H100 Benchmark + 🟠 Schema 7× + 🟠 TGI 维护 + 🟠 AI Agents Stack + 🟠 HotInfra'26 PIM-DIMM + 🟠 ServerMO + 🟠 Chain-of-Experience + 🟡 Cross-Model KV Cache Transfer + 🟡 OasisKV + 🔴 vLLM 0.27.0 + 🟠 SGLang 400K+ GPU + 🟠 EAGLE 多 token + 🟠 推理框架 <24h CVE 响应 SOP + HF Daily 8-24 立标池双向锚第 10 日稳态** = Phase 22.

T50(§IX 55 沿用)T49(§IX 54 沿用)T48(§IX 53 沿用)Phase 18 沿用。T47(§IX 52 沿用)Phase 17 沿用。T46(§IX 51 沿用)Phase 16 沿用。T45(§IX 50 沿用)Phase 15 沿用。T44(§IX 49 沿用)Phase 14 沿用。T43(§IX 48 沿用)Phase 13 沿用。T42(§IX 47 沿用)Phase 12 沿用。T41(§IX 46 沿用)Phase 11 沿用。T40(§IX 45 沿用)Phase 10 沿用。T39(§IX 44 沿用)Phase 9 沿用。T38(§IX 43 沿用)Phase 8 沿用。T37(§IX 42 沿用)Phase 7 沿用。T36(§IX 41 沿用)Phase 6 沿用。T35(§IX 40 沿用)Phase 5 沿用。T34(§IX 39 沿用)Phase 4 沿用。T32-T33(沿用 §IX 38 轮)

(沿用 T1-T31:详见 §5 上轮 §VII)

6. 引用清单

6.1-6.9 核心 ID 全集(精简)

  • 6.1 推理引擎 (70 + §IX 55 新增 8 件 + §IX 56 新增 3 件 = 81): 沿用 §IX 55 轮 70 + §IX 56 立基础延展 5 件 + 邻接升级 3 件 = §IX 56 轮新增 3 件 = vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(github.com/vllm-project/vllm/issues/48168 + vllm.ai/events/vllm-conference/2026)+ Photon 2.0(Moondream · 2026-08-03 · moondream.ai/blog/photon-2-launch · Physical AI 专用 megakernel · H100 ChartQA 全面优于 vLLM/SGLang)+ Stripe 73% 成本案例 + PremAI H100 基准对照(premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026)+ The AI Engineer 四选一决策框架 Ollama/SGLang/vLLM/TensorRT-LLM/llama.cpp + 沿用 §IX 55 全部 8 件 + §IX 54 沿用全部 30+ 件
  • 6.2 MoE/稀疏 (25 + §IX 56 新增 0 件 = 25): 沿用 §IX 53 全部 25 + §IX 56 沿用 FreeToken paper_card 987 arXiv:2608.16157 + DeepSeek-V4-Pro H20 1.6T MoE 邻接级 + Particula Tech SGLang 对 DeepSeek V3 3.1× 邻接级
  • 6.3 KV Cache/量化 (62 + §IX 55 新增 6 件 + §IX 56 新增 3 件 = 71): 沿用 §IX 55 轮 62 + §IX 56 立基础延展邻接级 3 件 = DistillCache arXiv:2608.08878(KL 引导自适应 KV Cache 驱逐 + 5 维特征 + 对标 H2O/SnapKV · paper_card 待建)+ ReCache arXiv:2608.19662(动态工具调用 agentic KV 缓存复用首个专项 · 与 Chain-of-Experience 邻接 · paper_card 待建)+ Topology-Aware Data Movement arXiv:2607.28633v2(PD disaggregation 70B 模型 KV cache 1.3 GB/请求 + 网络拓扑感知数据传输优化 + v2 修订 2026-08 + 与 §IX 53 PipeMax + DualPath 同方向 · paper_card 待建)+ 沿用 §IX 55 立基础延展 6 件 = K8s+LLM Inference Mistral Large 123B 0.344 MB/token + 128K 44GB + GPU 显存三分 + KEDA KV cache pressure + GIE 前缀路由 + DefensiveKV ICLR 2026(RULER 20% SnapKV 39.0 / DefensiveKV 85.3 / LayerDefensiveKV 91.4)+ kv-cache-analyzer CLI(RAG QA 30% within-session + 多场景 LRU hit rate 实测)+ llm-d KV Cache 路由 upstreamed vLLM v0.23(KVEvents + KV Block Index + Scheduler 打分)+ TurboQuant arXiv:2605.19660 数字矛盾警示 + RMM arXiv:2608.13426(训练无关输入自适应矩阵乘)+ FlashPrefill V2 arXiv:2608.19758(块稀疏 attention + SGLang backend 集成 + H200 FP8 47.26× 升级)+ InferScale arXiv:2607.27090(GPU 原生 KV Injection 个性化记忆)+ Online KV Cache Compaction arXiv:2608.00902(长程 Agent KV Cache 在线压缩)+ DualPath arXiv:2602.21548v2(KV-Cache 加载重平衡)+ Chain-of-Experience arXiv:2608.18027(推理时持续改进 loop)+ Cross-Model KV Cache Transfer arXiv:2608.03893(梯度无关闭式线性映射)+ OasisKV arXiv:2608.08097(KV 6.5-9.7× 压缩 + decode 2.1× 提速)+ Power Law Graph Attention arXiv:2608.10288(SDPA 精确泛化)+ §IX 53 轮沿用 DASH arXiv:2608.14333 + HBF Sucks arXiv:2608.11668v2 + An Internet for the KV Cache arXiv:2608.01526 + PipeMax arXiv:2605.02189 + Online Scheduling MC-SF arXiv:2502.07115v5 + Reimagining HotInfra'26 PIM-DIMM(论文无 arXiv ID)
  • 6.4 HPCA 2026 (13): 沿用上轮 13 件 wafer-scale 系统论文
  • 6.5 Agent 安全/记忆/评估 (69 + §IX 55 新增 2 件 + §IX 56 新增 1 件 = 72): 沿用 §IX 35th~55 轮 69 + §IX 56 沿用 §IX 55 轮新增 2 件 + TGI EOL 官方二次确认(2025-12 维护模式生效 2026-08 HuggingFace 官方确认推荐迁移 vLLM/SGLang)+ Stripe 73% 成本案例(vLLM Blog 2026-07-15 · 每日 5000 万调用 GPU 舰队缩至 1/3 成本 -73% PagedAttention 60-80% 碎片消除 · GLM-5.2 on 24× NVIDIA B300 Day-0 支持 · Kimi K3 preview 2026-07-21)+ Harness Engineering arXiv:2607.08028(沿用 §IX 52)+ Context Engineering arXiv:2603.09619(沿用 §IX 52)+ Cross-Model Memory Transfer arXiv:2608.17050(沿用 §IX 53)+ AI Serving 形式化优化 arXiv:2605.01280(沿用 §IX 53)+ Chain-of-Experience arXiv:2608.18027(沿用 §IX 54)+ Cross-Model KV Cache Transfer arXiv:2608.03893(沿用 §IX 54)+ AI Agents Stack 2026 Edition Eval 37pp gap(沿用 §IX 54)+ Context-Bench / Recovery-Bench / Terminal-Bench 新兴 Benchmark(沿用 §IX 54)+ Guardrails 范式转变(沿用 §IX 54)+ MCP 安全审计实锤(沿用 §IX 53)+ CVE trio(vLLM CVE-2026-73558 + LMDeploy CVE-2026-33626 + SGLang CVE-2026-3059/3060/3989 沿用 §IX 54)
  • 6.6 向量 DB/数据系统 (18 + §IX 55 新增 1 件 = 19): 沿用上轮 18 + §IX 55 轮新增 1 件 = LEANN MLSys 2026(StarTrail-org/LEANN · 图结构剪枝 + 选择性重计算 · 97% 存储节省)+ Qdrant v1.14 GPU 加速 HNSW + Multi-AZ 99.95% SLA + $50M Series B + Salt Technologies Q1 2026 Benchmark + HubSpot 200 亿向量 Qdrant + Vector DB 2026 大变局 邻接级沿用 + TEngineDB-V + Filtered Vector Search + DBAIOps + Data Agent 综述 4 件 SIGMOD/VLDB 2026 沿用
  • 6.7 SIGMOD 2026 LLM Serving 三件套 (5): CoDec DOI:10.1145/38020284 / AlignedServe DOI:10.1145/38020094 + 2605.23389v1 / HotPrefix DOI:10.1145/3749168
  • 6.8 CVE 全集(18 ID + §IX 56 沿用 = 18) = CVE-2026-73558 vLLM 跨用户 KV 数据泄漏 + CVE-2026-33626 LMDeploy SSRF 12h31m 武器化 + CVE-2026-3059/3060/3989 SGLang 多模态/分拆去序列化 + CVE-2026-5241 + CVE-2026-3172 + CVE-2026-22773 + CVE-2026-22778 video pipeline RCE CVSS 9.8 + CVE-2026-24779 vLLM + CVE-2026-25960 vLLM + CVE-2026-27893 vLLM trust_remote_code bypass CVSS 8.8 + CVE-2026-5760 SGLang GGUF chat template CVSS 9.8 + CVE-2026-26030 Semantic-Firewall + CVE-2025-30165 + CVE-2025-62164 + CVE-2025-66448 HF + CVE-2026-3059 + CVE-2026-3060 SGLang multimodal ZMQ broker pickle deserialization CVSS 9.8 + CVE-2026-3989 SGLang crash dump replay CVSS 7.8 + CVE-2026-14890 SGLang expert-parallel pickle deserialization VU#326070) + 第 18-23 候选 + 第 12 + 24 + 25 + 26 类风险候选
  • 6.9 §IX 35~56 轮新增 arXiv 集合:沿用 §IX 55 轮全部 + §IX 56 轮新增 0 件主分类 arXiv 主轴 + 3 件邻接升级研究前沿(arXiv:2608.08878 DistillCache paper_card 待建 + arXiv:2608.19662 ReCache paper_card 待建 + arXiv:2607.28633v2 Topology-Aware Data Movement paper_card 待建)+ §IX 55 沿用 2 件邻接升级(arXiv:2608.13426 RMM paper_card 952 + arXiv:2608.10288 PLGA paper_card 920)+ §IX 54 沿用 4 件(paper_card 1039 2608.19758 + paper_card 待建 2607.27090 + paper_card 待建 2608.00902 + paper_card 139 2602.21548v2 主分类 llm-infra)+ 1 件邻接级(paper_card 1045 2608.18027)+ 2 件研究前沿(2608.03893 + 2608.08097)+ 5 件 CVE 主轴级(CVE-2026-73558 + CVE-2026-33626 + CVE-2026-3059 + CVE-2026-3060 + CVE-2026-3989)+ §IX 53 沿用 5 件(paper_card 037 2601.06288 + paper_card 090 2606.01927 旧卡复活 + arXiv:2605.19537 + arXiv:2607.08028 + arXiv:2603.09619)+ §IX 52 沿用 5 件 + §IX 51 沿用 6 件 + §IX 50 沿用 3 件 + §IX 49 沿用 1 件 + §IX 48 沿用 9 件 + §IX 56 沿用 TurboQuant arXiv:2605.19660 数字矛盾警示

6.13 沿用引用补遗(沿用 §IX 55 轮 URL 集合 + §IX 56 轮新增 URL · 保 old->candidate 无 missing)

arXiv / CVE / URL:沿用 §IX 55 轮全部 + §IX 56 轮新增 3 件 arXiv ID(邻接升级):arXiv:2608.08878(DistillCache · KL 引导自适应 KV Cache 驱逐 · 5 维特征 · 主分类 llm-infra · paper_card 待建 · 8-23 spark llm-infra-e1prep §二增量 4 · 邻接升级候选 ★ 中档)+ arXiv:2608.19662(ReCache · 动态工具调用 agentic KV 缓存复用首个专项 · 主分类 llm-infra · paper_card 待建 · 8-23 spark llm-infra-e1prep §二增量 4 · 邻接升级候选 ★ 中档)+ arXiv:2607.28633v2(Topology-Aware Data Movement · PD disaggregation 70B 模型 1.3 GB/请求 · v2 修订 2026-08 · 主分类 llm-infra · paper_card 待建 · 8-23 spark llm-infra-e1prep §二增量 4 · 邻接升级候选 ★ 低档)+ §IX 56 轮新增 11 件 URL:github.com/vllm-project/vllm/issues/48168(vLLM Roadmap Q3 2026 · 6 主轴 + Cold Start Q3 子主题)+ vllm.ai/events/vllm-conference/2026(First vLLM Conference at Ray Summit · 8-24 ~ 26 San Francisco · Day 1 Tuesday August 25 9:30 AM Keynotes + 12:30 PM State of vLLM 2026)+ moondream.ai/blog/photon-2-launch(Photon 2.0 Physical AI 专用 megakernel 引擎 · H100 ChartQA 全面优于 vLLM/SGLang · 2026-08-03)+ premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026(PremAI H100 基准 SGLang 16,200 / vLLM 12,500 / LMDeploy 16,200)+ vllm.ai/blog(Stripe 73% 成本案例 · 每日 5000 万调用 · GPU 舰队缩至 1/3 · PagedAttention 60-80% 碎片消除 · 2026-07-15)+ blog.csdn.net/brandy/article/details/155517690(SGLang vs vLLM 选型 RadixAttention + PagedAttention + Llama3-70B-FP8 2×H100 场景表)+ blog.csdn.net/u013701860/article/details/148295809(bench_serving 工具命令 SGLang + vLLM backend + pd-separated)+ anyscale.com/ray-summit/2026(Ray Summit 2026 · 8-24 ~ 26 San Francisco · co-located with vLLM Conference)+ nvidia.com/en-us/events/ray-summit(NVIDIA at Ray Summit 2026 · NVIDIA and vLLM Full-Stack Collaboration session)+ arxiv.org/abs/2608.08878(DistillCache 邻接升级候选 ★ 中档)+ arxiv.org/abs/2608.19662(ReCache 邻接升级候选 ★ 中档)+ arxiv.org/abs/2607.28633v2(Topology-Aware Data Movement v2 修订 邻接升级候选 ★ 低档)+ 沿用 8 件 URL 沿用; DOI 10.1145/38020284 + DOI 10.1145/38020094 + DOI 10.1145/3749168 + DOI 10.1145/3803798 沿用。

§6.13.1 全量 URL(沿用 §IX 55 轮 URL 集合 + §IX 56 轮新增 URL · 全量保 old->candidate 无 missing · 共 86 件)

https://arxiv.org/abs/2502.07115 https://arxiv.org/abs/2605.01280 https://arxiv.org/abs/2605.02189 https://arxiv.org/abs/2608.01526 https://arxiv.org/abs/2608.14333 https://arxiv.org/abs/2608.14376 https://arxiv.org/abs/2608.17050 https://arxiv.org/abs/2608.19758 https://arxiv.org/abs/2607.27090 https://arxiv.org/abs/2608.00902 https://arxiv.org/abs/2602.21548 https://arxiv.org/abs/2608.18027 https://arxiv.org/abs/2608.03893 https://arxiv.org/abs/2608.08097 https://arxiv.org/abs/2608.13426 https://arxiv.org/abs/2608.10288 https://arxiv.org/abs/2605.19660 https://arxiv.org/abs/2608.08878 https://arxiv.org/abs/2608.19662 https://arxiv.org/abs/2607.28633 https://arxiv.org/html/2502.07115v5 https://arxiv.org/html/2605.02189v1 https://arxiv.org/html/2608.01526v1 https://arxiv.org/html/2608.11668v2 https://arxiv.org/pdf/2608.19758 https://blog.modelcontextprotocol.io/posts/2026-07-28 https://cloudnativenow.com/features/cncf-expands-efforts-to-run-ai-inference-workloads-on-kubernetes-clusters https://deploybase.ai/articles/best-llm-inference-engine https://events.linuxfoundation.org/kubecon-cloudnativecon-north-america/co-located-events/cloud-native-ai-inference-day https://freedom.tech/project/vllm https://github.com/RyanAlberts/best-of-Agent-Harnesses https://github.com/sgl-project/sglang/issues/21994 https://github.com/sgl-project/sglang/issues/23842 https://github.com/qhfan/FlashPrefillv2 https://github.com/InternLM/lmdeploy/security/advisories https://github.com/sgl-project/sglang/security/advisories https://hotinfra.org/2026/papers/hotinfra26-final59.pdf https://lyceum.technology/magazine/vllm-vs-tensorrt-llm-production-benchmark https://mp.weixin.qq.com/s?__biz=MzkyMzI3NzQ0Mg%3D%3D&mid=2247494105&idx=1&sn=8d7409e0fb846a3c7803c142b5d1a8e7 https://vllm.ai/blog https://www.axios.com/2026/08/17/a2a-agentic-ai-foundation-open-ai-standards https://www.buildmvpfast.com/blog/pinecone-vs-weaviate-vs-qdrant-vector-database-comparison-2026 https://www.glukhov.org/ai-systems/comparisons/a2a-protocol-2026-adoption https://www.lmsys.org/blog/2026-08-17-advanced-cuda-graph https://www.lmsys.org/blog/2026-08-18-miles-v0-1 https://www.lmsys.org/blog/2026-08-19-deepseek-v4-pro-engine-optimization-h20 https://www.modular.com/blog/mojo-open-source https://www.redhat.com/en/blog/red-hat-ai-inference-brings-llm-d-any-managed-kubernetes-starting-coreweave-and-microsoft-azure https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026 https://app.opencve.io/cve?product=vllm&vendor=vllm-project https://www.cve.org/CVERecord?id=CVE-2026-73558 https://github.com/vllm-project/vllm/security/advisories/GHSA-7m6h-x95x-82q5 https://www.sysdig.com/blog/cve-2026-33626-how-attackers-exploited-lmdeploy-llm-inference-engines-in-12-hours https://orca.security/resources/blog/sglang-llm-framework-rce-vulnerabilities https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison https://deepinfra.com/blog/vllm-vs-sglang https://www.spheron.network/blog/vllm-vs-sglang-2026 https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt https://www.servermo.com/blogs/sglang-vs-vllm-benchmark https://huggingface.co/blog https://berkeleyrdi.substack.com/p/agentic-ai-weekly-berkeley-rdi-august https://www.nvidia.com/en-us/on-demand/session/gtc26-s82033 https://github.com/amitshekhariitbhu/llm-inference-engineering https://www.kodemsecurity.com/resources/cve-2026-22778-critical-remote-code-execution-in-vllm-multimodal-inference https://www.spheron.network/blog/llm-inference-optimization-2026 https://highlimitdesigns.com/blog/prefill-decode-disaggregation-llm-serving-2026 https://highlimitdesigns.com/blog/llm-infrastructure-breakthroughs-vllm-v1-sglang-epd-disaggregation https://github.com/framsouza/inference-at-scale-on-kubernetes https://github.com/FFY0/DefensiveKV https://github.com/bs258q/kv-cache-analyzer https://github.com/llm-d/llm-d-kv-cache https://vllm-project.github.io/blog/2026-07-29-25k-tps-qwen35 https://vllm-project.github.io/blog/2026-08-06-decode-context-parallelism https://vllm-project.github.io/blog/2026-08-07-efficient-decode-context-parallelism https://vllm-project.github.io/blog/2026-04-21-state-of-fp8-kv-cache https://linkedin.com/posts/servergurus-india_disaggregated-inference-why-splitting-prefill-activity-7489815467243540480-FGVo https://github.com/StarTrail-org/LEANN https://github.com/vllm-project/vllm/issues/48168 https://vllm.ai/events/vllm-conference/2026 https://moondream.ai/blog/photon-2-launch https://premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 https://blog.csdn.net/brandy/article/details/155517690 https://blog.csdn.net/u013701860/article/details/148295809 https://anyscale.com/ray-summit/2026 https://nvidia.com/en-us/events/ray-summit

§7 沿革摘要(至 2026-08-24 09:00 · 极精简)

日期 轮次 主题快照
2026-08-25 05:00 §IX 56th 🟠 FlashPrefill V2 H200 FP8 47.26× 升级 + SGLang 集成路径 + H20 存量工程意义 + 🟠 vLLM Conf @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(github.com/vllm-project/vllm/issues/48168 + vllm.ai/events/vllm-conference/2026 · Flat Model + MRV2 + 多级 KV Offloading + 1000+ TPS + 量化 KV Cache + llm-d 推进 + Rust Frontend + SIG Spec Decode Q3 + Cold Start Q3 + Sprint 机制 · 当前 sprint = GLM5.2 + DSpark · + NVIDIA 合作 session "DeepSeek and MiniMax Performance")+ 🟠 Photon 2.0(Moondream · 2026-08-03 · Physical AI megakernel · H100 ChartQA 全面优于 vLLM/SGLang)+ 🟠 3 件 KV Cache 新论文邻接升级(DistillCache arXiv:2608.08878 + ReCache arXiv:2608.19662 + Topology-Aware arXiv:2607.28633v2)+ 🟠 TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源(PremAI/Particula/Atomic/AIMultiple)。推理工程学科化第 9 维 67 → 71 件套扩面。
2026-08-23 05:00 §IX 55th 🟠 K8s+LLM Inference 完整数值层 framsouza + 🟠 DefensiveKV ICLR 2026 + 🟠 kv-cache-analyzer CLI bs258q + 🟠 llm-d KV Cache 路由 upstreamed vLLM v0.23 + 🟡 vLLM 8 月三件 blog + 🟡 TurboQuant 数字矛盾 + 🟡 RMM arXiv:2608.13426 邻接升级候选 ★ 中档 + 🟡 PLGA arXiv:2608.10288 邻接候选 ☆ + 🟠 Spheron 2026 + ServerGurus PD disaggregation + HLD Blog 三件 + 🟠 LEANN MLSys 2026。推理工程学科化第 9 维 62 → 67 件套扩面。
2026-08-22 05:00 §IX 54th 🔴 FlashPrefill V2 arXiv:2608.19758 + 🔴 InferScale arXiv:2607.27090 + 🔴 Online KV Cache Compaction arXiv:2608.00902 + 🔴 DualPath arXiv:2602.21548v2 + 🔴 vLLM CVE-2026-73558 跨用户 KV 数据泄漏 + 🔴 LMDeploy CVE-2026-33626 SSRF + 🟠 SGLang CVE-2026-3059/3060/3989 + 🟠 Particula Tech SGLang vs vLLM H100 + 🟠 Schema 7× + 🟠 TGI 维护 + 🟠 AI Agents Stack + 🟠 HotInfra'26 PIM-DIMM + 🟠 ServerMO + Chain-of-Experience + Cross-Model KV + OasisKV + 🟠 vLLM 0.27.0 = CVE-2026-73558 修复门槛。推理工程学科化第 9 维 58 → 62 件套扩面。
2026-08-21 05:00 §IX 53rd 🔴 CoRun + DASH + HBF Sucks 三件 arXiv 主轴 + SGLang Advanced CUDA Graph + DeepSeek-V4-Pro H20 + Miles v0.1 + KV Cache 基础设施重构四件套(An Internet for the KV Cache + PipeMax + Online Scheduling MC-SF + Reimagining HotInfra'26 PIM-DIMM 1,607 vs 679 tok/s)+ vLLM 0.27.1 + GLM-5.3 + Qdrant v1.14 + Red Hat AI Inference llm-d + A2A 治理。推理工程学科化第 9 维 54 → 58 件套扩面。
2026-08-20 05:00 §IX 52nd 🔴 paper_card 037 AIConfigurator + paper_card 090 Albireo + EuroSys 2026 6 件 + HPDC 2026 ATLAS + IEEE DCOSS-IoT Best Paper + vLLM vs SGLang 生产决策树 v2 + PremAI/Particula H100 横评 + Spheron H100/H200 + Mojo🔥 开源 + The AI Agents Stack 2026 + MCP 工程实践三件套 + A2A 协议一周年。推理工程学科化第 9 维 47 → 54 件套扩面。
2026-08-19 05:00 §IX 51st 🟠 Thought-Level Beam Search + Hybrid-Policy Self-Editing + Modular Cognitive Architecture + FreeToken + TensorRT-LLM v1.0 + SGLang RadixArk TPU + GLM5.2 NVFP4 + vLLM 8月 blog posts 5 件 + CSDN inference 部署/选型 5 件。推理工程学第 9 维 42 → 47 件套扩面。

本次变更

2026-08-25 05:00 (Wave3 E1 第五十六轮 cron · §IX 56th)

本轮 §IX 56 主题:FlashPrefill V2 H200 FP8 47.26× 升级 + SGLang 集成路径 + H20 存量工程意义 + vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴官方公告(Flat Model + MRV2 + 多级 KV Offloading + 1000+ TPS 推测解码 + 量化 KV Cache 生产级压缩 + llm-d 推进 + Rust Frontend 生产化 + SIG Spec Decode Q3 + Cold Start Q3 子主题 + Sprint 机制)+ Photon 2.0 Moondream Physical AI 专用 megakernel + 3 件 KV Cache 新论文邻接升级(DistillCache + ReCache + Topology-Aware v2)+ TGI EOL 官方二次确认 + Stripe 73% 成本案例 + H100 基准三方新源。5 件工程化层级补位 + 3 件邻接升级。共识/争议/试金石/趋势:C1-C195 共 195 条(新增 C191-C195 共 5 条)/ D1-D93 共 93 条(新增 D89-D93 共 5 条)/ O1-O311 共 311 条(新增 O302-O311 共 10 条)/ T1-T51 共 51 条(新增 T51 共 1 条)。推理工程学科化第 9 维 67 → 71 件套扩面。≥ 10 P0 待核警示(详见 §4 O302-O311)。下次预计 8-25 evening cron(Wave3 E1 第五十七轮)。

2026-08-23 05:00 (Wave3 E1 第五十五轮 cron · §IX 55th)

(本段沿用 §IX 55 · 详见 /shared/research-kb/organized/knowledge/archive/llm-infra-changelog.md 存档)

2026-08-22 05:00 (Wave3 E1 第五十四轮 cron · §IX 54th)

(本段沿用 §IX 54 · 详见 /shared/research-kb/organized/knowledge/archive/llm-infra-changelog.md 存档)


6.99 全量 arXiv ID · URL 索引(确保 old→candidate 无 missing)

6.99.1 全量 arXiv(共 186 件 · 沿用 §IX 55 183 + §IX 56 新增 3 邻接升级 = 186 件)

arXiv:2403.05527 arXiv:2502.07115 arXiv:2502.14617 arXiv:2504.11320 arXiv:2504.19874 arXiv:2505.02189 arXiv:2506.04565 arXiv:2507.06608 arXiv:2511.01815 arXiv:2511.11581 arXiv:2512.05411 arXiv:2512.09196 arXiv:2601.06288 arXiv:2601.19139 arXiv:2602.04900 arXiv:2602.08005 arXiv:2602.14617 arXiv:2602.21548 arXiv:2603.02001 arXiv:2603.04428 arXiv:2603.06728 arXiv:2603.09619 arXiv:2603.10249 arXiv:2603.11088 arXiv:2603.12646 arXiv:2603.13358 arXiv:2603.15569 arXiv:2603.17456 arXiv:2603.18272 arXiv:2603.20397 arXiv:2603.21354 arXiv:2603.23710 arXiv:2603.29010 arXiv:2603.29231 arXiv:2604.00499 arXiv:2604.03143 arXiv:2604.04722 arXiv:2604.04853 arXiv:2604.12374 arXiv:2604.15732 arXiv:2604.19157 arXiv:2604.19769 arXiv:2604.20920 arXiv:2604.25724 arXiv:2604.25899 arXiv:2604.26557 arXiv:2605.01280 arXiv:2605.02189 arXiv:2605.04595 arXiv:2605.10834 arXiv:2605.11733 arXiv:2605.17613 arXiv:2605.19537 arXiv:2605.19660 arXiv:2605.23389 arXiv:2605.27744 arXiv:2605.29640 arXiv:2606.01927 arXiv:2606.02643 arXiv:2606.03811 arXiv:2606.06535 arXiv:2606.11916 arXiv:2606.14589 arXiv:2606.16316 arXiv:2606.18023 arXiv:2606.18431 arXiv:2606.19746 arXiv:2606.20295 arXiv:2606.21238 arXiv:2606.24775 arXiv:2606.26560 arXiv:2606.26875 arXiv:2606.28565 arXiv:2606.30391 arXiv:2607.00482 arXiv:2607.02980 arXiv:2607.03333 arXiv:2607.05061 arXiv:2607.07386 arXiv:2607.07816 arXiv:2607.07953 arXiv:2607.08028 arXiv:2607.09172 arXiv:2607.09248 arXiv:2607.09424 arXiv:2607.10350 arXiv:2607.10508 arXiv:2607.11505 arXiv:2607.11523 arXiv:2607.11783 arXiv:2607.11881 arXiv:2607.12747 arXiv:2607.13027 arXiv:2607.13104 arXiv:2607.13705 arXiv:2607.14541 arXiv:2607.17715 arXiv:2607.17979 arXiv:2607.18141 arXiv:2607.21557 arXiv:2607.22529 arXiv:2607.23693 arXiv:2607.23933 arXiv:2607.24062 arXiv:2607.25380 arXiv:2607.26475 arXiv:2607.26654 arXiv:2607.27042 arXiv:2607.27090 arXiv:2607.28633 arXiv:2607.29377 arXiv:2607.29405 arXiv:2608.00101 arXiv:2608.00303 arXiv:2608.00677 arXiv:2608.00742 arXiv:2608.00881 arXiv:2608.00902 arXiv:2608.01247 arXiv:2608.01326 arXiv:2608.01526 arXiv:2608.01651 arXiv:2608.01718 arXiv:2608.01735 arXiv:2608.01964 arXiv:2608.01975 arXiv:2608.02143 arXiv:2608.02515 arXiv:2608.02585 arXiv:2608.02645 arXiv:2608.02703 arXiv:2608.02870 arXiv:2608.02989 arXiv:2608.03036 arXiv:2608.03216 arXiv:2608.03222 arXiv:2608.03487 arXiv:2608.03796 arXiv:2608.03893 arXiv:2608.03972 arXiv:2608.03994 arXiv:2608.05136 arXiv:2608.05219 arXiv:2608.05604 arXiv:2608.05784 arXiv:2608.06007 arXiv:2608.06033 arXiv:2608.06130 arXiv:2608.06301 arXiv:2608.06867 arXiv:2608.07009 arXiv:2608.07152 arXiv:2608.07169 arXiv:2608.07458 arXiv:2608.07645 arXiv:2608.08020 arXiv:2608.08097 arXiv:2608.08311 arXiv:2608.08389 arXiv:2608.08878 arXiv:2608.09867 arXiv:2608.09888 arXiv:2608.10208 arXiv:2608.10288 arXiv:2608.10875 arXiv:2608.10915 arXiv:2608.11660 arXiv:2608.12149 arXiv:2608.12440 arXiv:2608.13263 arXiv:2608.13426 arXiv:2608.13499 arXiv:2608.13567 arXiv:2608.14333 arXiv:2608.14376 arXiv:2608.14465 arXiv:2608.16157 arXiv:2608.17050 arXiv:2608.18027 arXiv:2608.19662 arXiv:2608.19758