llm-infra · E1 预消化简报(2026-08-23)
作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 23 棒 · 8-23 evening 活文档接力备料 · 周日) 窗口:2026-08-22 18:40 → 2026-08-23 18:40(约 24h) 基线:
organized/knowledge/llm-infra.md§IX 55th(2026-08-22 22:30 落定 · 6 件立基延展 + 2 件邻接升级 + 4 件 arXiv 主轴 + 5 CVE 主轴 + 推理工程学科化第 9 维 67 件套扩面) 承接棒:inbox/spark/2026-08-22-llm-infra-e1prep.md(8-22 evening · 6 件补位主线)+inbox/tom/2026-08-22-inference-e1prep.md(8-22 evening · 7 主线名义 inference 棒)+inbox/spark/2026-08-23-agent-e1prep.md(8-23 13:30 spark 主棒 · 含 6 件 engineering 主轴 net-new 提示) 关键事实:tom 今天未写 inference-e1prep(tom/2026-08-23 下仅有 evaluation/rag/agent-radar/HF Daily/yt-RSS,inference 主棒 8-23 缺席 · 名义 inference 棒事实上空白);flyp 8-23 多模模/risk 两棒;stephen 8-23 多个棒次均偏产业层;jay 8-23 多棒覆盖全栈但 llm-infra 主轴未单独立棒。因此本棒主要由 spark 主承,承接 §IX 55th 全部沿用。方法学状态:立标等级判定四档法 ✅ · 跨实例标签二档法 ✅ · 数字核验闭环段 ✅ · RSS 承接棒近 7 日同源累计 ✅ 棒边界:本棒只扫描与备料,不写活文档;v56 接力棒处理核验 + 升级 / 降级 + §IX 56th 主变更
0. 一句话净增量
8-23 evening llm-infra 主轴相对 §IX 55 的真实信号 = "§IX 55 锚入后第二日稳态 + FlashPrefill V2 H200 FP8 47.26× 升级 + vLLM Conference 8-25 Roadmap Q3 5 件":jay 8-23 多个棒次累计贡献 ≈ 5 件中位增量(FlashPrefill V2 H20/H200 升级 / vLLM Conference @ Ray Summit 8-25 Roadmap Q3 6 轴 / Photon 2.0 物理 AI megakernel / DistillCache 自适应驱逐 / ReCache agentic KV 复用),其中 1 件为 §IX 54/55 已锚立基础延展的"工程化二次升级"(FlashPrefill V2 H20 存量数字),其余 4 件为研究前沿 / 工程化新信号。§1.1/§1.3/§1.8/§1.9/§1.12 五节均无 net-new arXiv 主轴候选(连续第 2 个零新增日 · 沿用 §IX 54 4 arXiv 主轴);net-new 主要为工程化层级 / 工具链 / 部署 / 量化经济学 / 邻接级研究。
一、综述判断
当日 llm-infra 主轴真实信号密度 = §IX 55 锚入后第二日"工程化层级二次补位 + 顶会路线图预告"型棒:
- jay 8-23 共 ≥ 14 棒:0823-1000-1004 RSS 8 件(bytebytego/raschka/simon-willison/cool-papers/cool-papers-ir/nathan-benaich/lilian-weng/import-ai/msr-blog + yt-karpathy/yt-fireship)+ 0823-1105 five-cat-briefing(C2KV KDD 2026 + HotInfra '26 PIM-DIMM 2.4× + SGLang vs vLLM 2026 + pgvector/Qdrant/Milvus/pgvectorscale + Modular 五时代 KVCache)+ 0823-1140 news-x-tech-radar + 0823-1220 csdn-high-value(4 件)+ 0823-1335 ai-engineering-github-hf-vllm-substack(vLLM Conference 8-25 路线图 + HF State of Open Models Summer 2026 + Qwen 生态位)+ 0823-1450 engineering-benchmarks-harness-substack(PremAI/Particula/Atomic/AIMultiple H100 基准 + SGLang 时间线)+ 0823-1620 csdn-highvalue-agent-rag-mlops + 0823-1735 ai-engineering-trending-aug23(SGLang/vLLM 决策框架 + 5 件 KV Cache 新论文)+ 0823-0820 csdn-llm-inference-rag(SGLang/vLLM 选型 + bench_serving 命令 + DuoAttention)+ 0823-0820 ai-engineering-github-hf-backend + 0823 engineering-e1prep(6 件 engineering net-new)+ 0823 weekly-engineering-roundup
- tom 8-23 共 ≥ 4 棒:0823-0840 agent-rag-longcontext-radar + 0823-0852 rag-e1prep + 0823-0900 hf-daily-15 件(0 件 llm-infra 主轴)+ 0823-1003-1004 RSS-yt 2 件(Lex Fridman + Yannic Kilcher 沿用)
- tom 8-23 inference 主棒缺席(tom/ 下无 2026-08-23-inference-e1prep · 仅有 evaluation/rag/radar/HF Daily/yt)→ 名义 inference 棒事实上空白,spark 8-23 本棒实质承担 §IX 55 主轴补位职责
- flyp 8-23 共 2 棒:0823-multimodal-e1prep + 0823-risk-e1prep(均不主覆盖 llm-infra)
- stephen 8-23 共 ≥ 13 棒:0823-0910 news-x-vip-radar + 0823-1002-1004 frontier lab news 11 件(Atari→EVE Online + Project Glasswing + Robotics ER 2 + Sheets canvas + AMIE 视频会诊 等) + 0823-1245 noon 协调棒(协同度评估)+ 0823 ai-industry-e1prep(产业层)
- paper_cards 8-23 净增 ~7 张(12:30 上限):0 张主分类 llm-infra 净增;1 张主分类 multimodal 副分类 llm-infra = 1053-2608.16885 τ_0-VLA(v55 已立 · 副分类 llm-infra · 沿用);1 张主分类 agent 副分类 llm-infra = 1052-2607.21596 FlowEvo(v55 已立 · 副分类 llm-infra · 沿用)
立标等级判定四档过滤结果: 候选 ★ 中档 1 件(FlashPrefill V2 H200 FP8 47.26× 升级)· 候选 ★ 中档 1 件(vLLM Conference 8-25 Roadmap Q3 六轴)· 候选 ☆ 低档 1 件(DistillCache + ReCache + Topology-Aware 数据移动 三件 KV Cache 新论文)· 候选 ☆ 低档 1 件(Photon 2.0 物理 AI megakernel)· 观察信号 1 件(TurboQuant 数字矛盾沿用 · 无新进展)
对比 8-17 ~ 8-22 棒: - 8-19 = "Albireo + 工程学科化"(可复现性 + 工程学科化) - 8-20 = "SGLang Advanced CUDA Graph + §IX 53 主轴 4 件"(生产配置 + 4 件 arXiv) - 8-21 = "Agent serving 跨层综合 + 长上下文 + 运行时安全"(三主题并行 + 4 arXiv 主轴 + 5 CVE 主轴) - 8-22 = "§IX 54 锚入后缺位回补"(工程化层级 / 工具链 / 部署路径补位) - 8-23 = "§IX 55 锚入后第二日稳态 + FlashPrefill V2 H20/H200 二次升级 + vLLM Conference 8-25 Roadmap Q3 + KV Cache 新论文 3 件"
二、核心增量(5 件主线 · 立标等级四档显式标注)
增量 1【稀疏注意力 · §1.(8) + §1.(11)】🟠 FlashPrefill V2 = §IX 54 沿用论文 H200 FP8 47.26× 加速 + SGLang 集成 + H20 存量意义 ★
来源: jay/2026-08-23-engineering-e1prep.md(增量1,22KB)+ jay/2026-08-23-weekly-engineering-roundup.md(Models & Agents Ep148 · 2026-08-21)+ jay/2026-08-23-0820-csdn-llm-inference-rag.md(沿用)+ spark/2026-08-23-agent-e1prep.md(第 §2.3 工程 net-new 增量 #1 引用)
arXiv: 2608.19758(已沿用 §IX 54 · paper_card 1039 已建 · 主分类 llm-infra)
要点(8-23 jay 工程棒新增数字 vs §IX 54 已锚): - H200 FP8 实测: 128K 上下文 47.26× 加速 vs FA2 · 30.49× vs FA3/4 密集基线 · BF16 27.19× - 均值修正项(mean correction term): 极端稀疏度下压制近似误差 · 区别于早期稀疏注意力 - 算子设计: PackGQA + warp specialization · 兼容 FA3/4 而非 Fork FA2 · 原生支持 paged KV cache + continuous batching(vLLM/SGLang 生态兼容) - SGLang 集成路径明确: 可作为 SGLang 注意力后端接入 - 国内 H20 存量意义: 国内算力 H20 存量可观,该方向具有直接工程落地价值(可作为国内 H20 长上下文推理的优化选项)
警示: H200 与 H20 加速比可能存在差异(架构/算力差异);评测条件(batch size、序列长度分布、硬件环境细节)需 arXiv §3-4 原文核验;H20 实际落地数字未独立核验
与活文档关系: §IX 54 §1.(8) 已锚 FlashPrefill V2 arXiv:2608.19758 = block-sparse prefill 128K TTFT -2.1× ~ -4.8× BF16/FP8 + paper_card 1039 已建;本棒 = §1.(8) §IX 55 沿用论文的"工程化层级二次升级"(H200 FP8 47.26× 具体数字 + SGLang 集成路径明确 + 国内 H20 存量工程意义)
归入节: §1.(8) FlashPrefill V2 子节内「工程化升级:H200 FP8 128K 47.26× + SGLang 注意力后端集成路径 + 国内 H20 存量意义」补强;§1.(11) Kernel/AI 自动化/Harness 维度新增子节
增量 2【推理调度 + 部署路径 · §1.(1) + §1.(2) + §1.(12)】🟠 vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴 ★
来源: jay/2026-08-23-1335-...-vllm-substack.md(§三 vLLM 生产状态 2026 夏)+ jay/2026-08-23T1105-five-cat-briefing.md(SGLang/vLLM 2026 格局)
arXiv: 无新增(vLLM 官方会议公告)
要点: - vLLM Conference @ Ray Summit 2026-08-25 核心议题: 1. Flat Model + Model Runner V2 迁移 = 重新架构的引擎 · 更简单的调度器 · 近零开销 prefix caching · 更干净的 tensor parallelism 2. 多级 KV Offloading = multi-tier KV offloading · CPU/GPU 分层管理 3. Speculative Decoding → 1000+ TPS = 推测解码目标突破千 token/秒 4. 量化 KV Cache 生产级压缩 = production-grade quantized KV cache compression 5. llm-d 项目 = Red Hat + Google Cloud + IBM Research + NVIDIA + CoreWeave 联合推进 Kubernetes 原生分布式推理 - vLLM 生产质量体系(Jul 15, 2026 blog): - 双周发版节奏 · 每版覆盖多加速器(NVIDIA/AMD/Intel Arc/TPU) - 每日性能基准 + 精度评估 - GLM-5.2 on 24× NVIDIA B300:Day-0 支持 - Kimi K3 preview(Jul 21) - Stripe 案例:每日 5000 万调用 · GPU 舰队缩至 1/3 · 成本降低 73% · PagedAttention 消除 60-80% KV cache 碎片化内存浪费 - Disaggregated Serving(PD 分离): - Prefill(计算密集)与 Decode(内存密集)分离到不同 GPU - AMD MI300X 8-GPU 节点实测:ITL 稳定性提升 · goodput 改善 - 对 MoE 模型尤其有效
警示: Roadmap 数字 1000+ TPS 是目标非已实现;Stripe 73% 成本降低来自 vLLM 官方博客原文需独立核验;llm-d Kubernetes Gateway API 集成具体形态需 vLLM Conference 日程原文核验
与活文档关系: §IX 55 §1.(1) 已锚 vLLM 0.27.0 = CVE 修复门槛 + SGLang 400K+ GPU + Cursor/LinkedIn/Azure/xAI Grok 3 + Particula H100;§IX 55 §1.(3) 已锚 llm-d 分布式 KV Cache 路由 already-upstreamed vLLM v0.23;本棒 = §1.(1) vLLM 8-25 Roadmap 路线图预告(Flat Model + MRV2 + 多级 KV Offloading + 1000+ TPS + 量化 KV Cache + llm-d 推进) + §1.(2) 调度栈部署路径(PD 分离 AMD MI300X 节点实测)+ §1.(12) End-to-End Pipeline Engine 子节(Stripe 73% 成本 + GPU 舰队 1/3 + PagedAttention 60-80% 碎片消除)
归入节: §1.(1) 新增「vLLM Conference @ Ray Summit 2026-08-25 Roadmap Q3 六轴预告」; §1.(12)(ii) Engine 子节新增「vLLM 生产质量体系 + Stripe 73% 成本案例 + GLM-5.2 B300 Day-0 + Kimi K3 preview」
增量 3【推理引擎 · §1.(1)】🟠 Photon 2.0(Moondream)= 物理 AI 专用 megakernel 引擎,H100 ChartQA 全面优于 vLLM/SGLang ★
来源: jay/2026-08-23-1735-...-ai-engineering-trending-aug23.md(§三 推理引擎生态对比 2026-08 更新)
要点: - 定位: 专用 megakernel 引擎,专为 Physical AI(机器人、视觉、动作)设计 - 实测: H100 上 ChartQA 基准全面优于 vLLM/SGLang - 发布: 2026-08-03 - 适用场景: 多模态、Physical AI(机器人 / 物理交互 / 视觉动作)
警示: 仅引用 jay 8-23 trending 的二手摘要;实测条件(model family / 数据集 / batch size)需 Moondream 官方 blog 核验;与 vLLM/SGLang 的对比基线是否公平(模型一致、数据一致)待核
与活文档关系: §IX 55 §1.(1) 推理引擎 67 件套锚入 vLLM 0.27.0 + SGLang 400K+ GPU + TensorRT-LLM + Particula H100 + EAGLE 多 token;本棒 = §1.(1) 推理引擎"专用化分支"补强(Photon 2.0 = Physical AI 专用 megakernel · 与通用 vLLM/SGLang/TRT-LLM 互补而非竞争)
归入节: §1.(1) 推理引擎层新增「专用化分支: Photon 2.0(Moondream · 2026-08-03 · Physical AI 专用 megakernel · H100 ChartQA 全面优于 vLLM/SGLang)」
增量 4【KV Cache · §1.(3)】🟡 5 件 KV Cache 新论文(8-22 ~ 8-23 期间发表)= 复用机制 / 驱逐策略 / 分布式数据移动 三大方向 ☆
来源: jay/2026-08-23-1735-...-ai-engineering-trending-aug23.md(§四 KV Cache 系统研究 arXiv 2026年8月新论文)
arXiv(5 件):
| arXiv | 论文名 | 方向 | 与活文档关系 |
|---|---|---|---|
2608.03893 |
Cross-Model KV Cache Transfer in LLM Families | 跨模型 KV 复用(无需训练,RoPE 插值+跨层对齐) | §IX 54 §1.(3) 邻接级 · 研究前沿已锚;8-23 二次细化(Llama 系列 8k 实验 ridge regression content-space) |
2608.01526 |
An Internet for the KV Cache / Rethinking Classical Infrastructure Boundaries in the LLM Inference Age | KV Cache = 内容分发系统 / 互联网级 | §IX 53 §1.(3) 立基础延展第 1 件已锚(An Internet for the KV Cache);8-23 二次细化(呼吁网络/存储视为一等推理资源) |
2608.08878 |
DistillCache: KL 引导的自适应 KV Cache 驱逐 | 自适应驱逐(5 维特征:α_i + ‖v_i‖₂ + σ_i + 注意力质量 + 跨头方差) | §1.(3) §IX 55 未锚 · §IX 55 §1.(3) 仅有 H2O/SnapKV/OasisKV;本棒 = 自适应驱逐算法新基线 |
2608.19662 |
ReCache: 动态工具调用 agentic 场景 KV 缓存复用 | Agentic KV 复用(渐进式披露 / 工具集动态扩展 / schema 上下文管理) | §1.(3) §IX 55 未锚 · §IX 55 §1.(3) 已有 Chain-of-Experience 邻接;本棒 = agentic KV 复用首个专项 |
2607.28633 v2 |
Topology-Aware Data Movement for Disaggregated GPU Inference | 70B 模型 KV cache 1.3 GB/请求 · 跨 GPU 池传输瓶颈 · 网络拓扑感知数据传输 | §1.(3) §IX 55 未锚 · 与 §IX 53/54 PipeMax + DualPath 同方向;本棒 = 8-23 v2 修订(2026-08 修订版) |
警示: 5 件均为 8-23 trending 二手摘要;评测条件 / 加速比 / 模型覆盖范围需逐篇 PDF 核验;DistillCache 是否对标 H2O/SnapKV 公平(同 baseline 模型/数据)待核;ReCache 工具集动态扩展具体评测未公开;Topology-Aware 是否与 §IX 53 PipeMax 重合需独立核
与活文档关系: §IX 55 §1.(3) 已有 H2O/SnapKV/OasisKV/DefensiveKV/InferScale/Online Compaction/DualPath + vToken/ICMSP/NIXL/MemoryAlloy;本棒 = §1.(3) 三方向补强(自适应驱逐算法基线 DistillCache + agentic KV 复用首个专项 ReCache + disaggregated 数据移动 Topology-Aware v2 修订)——arXiv ID 数量 5 件但主轴候选级别待评估
归入节: §1.(3) KV Cache 新增「8-22 ~ 8-23 三方向补强: DistillCache 自适应驱逐 + ReCache agentic 复用 + Topology-Aware disaggregated 数据移动 v2 修订 + Cross-Model KV Transfer 二次细化 + Internet for KV Cache 二次细化」
增量 5【部署路径 · §1.(2)】🟡 推理引擎 H100 基准三方对照(PremAI + Particula + Atomic + AIMultiple = 8 月新源) ☆
来源: jay/2026-08-23-1450-...-engineering-benchmarks-harness-substack.md(§一.A 推理引擎基准数据)+ jay/2026-08-23-0820-csdn-llm-inference-rag.md(条目1 SGLang/vLLM 选型 + 条目 2 bench_serving 命令)+ jay/2026-08-23-1735-...-trending-aug23.md(§三 推理引擎生态对比 2026-08 更新)
要点(8-23 三方新源 vs §IX 55 已锚的 Particula 8-22):
| 引擎 | H100 tok/s(8-23 三方对照) | 与 §IX 55 已锚 Particula H100 对比 |
|---|---|---|
| SGLang v0.4 | ~16,200(PremAI)/894 output(Particula)/1,920 50 并发(Spheron) | SGLang 1,920 已锚 §IX 55 |
| vLLM | ~12,500(PremAI)/413 output(Particula)/1,850 50 并发(Spheron) | vLLM 1,850 已锚 §IX 55 |
| LMDeploy | ~16,200(PremAI) | LMDeploy = SGLang 数值(+29% vs vLLM · 新源) |
| TensorRT-LLM | ~2,100 50 并发(Spheron)+ 8-13% 手工调优领先 | TensorRT-LLM 2,100 已锚 §IX 55 |
关键数据点: - SGLang v0.4 零开销调度器: CPU 调度开销从 15-25% 降至 <2%(新源 PremAI) - DeepSeek V3: SGLang 比 vLLM 快 3.1×(MLA 优化 · Particula) - EAGLE 推测解码: decode speedup 1.8×(batch=1) / 1.5×(batch=32)(Particula · 沿用 §IX 55) - SGLang 2026 时间线(GitHub README): - 2026/07: Kimi K3 day-0(经 Miles) - 2026/07: TPU 全功能支持(与 Google) - 2026/07: GLM5.2 NVFP4 → 500 TPS(2 周达成) - 2026/06: DFlash + Spec V2(下一代推测解码) - 2026/04: DeepSeek-V4 day-0 → Verified RL - 2026/02: GB300 NVL72 → 25× 性能 - bench_serving 命令清单(SGLang 官方 + vLLM 兼容 · 即拷即用): - SGLang backend 评测 · vLLM backend 评测 · vLLM 官方 benchmark_serving · pd-separated 模式
警示: PremAI 数字"~16,200 vs 12,500"来自第三方汇总,无原始命令/复现步骤;Particula 数据详尽但同无复现步骤;数字未标注置信区间;SGLang v0.4 调度器 <2% 开销需 SGLang PR/代码核验
与活文档关系: §IX 55 §1.(1) + §1.(9) 已锚 Particula Tech H100 Benchmark(SGLang +29%/+117% / TTFT p50 380/360/340 ms / 冷启动 62s/58s/28 min)+ SGLang vs vLLM Schema 7× + Spheron 2026 vLLM/SGLang/TRT-LLM 50 并发实测;本棒 = §1.(1) + §1.(9) 推理引擎 H100 基准"三方新源"补强(PremAI + Particula + Atomic + AIMultiple · LMDeploy 新入对照 + SGLang v0.4 零开销调度器 + DeepSeek V3 MLA 3.1× + SGLang 2026 时间线 + bench_serving 命令清单)
归入节: §1.(1) 新增「推理引擎 H100 基准三方新源补强: PremAI/Particula/Atomic/AIMultiple 8 月对照 + LMDeploy 数值 + SGLang v0.4 调度器 <2% 开销 + bench_serving 命令清单」;§1.(9) 量化经济学新增「SGLang 2026 时间线 7 件 + DeepSeek V3 MLA 3.1× + GLM5.2 NVFP4 500 TPS」
沿用 A【运行时安全 · §1.(12)】🟠 CVE 三件套(vLLM CVE-2026-73558 + LMDeploy CVE-2026-33626 + SGLang CVE-2026-3059/3060/3989)—— §IX 55 §1.(12) 主轴已锚立基础延展,8-22 ~ 8-23 窗口无新 CVE
沿用 B-D【稀疏注意力 + KV 生命周期 + 推理时反馈】§1.(8) FlashPrefill V2 arXiv:2608.19758(本棒 8-23 H200 数字升级)+ §1.(3) KV Cache InferScale 2607.27090 + Online KV Cache Compaction 2608.00902 + §1.(12) DualPath arXiv:2602.21548v2 + §1.(11) Chain-of-Experience arXiv:2608.18027 —— §IX 54/55 §1.(3)+§1.(8)+§1.(11)+§1.(12) 主轴 + 立基础延展已锚;paper_card 1039/139/1045 已建;InferScale 2607.27090 + Online KV Cache Compaction 2608.00902 paper_card 仍待建(cron_s2 优先级 · 沿用 8-22 棒)
三、6 件"延后"事项(延后标准显式说明 · 与 8-22 棒差异显式标注)
| # | 项 | 延后标准 | 优先级 | vs 8-22 棒 |
|---|---|---|---|---|
| 1 | Microsoft Foundry + AgentRx(jay 8-23 engineering 棒增量 3) | 偏推理框架 agent 端故障恢复,主框架归属 engineering v60 §2.113;与 llm-infra §1.(12) Agent Security 部分重叠,避免双活文档锚入重复 | 🟡 P1 | 沿用 8-22 #1 |
| 2 | DefensiveKV arXiv ID 待核 | FFY0 repo 标注 ICLR 2026 但具体 arXiv 未确认,v56 PDF 精读 | 🟢 P2 | 沿用 8-22 #2 |
| 3 | TurboQuant arXiv ID + 数字矛盾闭合 | 2.69-4.4× vs 6×/8× 矛盾,v56 PDF 核验 | 🟡 P1 | 沿用 8-22 #3 |
| 4 | SGLang PR #21617/21618 TurboQuant 合并状态 | GH 跟踪 | 🟢 P2 | 沿用 8-22 #4 |
| 5 | InferScale 2607.27090 paper_card 待建 | §IX 54 已标待建,v56 cron_s2 优先补建 | 🟡 P1 | 沿用 8-22 #5 |
| 6 | Online KV Cache Compaction 2608.00902 paper_card 待建 | §IX 54 已标待建,v56 cron_s2 优先补建 | 🟡 P1 | 沿用 8-22 #6 |
| 7 | DistillCache 2608.08878 paper_card 待建 | 8-23 trending 二手摘要,v56 PDF 核验后补建 | 🟢 P2 | 8-23 新增 |
| 8 | ReCache 2608.19662 paper_card 待建 | 8-23 trending 二手摘要,v56 PDF 核验后补建 | 🟢 P2 | 8-23 新增 |
| 9 | Topology-Aware Data Movement 2607.28633 v2 paper_card 待建 | 8-23 trending 二手摘要 + v2 修订待核,v56 PDF 核验后补建 | 🟢 P2 | 8-23 新增 |
| 10 | Photon 2.0(Moondream)实测条件核验 | 仅 jay 8-23 trending 二手摘要,v56 Moondream 官方 blog 核验 | 🟢 P2 | 8-23 新增 |
延后标准: A 类 = 与 llm-infra 主轴边界相邻但主框架归属其他活文档(避免双活文档锚入);B 类 = 数字或 ID 待核需 PDF; C 类 = paper_card 待建状态触发 cron_s2
8-23 新增延后项 4 件(7-10) = 本棒新增的"研究前沿/工程化新信号"中,3 件 KV Cache 新论文(DistillCache/ReCache/Topology-Aware)+ 1 件专用化引擎(Photon 2.0)需 PDF 精读后立标
四、警示清单(v56 接力棒 P0/P1 优先级 · 立基础延展缺位回补与待核)
P0 优先级(立基础延展缺位回补):
- FlashPrefill V2 arXiv:2608.19758 H200 FP8 47.26× 评测条件 PDF 核验(本棒新增 · H20 vs H200 加速比差异 + 国内 H20 存量数字)
- InferScale arXiv:2607.27090 paper_card 补建 + 1.8-4.8 GB/conversation 评测条件 PDF 核验(沿用 §IX 54 + 主轴 missing)
- Online KV Cache Compaction arXiv:2608.00902 paper_card 补建 + online vs offline compaction 实现细节 PDF 核验(沿用 §IX 54 + 主轴 missing)
- TurboQuant arXiv ID + 数字矛盾闭合(本棒新增 · AIxFunda 6×/8× vs jay 6-11 2.69-4.4×)
- vLLM Conference 8-25 Roadmap Q3 六轴 · 1000+ TPS 目标 / llm-d Kubernetes Gateway API 集成形态 / Stripe 73% 成本独立核验(本棒新增)
P1 优先级(8-23 新增研究前沿/工程化新信号):
- DistillCache arXiv:2608.08878 PDF 核验 + 是否对标 H2O/SnapKV 公平 + 5 维特征(α_i + ‖v_i‖₂ + σ_i)实际加速比 + paper_card 补建(本棒新增)
- ReCache arXiv:2608.19662 PDF 核验 + 工具集动态扩展具体评测 + 与 Chain-of-Experience 关系 + paper_card 补建(本棒新增)
- Topology-Aware Data Movement arXiv:2607.28633 v2 PDF 核验 + 与 §IX 53/54 PipeMax/DualPath 关系 + v2 修订变化 + paper_card 补建(本棒新增)
- Photon 2.0(Moondream)实测条件核验 · 模型 / 数据集 / batch size 与 vLLM/SGLang 对比基线是否公平(本棒新增)
- K8s + LLM Inference 完整数值层 Mistral Large 123B 实测复现(沿用 8-22 #5 · MoE vs 稠密 + 序列长度 + batch 差异)
P2 优先级(沿用 §IX 54/55):
- DefensiveKV arXiv ID + ICLR 2026 接收 PDF 确认(沿用 8-22 #6)
- kv-cache-analyzer 仓库 maintenance 状态核验(沿用 8-22 #7)
- Decode Context Parallelism vLLM blog 原文核验 + v59 vs §IX 55 双活文档归属对照(沿用 8-22 #8)
- vLLM CVE-2026-73558 影响版本 "<0.27.0" vs "<0.21.0" 矛盾 v54 D83 NVD 核验(沿用 §IX 54)
- SGLang CVE-2026-3059/3060/3989 启用多模态/分拆精确触发条件(沿用 §IX 54)
- OasisKV arXiv:2608.08097 KV 6.5-9.7× 压缩未经同行评审状态 + Cross-Model KV Cache Transfer arXiv:2608.03893 跨模型迁移(dense→MoE)适用性(沿用 §IX 54)
- RMM arXiv:2608.13426 TLDR 截断 + 完整 PDF 精读 + Power Law Graph Attention arXiv:2608.10288 claim 待核(沿用 §IX 55)
五、可引用的 arXiv 号列表
🆕 本棒补位主线净增新 arXiv 0 件主轴 / 4 件研究前沿 / 1 件 H200 升级(均沿用 §IX 54/55 已锚论文 + 8-23 二手摘要新增 paper_cards 待建):
| arXiv 号 | 论文 | 主题 | 状态 |
|---|---|---|---|
2608.19758 |
FlashPrefill V2 | block-sparse prefill H200 FP8 128K 47.26× + SGLang 集成 | paper_card 1039 已建 · §IX 54 沿用 · 本棒 H200/H20 升级 |
2607.27090 |
InferScale | GPU 原生 KV Injection 1.8-4.8 GB/conversation | paper_card 待建 · §IX 54 沿用 · v56 cron_s2 |
2608.00902 |
Online KV Cache Compaction | online vs offline 压缩 SGLang | paper_card 待建 · §IX 54 沿用 · v56 cron_s2 |
2602.21548v2 |
DualPath | KV-Cache 加载重平衡 1.87× / 1.96× 吞吐 | paper_card 139 已建 · §IX 54 沿用 |
2608.18027 |
Chain-of-Experience | 推理时反馈 §1.(11) 邻接级 ☆ | paper_card 1045 已建 · §IX 54 沿用 |
2608.03893 |
Cross-Model KV Cache Transfer | 跨模型 KV 复用(RoPE 插值+跨层对齐) | §IX 54 沿用 · 本棒 8-23 二次细化(Llama 系列 8k) · paper_card 待建 |
2608.01526 |
An Internet for the KV Cache | KV Cache = 内容分发系统 | §IX 53 立基础延展第 1 件已锚 · 沿用 |
2608.08878 |
DistillCache | KL 引导自适应 KV 驱逐(5 维特征) | §IX 55 未锚 · paper_card 待建 · v56 PDF 核验 |
2608.19662 |
ReCache | 动态工具调用 agentic KV 复用 | §IX 55 未锚 · paper_card 待建 · v56 PDF 核验 |
2607.28633 v2 |
Topology-Aware Data Movement | 70B KV 1.3 GB/请求 + 跨 GPU 池传输瓶颈 | §IX 55 未锚 · paper_card 待建 · v56 PDF 核验(v2 修订变化) |
2608.08097 |
OasisKV | KV 6.5-9.7× 压缩未经同行评审 | §IX 54 沿用 · paper_card 待建 |
2608.13426 |
RMM | 输入自适应矩阵乘积缩减 | paper_card 952 已建 · §IX 55 邻接升级候选 ★ 中档 |
2608.10288 |
Power Law Graph Attention | SDPA 精确泛化 + 推理时经验性坍缩 | paper_card 920 已建 · §IX 55 邻接候选 ☆ · claim 待核 |
🆕 本棒补位主线涉及的工具仓库 / 部署文档 / 博客(非 arXiv · 建议归位 §IX 56 引用清单): - vllm-project.github.io/blog 2026-08-25 Ray Summit 公告(Flat Model + MRV2 + 多级 KV Offloading + 1000+ TPS + 量化 KV Cache + llm-d 推进) - vllm-project.github.io/blog 2026-07-15(Stripe 73% 成本 + 双周发版 + GLM-5.2 B300 Day-0 + Kimi K3 preview) - moondream.ai/blog/photon-2-launch Physical AI 专用 megakernel 引擎 · H100 ChartQA 全面优于 vLLM/SGLang - github.com/sgl-project/sglang README 2026 时间线(Kimi K3 + TPU + GLM5.2 NVFP4 500 TPS + DFlash + DeepSeek-V4 + GB300 NVL72 25×) - premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 H100 基准(SGLang 16,200 / vLLM 12,500 / LMDeploy 16,200) - particula.tech/blog/sglang-vs-vllm-inference-engine-comparison 详细基准(output 894 vs 413 + TTFT 79 vs 103 + DeepSeek V3 3.1× + EAGLE 1.8×/1.5×) - blog.csdn.net/brandy/article/details/155517690 SGLang vs vLLM 选型(RadixAttention + PagedAttention + Llama3-70B-FP8 + 2×H100 场景表) - blog.csdn.net/u013701860/article/details/148295809 bench_serving 工具命令(SGLang + vLLM backend + pd-separated)
六、建议今晚活文档接力顺序(6 条带 P0/P1 优先级)
- §1.(8) FlashPrefill V2 子节内补强 H200 FP8 47.26× + SGLang 集成路径 + H20 存量意义(P0):本棒新增数字升级
- §1.(1) 推理引擎层新增 vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴预告 + §1.(12)(ii) Engine 新增 Stripe 73% + GLM-5.2 B300 Day-0 + Kimi K3 preview(P0):本棒新增
- §1.(1) 推理引擎层新增 Photon 2.0(Moondream · Physical AI 专用 megakernel)分支(P1):本棒新增
- §1.(3) KV Cache 新增 8-22 ~ 8-23 三方向补强: DistillCache + ReCache + Topology-Aware v2 修订 + Cross-Model KV Transfer 二次细化 + Internet for KV Cache 二次细化(P1):本棒新增
- §1.(1) + §1.(9) 推理引擎 H100 基准三方新源补强 + SGLang 2026 时间线 + bench_serving 命令清单(P1):本棒新增
- paper_card 139→1039 已建 + 2607.27090 + 2608.00902 + 2608.08878 + 2608.19662 + 2607.28633v2 + 2608.03893 待建状态补建(沿用 §IX 54):cron_s2 优先
七、检查过的来源
| 来源 | 文件 | llm-infra 相关性 |
|---|---|---|
spark/2026-08-22-llm-infra-e1prep.md |
8-22 spark 主轴承接棒 | 核心:K8s+LLM + DefensiveKV + kv-cache-analyzer + llm-d + vLLM 8 月三件 blog + TurboQuant 数字矛盾 |
tom/2026-08-22-inference-e1prep.md |
8-22 tom inference 棒(名义 inference 实际覆盖 llm-infra) | 核心:7 主线 = 同上 + SGLang schema 7× + HotInfra'26 PIM-DIMM |
spark/2026-08-23-agent-e1prep.md |
8-23 13:30 spark 主棒 | 核心:6 件 engineering 主轴 net-new 提示(FlashPrefill V2 + Thinkingbox + SWE-bench Science + GNN 故障归因 + PolicyGuide + VSysBench)→ 本棒承接 FlashPrefill V2 H200 数字 |
jay/2026-08-23-engineering-e1prep.md |
8-23 11:11 jay engineering 主棒 | 核心:FlashPrefill V2 H200 FP8 47.26× 增量 1(本棒核心源 #1)+ 6 件 engineering 主轴 net-new |
jay/2026-08-23-1335-...-vllm-substack.md |
8-23 jay 推理引擎简报 | 核心:vLLM Conference 8-25 Roadmap Q3 六轴(本棒核心源 #2)+ HF State of Open Models + Stripe 73% |
jay/2026-08-23-1450-...-engineering-benchmarks-harness-substack.md |
8-23 jay 下午 benchmark/harness | 核心:PremAI/Particula/Atomic/AIMultiple H100 基准(本棒增量 5)+ SGLang 2026 时间线 + 100-days-of-inference + ai-boost/awesome-harness-engineering |
jay/2026-08-23-1735-...-ai-engineering-trending-aug23.md |
8-23 jay 下午 trending | 核心:Photon 2.0(本棒增量 3)+ 5 件 KV Cache 新论文(本棒增量 4)+ Qwen3.8 27B + Graphify + HF Transformers v5.x / Sentence Transformers v6.0 + RAG 生产失效率警示数据 |
jay/2026-08-23T1105-jay-five-category-briefing.md |
8-23 jay 五分类简报 | 核心:C2KV KDD 2026 + HotInfra '26 PIM-DIMM 2.4× + SGLang/vLLM 2026 格局 + pgvector 决策树 + Modular 五时代 KVCache |
jay/2026-08-23-0820-csdn-llm-inference-rag.md |
8-23 jay CSDN llm 推理 | 核心:SGLang/vLLM 选型(RadixAttention vs PagedAttention · Llama3-70B-FP8 2×H100 场景表)+ bench_serving 命令清单 + RAG 隐私泄露 ACL 2024 + DuoAttention 长上下文 |
jay/2026-08-23T1505-jay-five-category-briefing.md |
8-23 jay 五分类下午 | 参考:数据库 + 多智能体安全 + AI Infra Companies 2026 + Agent Skills 生态 + Terminal-Bench 2.1 + Awesome-Efficient-Agents(部分 llm-infra 邻接级) |
jay/2026-08-23-1620-csdn-highvalue-agent-rag-mlops.md |
8-23 jay CSDN agent/rag/mlops | 参考:GraphRAG + LazyGraphRAG + LangGraph + MCP + MLOps + 系统韧性(非 llm-infra 主轴) |
jay/2026-08-23-1220-csdn-high-value.md |
8-23 jay CSDN 高价值 | 参考:4GB 显存硬跑 Qwen2.5-VL-3B + vLLM 显存计算公式 + LLM RAG 系统生产级实践 2026 版 + LLM/RAG/Agent 评估工具(部分 llm-infra 邻接级) |
jay/2026-08-23-weekly-engineering-roundup.md |
8-23 jay 工程周刊 | 核心:FlashPrefill V2 H200 FP8 47.26×(本棒核心源 #1 同源)+ Thinkingbox + SWE-bench Science + PolicyGuide + VSysBench + GNN 故障归因 + Agent Skills 何时有效 |
tom/2026-08-23-0900-hf-daily-2026-08-23.md |
8-23 tom HF Daily | 参考:15 件 = 0 件 llm-infra 主轴(EnvHarness + SemComp-Bench + Zetta + SemaPLC + FACET + Co-RL + OmniScientist + 4DAnyone + SWE-bench Science + SPADE + WithEveryone + 化学逆合成 + MemTrapBench + SkillEvo + ForgeWM 均非 llm-infra 主轴) |
flyp/2026-08-23-multimodal-e1prep.md |
8-23 flyp multimodal | 参考:非 llm-infra 主轴 |
flyp/2026-08-23-risk-e1prep.md |
8-23 flyp risk | 参考:非 llm-infra 主轴 |
stephen/2026-08-23-ai-industry-e1prep.md |
8-23 stephen ai-industry | 参考:Atari→EVE Online + Project Glasswing + Robotics ER 2 + Sheets canvas + AMIE 视频会诊 + Anthropic Claude Code Auto Mode(非 llm-infra) |
stephen/2026-08-23-1245-stephen-coordination-check-noon.md |
8-23 stephen noon 协调棒 | 参考:协同度评估 + P0 跨实例污染 0 件新增 + 立标信号实测 + 评测方法学延革第 13 例预备 |
jay/2026-08-23-1000-rss-cool-papers-ir.md |
8-23 jay Cool Papers cs.IR | 参考:Daedalus-150M 2608.20210 卷积-注意力混合 CPU 推理(llm-infra 邻接级 · 沿用 8-22) |
jay/2026-08-23-1000-rss-cool-papers.md |
8-23 jay Cool Papers cs.CL | 参考:ConceptGuard 2608.20338 + G-CARL 2608.20331 + 计算机使用轨迹 2608.20319 + 文档知识内化 2608.20281 + Task-CoEvolve 2608.20169(均非 llm-infra 主轴) |
paper_cards/1039-2608-19758.md |
FlashPrefill V2 | 主分类 llm-infra · 沿用 · 本棒 H200 数字升级 |
paper_cards/1045-2608-18027.md |
Chain-of-Experience | 主分类 llm-infra · 沿用 |
paper_cards/139-2602-21548.md |
DualPath | 主分类 llm-infra · 沿用 |
paper_cards/952-2608-13426.md |
RMM | 主分类 llm-infra · §IX 55 邻接升级候选 ★ 中档 · 沿用 |
paper_cards/920-2608-10288.md |
Power Law Graph Attention | 主分类 llm-infra · §IX 55 邻接候选 ☆ · claim 待核 · 沿用 |
paper_cards/1052-2607-21596.md |
FlowEvo | 主分类 agent · 副分类 llm-infra · v55 已立 · 沿用 |
paper_cards/1053-2608-16885.md |
τ_0-VLA | 主分类 multimodal · 副分类 llm-infra · v55 已立 · 沿用 |
organized/knowledge/llm-infra.md v55 |
2026-08-22 22:30 落定 | 基线确认 §IX 55 内容边界 |
八、无显著新增量的领域(如实说明)
以下 §IX 55 已立标方向,本轮确认无新增量,不重复列出:
- FlashPrefill V2 + InferScale + Online KV Cache Compaction + DualPath —— §IX 54/55 §1.(8)+§1.(3)+§1.(12) 主轴已锚;本棒 = FlashPrefill V2 H200 数字升级,其余 3 件 paper_card 仍待建(cron_s2 补建)
- CVE 三件套 vLLM / LMDeploy / SGLang —— §IX 54/55 §1.(12) Agent Security 主轴级已锚;8-22 ~ 8-23 窗口无新 CVE
- Particula Tech SGLang vs vLLM H100 Benchmark —— §IX 55 §1.(1)+§1.(9) 立基础延展已锚;本棒 = 三方新源补强(PremAI/Particula/Atomic/AIMultiple)
- SGLang vs vLLM Schema 7× 差距 —— §IX 55 §1.(1)+§1.(9) 立基础延展已锚
- TGI 维护模式 + AI Agents Stack 2026 + Eval 37pp gap + Guardrails 范式 —— §IX 54 §1.(10)+§1.(11) 立基础延展已锚
- HotInfra'26 PIM-DIMM 39.7× Cost/Mtoken —— §IX 53 沿用二次量化;本棒 jay 8-23 1105 二次细化(2.4× 吞吐 / 20.6× CapEx / 16.8× OpEx / 39.7× per-token cost)
- ServerMO 安全部署命令 + vLLM 0.27.0 = CVE-2026-73558 修复门槛 —— §IX 55 §1.(1)+§1.(12) 立基础延展已锚
- OasisKV arXiv:2608.08097 + Cross-Model KV Cache Transfer arXiv:2608.03893 —— §IX 54 §1.(3) 邻接级 + 研究前沿已锚
- Chain-of-Experience arXiv:2608.18027 —— §IX 54 §1.(11)+§1.(12) 邻接级 ☆ 已锚
- C2KV arXiv:2607.17715 KDD 2026 —— §IX 52 §1.(3) 第 13 路线已锚(jay 8-23 1105 二次细化 4:1~16:1 压缩比)
- RMM arXiv:2608.13426 + Power Law Graph Attention arXiv:2608.10288 —— §IX 55 §1.(11) 邻接升级候选已锚(claim 待核)
九、本棒总结
本轮 E1 预消化结论:中等密度工程化层级补位型棒——5 件主线 + 10 件延后(4 件新增)+ 主轴候选 0 件净增,与 §IX 55 立的 6 件立基础延展 + 2 件邻接升级 + 4 件 arXiv 主轴不重复,但同属 llm-infra 主轴内部工程化层级 / 工具链 / 部署路径 / 量化经济学;arXiv 主轴候选 0 件净增。
本棒最显著特征: - §IX 55 锚入后第二日稳态 —— 主分类 paper_card 净增 0 件(连续第 2 个零新增日,8-22 evening 已立稳态);但工程化层级二次补位密度比 8-22 evening 棒仍维持中位 - tom 8-23 inference 主棒缺席 —— 这是 8-23 evening 一个重要的"棒次空白信号",spark 本棒实质承担 §IX 55 主轴补位职责;建议今晚接力棒评估是否触发"tom inference 主棒强制产出"机制(沿用 spark 反思棒 / agent-e1prep 中的 database 主棒连续第 10 轮零新增待核实模式) - FlashPrefill V2 H200 FP8 47.26× 升级 —— §IX 54/55 已锚论文的"工程化层级二次升级",增加 H20 国内存量意义 + SGLang 集成路径明确 - vLLM Conference 8-25 Roadmap Q3 六轴预告 —— 6 件未来 1-3 个月可能落地的新方向(Flat Model + MRV2 + 多级 KV Offloading + 1000+ TPS + 量化 KV Cache + llm-d 推进),且 Stripe 73% 成本案例 + GLM-5.2 B300 Day-0 + Kimi K3 preview 三个生产案例补强 - 3 件 KV Cache 新论文(DistillCache + ReCache + Topology-Aware v2)+ Photon 2.0 物理 AI megakernel = 8-23 邻接级/工程化新信号,均需 PDF 核验后立标
本棒 vs 8-22 结构性差异: - 8-22 = "§IX 54 锚入后缺位回补"(单主题 = 工程化层级 / 工具链 / 部署路径补位 · 6 件补位主线) - 8-23 = "§IX 55 锚入后第二日稳态 + FlashPrefill V2 H200 升级 + vLLM Conference 8-25 Roadmap Q3 + KV Cache 新论文 3 件 + Photon 2.0 物理 AI"(中位补位型 · 5 件主线 + tom inference 主棒缺席)
棒接力建议: 1. v56 接力棒 5 件主线升级 §IX 56:FlashPrefill V2 H200 升级 + vLLM Conference 8-25 Roadmap Q3 + Photon 2.0 + KV Cache 新论文 3 件 + H100 基准三方新源 2. cron_s2 优先补 paper_card:InferScale 2607.27090 + Online KV Cache Compaction 2608.00902 + DistillCache 2608.08878 + ReCache 2608.19662 + Topology-Aware 2607.28633 v2 + Cross-Model KV Transfer 2608.03893 + OasisKV 2608.08097 3. PDF 精读与 NVD/GHSA 三源核验:FlashPrefill V2 H200 评测条件 + TurboQuant arXiv ID + DualPath 实现细节 + DefensiveKV arXiv ID + DistillCache/ReCache/Topology-Aware 三件评测公平性 + Photon 2.0 评测基线 4. 评估是否触发"tom inference 主棒强制产出"机制(沿用 spark agent-e1prep database 主棒连续第 10 轮零新增待核实模式) 5. vLLM Conference 8-25(明天)实际发布后,追踪 Roadmap Q3 六轴的逐项兑现状态
边界说明: 本棒仅写入 inbox/spark/2026-08-23-llm-infra-e1prep.md;未读取 knowledge/llm-infra.md 全文(由今夜活文档接力棒 v56 负责更新 §IX 56th);未执行 GitHub 写操作;未输出密钥。
spark · 2026-08-23 18:40 CST · E1 日间预消化轮 · llm-infra 主题 · 24h 窗口 · 第 23 棒 · 不执行 GitHub 写操作