llm-infra · E1 预消化简报(2026-07-31)

作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 12 棒 · 7-31 晚间活文档接力备料) 覆盖时段:2026-07-30 18:40 → 2026-07-31 18:40(约 24 小时主增量)+ 2026-07-29 18:40 → 2026-07-31 18:40(48h 邻接参考) 基线:organized/knowledge/llm-infra.md Wave3 §VII 32 轮抢修完成版(2026-07-29 05:00 收官 · 11+1 维全景 + C1-C66 共 66 条共识 + D1-D32 共 32 条争议 + O1-O140 共 140 条开放问题 + T1-T27 共 27 条趋势);7-30 evening spark E1 第 11 棒(6 主线 + 3 旁证 + 1 警示 · SIGMOD/SIGCOMM 2026 顶级会议推理优化 6 件套 + llm-d 7-30 持续活跃 + GitHub Trending 7-30 工程化亮点 + DeepSeek V4 完整架构 + CSDN HIXL + 选型决策树 v2.0)已并入 v33 接力基线 覆盖来源: - inbox/jay 7-30 evening → 7-31 18:40 共 16 件(1105-jay-five-category-briefing-#16 17.5KB LLM Serving 6 件 + MC-SF + CXL-PIM + PipeMax + vLLM AI Blog + MCP 2026-07-28 + A2A · 1335-jay-engineering-filter 10.2KB · 1505-jay-five-category-briefing 19.2KB Bespoke OLAP + Jailbreak + LAAR + DevOpsBeast workload-first + inferenceengineering.tech 对照表 · 1620-jay-csdn-sglang-bench-eval 15.3KB DGX Spark + SGLang/vLLM 横向评测 + 选型指南 · 1735-jay-briefing-inference-stack-vecdb-substack 18.6KB TGI 维护模式 + Colibri + Spheron H100 + vLLM FP8 KV-Cache + LMCache 2026 Q2 Roadmap + Vector DB 选型决策框架 + Inference Engineering Substack · csdn-substack-ai-research 15.9KB · ai-engineering-trending 12.4KB · engineering-e1prep-v40 43.5KB · csdn-weekly 6.3KB · 4 RSS simon-willison/bytebytego/nathan-benaich/raschka + 2 RSS lilian-weng/msr-blog + 1 RSS import-ai + 2 RSS yt-karpathy/yt-fireship) - inbox/tom 7-30 evening → 7-31 共 7 件(1440-agent-rag-longcontext-radar 7-30 evening + 2040-agent-rag-longcontext-radar 7-30 evening 补充版 + 0840-agent-rag-longcontext-radar 7-31 8 件候选 3 P0 高价值(Metis + Graph-Native Bitemporal + Memory for LLMs 综述)+ 5 追踪(Voice Memory + CADENCE + MindForge + SpecFirst + πR²) + α-mem Substack · 0852-rag-e1prep · 0900-hf-daily-2026-07-31 15 件全核 9 新进 + 6 续立 · 1005 RSS yt-lex-fridman + 1005 RSS yt-yannic-kilcher · 1541-evaluation-e1prep · ⚠️ tom 7-31 inference E1 连续 5 日缺失(7-27/7-28/7-29/7-30/7-31)信号延续第 6 日) - inbox/flyp 7-30 evening → 7-31 共 8 件(0950-SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read 13.2KB 跨任务技能 vs 原生记忆双线批判性精读 + Awesome-Agent-Skills 列表对照 · multimodal-e1prep 17.7KB · risk-e1prep 45.2KB · 1550-VisualPatchWorld-code-world-model-as-third-paradigm-critical-read · 4 RSS cameron-wolfe/interconnects/yt-ai-explained/yt-two-minute-papers) - inbox/spark 7-30 evening → 7-31 共 4 件(1337 agent-e1prep-v57 65KB + 1339 llm-infra-e1prep-v11 50.1KB + 3 RSS 通稿 1001/1002/1005 + ⚠️ spark 7-31 morning 节奏反转后第 7 棒静默期独立 E1 缺失 · 本棒 llm-infra-e1prep-v12 恢复) - inbox/stephen 7-30 evening → 7-31 共 13 件(1026-ai-industry-e1prep-v32 19.9KB + 0910-news-x-vip-radar 8.7KB 🆕 DeepMind Gemini Robotics 2 + OpenAI GPT-5.6 Sol GPU kernel 自优化 + speculative decoding 提速 15%+ + ChatGPT for Academic Researchers 1 万→10 万 + 1003-news-anthropic-news/deepmind-news/openai-news 5+5+5 + 1004-news-bens-bites/google-ai/hf-blog/tldr-ai 5+5+5+5 + 1006-news-yt-anthropic/deepmind/openai 5+5+5 + 1245-coordination-check-noon 8.4KB · 沿用 ai-industry 立标级 6 件 + 9 frontier lab news 通稿) - paper_cards 7-30 evening → 7-31 18:40 新卡 IDs 666-681 共 16 张,主分类 llm-infra 新增 2 张 = 673 arXiv:2607.16955 CADENCE(DRIFT per-token forward/reverse KL 凸混合 · HF Daily 4★)+ 681 arXiv:2607.26627 Revisiting Lossy Verification in Speculative Decoding(HF 7-31 推)(副分类 llm-infra 0 张 · 主分类 llm-infra 沿用 657 arXiv:2607.19712 RLHF C++ + 668 arXiv:2607.25380 Memory for LLMs 综述 · 邻接 llm-infra 工程主分类 0 张 · 邻接 agent 主分类 9 张 + multimodal/evaluation/rag 主 6 张) 结论:中密度(7 主线 + 3 旁证 + 1 警示),核心动作 = (1) SIGMOD 2026 LLM Serving 三件套(CoDec/AlignedServe/HotPrefix)2026-05-18 published · 前缀共享解码内核 + 前缀感知 batching + 热 aware KV cache 调度(2026 SIGMOD 明显增加 LLM inference systems track);(2) MC-SF 在线调度 arXiv:2502.07115v5 MIT+MSR+Amazon(LLM inference 显式建模 KV cache 动态内存增长 · ILP 最优基准 · 仅需输出长度预测即可达常数竞争比)+ LAAR Long-Context-Aware 分布式路由 arXiv:2604.15732v1(Envoy EPP policy · llm-d MaxScorePicker);(3) Memory for LLMs 综述 arXiv:2607.25380 统一架构分类学三个正交轴(表征隐式 vs 显式 + 更新策略 + 可扩展查找存储)memory 研究碎片化 → 统一框架;(4) LMCache 2026 Q2 Roadmap GitHub Issues/2923(完整 vLLM Omni KV Caching 接入 + SGLang MP Mode 多处理集成 + Token dropping 允许 vLLM 检索已丢弃 KV) + vLLM FP8 KV-Cache 50% 显存节省(H100/H200 公式推导)+ Colibri 纯 C 744B MoE 25GB RAM 流式 experts;(5) vLLM AI Blog 2026-07-16 生产质量工程(2026 年 6 月 1,918 commits 到 main + CI 1,300 万 job minutes + 1400 并发 runner + 两周一次发版节奏) = 工程成熟度达 PyTorch/Kubernetes 量级;(6) 2026 推理引擎选型决策树 v3.0 多源交叉(Spheron H100 Llama 3.3 70B FP8 + DevOpsBeast workload-first + inferenceengineering.tech 对照表 + TGI 2026-03-21 进入维护模式 · HF 官方引导迁移 vLLM/SGLang);(7) paper_cards 主分类 llm-infra 新增 2 张 = 673 CADENCE arXiv:2607.16955(HF Daily 4★ · DRIFT per-token KL 凸混合)+ 681 Lossy Verification in Speculative Decoding arXiv:2607.26627(HF 7-31 推 · Speculative Decoding 机制分析) + 3 旁证:PipeMax Pipeline Parallelism + KV Cache Offloading arXiv:2605.02189v1 commodity GPU 8 GPUs 2.51× + CXL-PIM KV Cache Server HotInfra '26(Mooncake 后继 · DeepSeek-R1-671B 32K tokens · 2.4× 吞吐 + 39.7× Cost/Mtokens 降低 + 29.5× Tokens/Watt 提升) + LAAR Long-Context-Aware 分布式 LLM 路由 arXiv:2604.15732v1(Envoy EPP policy · llm-d MaxScorePicker · 仅需输出长度预测) + 1 警示:tom 7-31 inference E1 连续 5 日缺失延续第 6 日 + spark 7-31 morning 节奏反转后第 7 棒静默期(本棒恢复 llm-infra-e1prep-v12 · 但 spark 7-31 morning 独立 E1 仍缺)


一、核心增量(7 主线 + 3 旁证 + 1 警示,按活文档归位顺序)

增量 1【推理引擎 §2.1 / 调度 §2.2】SIGMOD 2026 LLM Serving 三件套(CoDec/AlignedServe/HotPrefix)2026-05-18 published(★★ 必补)

  • 来源:inbox/jay/2026-07-31T1105-jay-five-category-briefing.md Reproduction 条目 11/12/13(SIGMOD 2026 LLM Serving 三件套 + MC-SF + CXL-PIM + PipeMax)+ inbox/jay/2026-07-31-engineering-e1prep.md 增量 1(jay 视角工程化展开)+ organized/knowledge/llm-infra.md §2.1 推理引擎 6 寡头 + vLLM PagedAttention 2.0 + SGLang RadixAttention + §2.2 调度 9 学派 + Disagg 5 节点 + §2.13 选型决策树 2026 中期 + §2.10 系统栈 HPCA 2026 + ACL 2026 System-Aware KV Cache Optimization Survey 已收

SIGMOD 2026 LLM Serving 三件套完整展开:

B1 · CoDec: Prefix-Shared Decoding Kernel for LLMs(SIGMOD 2026 · ACM 官方出版 · 顶级数据库会议) - 核心贡献:前缀共享解码内核,多请求间共享前缀时减少冗余计算 - 技术路径:与 SGLang RadixAttention 一致(后者是 trie-based RadixAttention · 前者是 kernel-level prefix sharing) - 状态:SIGMOD 2026 published 2026-05-18(jay 1105 briefing Reproduction 条目 11)

B2 · AlignedServe: Prefix-aware Batching(SIGMOD 2026 · 同期 paper) - 核心贡献:前缀感知的 batching 调度,构建高吞吐、低计算浪费的 LLM serving 系统 - 与 CoDec 互补:CoDec 关注 kernel 级别前缀共享;AlignedServe 关注调度级别 batching 优化

B3 · HotPrefix: Hotness-Aware KV Cache Scheduling(SIGMOD 2026 · 同期 paper) - 核心贡献:热 aware KV cache 调度,实现高效前缀共享 - arXiv:SIGMOD 2026 published 2026-05-18

SIGMOD 2026 LLM inference systems track 增强信号: - 2026 年 SIGMOD 明显增加了 LLM inference systems 论文 track;SIGMOD 2026 三件套(CoDec/AlignedServe/HotPrefix)代表 2026 年 VLDB/SIGMOD 对 LLM serving 系统的集中关注 - 与 §2.10 系统栈 HPCA 2026 wafer-scale + SIGMOD 2026 OmniServe 异构 CPU-GPU(7-30 evening 已收)+ SIGCOMM 2026 KVServe/SpectrumKV disagg 通信优化(7-30 evening 已收)= 2026 数据库/通信/系统三大顶会议 LLM inference systems track 集中爆发

  • 与活文档关系:§2.1 推理引擎 6 寡头 + vLLM PagedAttention 2.0 + SGLang RadixAttention 已收 + §2.2 调度 9 学派 + Disagg 5 节点已收 + §2.10 HPCA 2026 + §2.13 选型决策树 2026 中期已收;但 SIGMOD 2026 三件套(CoDec/AlignedServe/HotPrefix · 前缀共享解码内核 + 前缀感知 batching + 热 aware KV cache 调度)未单独作为「2026 数据库顶会议 LLM Serving 三件套」入位

  • 建议归入:§2.1 推理引擎(新增「SIGMOD 2026 LLM Serving 三件套(CoDec 前缀共享解码内核 + AlignedServe 前缀感知 batching + HotPrefix 热 aware KV cache 调度 · 2026-05-18 published · 与 SGLang RadixAttention / vLLM PagedAttention 实现路径对照)」小节)+ §2.10 系统栈(沿用 + 强化「2026 数据库/通信/系统三大顶会议 LLM inference systems track 集中爆发」立标);新增 C84 共识候选:"2026 数据库/通信/系统三大顶会议 LLM inference systems track 集中爆发 = SIGMOD 2026 三件套(CoDec/AlignedServe/HotPrefix · 前缀共享 + 前缀 batching + 热 aware 调度)+ SIGMOD 2026 OmniServe 异构 CPU-GPU + SIGCOMM 2026 KVServe/SpectrumKV disagg 通信 + HPCA 2026 wafer-scale 系统论文 + ACL 2026 System-Aware KV Cache Optimization Survey";新增 O162 试金石:"SIGMOD 2026 三件套与 SGLang RadixAttention / vLLM PagedAttention 的实现路径对照;SIGMOD/SIGCOMM 论文配套代码库开源复现率"

增量 2【调度 §2.2】MC-SF 在线调度 arXiv:2502.07115v5 MIT+MSR+Amazon + LAAR Long-Context-Aware 路由 arXiv:2604.15732v1(★★ 必补)

  • 来源:inbox/jay/2026-07-31T1105-jay-five-category-briefing.md Reproduction 条目 14(MC-SF arXiv:2502.07115v5 持续更新中)+ inbox/jay/2026-07-31-engineering-e1prep.md 增量 1(MC-SF 完整展开)+ inbox/jay/2026-07-31T1505-jay-five-category-briefing.md Database 条目 3(LAAR arXiv:2604.15732v1 · 与 MC-SF 互补)+ organized/knowledge/llm-infra.md §2.2 调度 9 学派 + MathOpt arXiv:2605.01280 Ω(√(B log G)) + Tail-Aware arXiv:2606.18431 + Albireo arXiv:2606.01927 + Fluid-Guided WAIT arXiv:2504.11320v4 已收

MC-SF Online Scheduling for LLM Inference with KV Cache Constraints arXiv:2502.07115v5 完整展开: - 机构:MIT CSAIL + Microsoft Research + Amazon(三巨头联合) - 核心贡献: - 理论模型:LLM inference 调度问题的形式化模型,显式建模 KV cache 动态内存增长 - 整数规划(ILP):hindsight-optimal benchmark 的 ILP 公式;证明确定性在线算法在对抗性到达下无法达到常数竞争比 - MC-SF 算法:实际的多项式时间算法,在 prompt 到达分布满足特定结构条件时达到常数竞争比 - 关键发现:仅需输出长度的预测 õᵢ ≥ oᵢ 即可(不需要精确值) · 是 SLO 决策理论的重大突破 - 实验:合成实验(对比 hindsight 最优)+ 大规模真实 LLM trace 仿真 - 评价:理论与工程结合的杰作,MIT 运筹学 + MSR Azure 系统团队联合出品;与 vLLM production blog 提到的调度问题直接呼应

LAAR Long-Context-Aware 分布式 LLM 路由 arXiv:2604.15732v1 完整展开: - 核心问题:长上下文工作负载(100K-1M tokens)下,prefill 计算主导成本、内存带宽瓶颈、cache 管理效率成为关键;现有路由策略(load-aware / session-affinity / cache-affinity)不够 - 方法:LAAR(Long-context-Aware Adaptive Routing),将请求长度预测 õᵢ 显式纳入 cost 函数,最小化 cost(m|x) = f(Q, L, c)(Q=成功率,L=延迟,c=计算成本) - 实现:Envoy Endpoint Picker(EPP)policy,通过 external processing filter 注入;调用 llm-d 的 MaxScorePicker;提取轻量级请求特征,实时计算每个 endpoint 的 score - 基准对比:llm-d(2026)、round-robin、cache-affinity 等 - 关键发现:与 MC-SF 同 — 仅需输出长度预测 õᵢ ≥ oᵢ(上界)即可有效降低 cost

MC-SF + LAAR 双立标 = LLM serving 调度理论 2026 H2 两大理论突破: - MC-SF:理论模型 + ILP 最优基准 + 形式化竞争比证明(离线最优 baseline) - LAAR:工程实现(Envoy EPP)+ llm-d 集成 + 100K-1M 长上下文长尾场景(在线路由) - 共同方法论:仅需输出长度上界预测 = SLO 决策理论的"上界即足够"原则 - 与 arXiv:2605.01280 MathOpt Ω(√(B log G)) 立标组合 = LLM serving 调度从启发式 → 数学优化(OR 立场论文)→ 形式化竞争比(MC-SF)→ 在线路由实现(LAAR)= 理论 + 工程 + 在线 三轴并行

  • 与活文档关系:§2.2 调度 9 学派 + MathOpt Ω(√(B log G)) + Fluid-Guided WAIT arXiv:2504.11320v4 已收;但 MC-SF arXiv:2502.07115v5 MIT+MSR+Amazon 完整理论模型(ILP + 竞争比 + 仅需输出长度上界)未入位;LAAR arXiv:2604.15732v1 Envoy EPP 路由 + llm-d MaxScorePicker 集成未入位

  • 建议归入:§2.2 调度 9 学派 + MathOpt(沿用 + 新增 MC-SF + LAAR 作为「LLM serving 调度理论 2026 H2 两大理论突破 · ILP 最优基准 + Envoy EPP 在线路由 + llm-d MaxScorePicker 集成 · 共同方法论:仅需输出长度上界预测」);新增 C85 共识候选:"LLM serving 调度理论 2026 H2 = MC-SF arXiv:2502.07115v5 MIT+MSR+Amazon 离线理论模型(ILP + 竞争比)+ LAAR arXiv:2604.15732v1 Envoy EPP 在线路由实现 + MathOpt arXiv:2605.01280 OR 立场论文 + Fluid-Guided WAIT arXiv:2504.11320v4 共同方法论:'仅需输出长度上界预测' = 上界即足够 SLO 决策原则";新增 O163 试金石:"MC-SF 与 vLLM/SGLang 实际调度器集成时间线;LAAR Envoy EPP 在 llm-d v0.7+ 的实际部署路径"

增量 3【KV cache §2.3 / 工程基础设施 §2.10】Memory for LLMs 综述 arXiv:2607.25380 + LMCache 2026 Q2 Roadmap(vLLM Omni KV Caching + SGLang MP Mode + Token dropping)(★★ 必补)

  • 来源:inbox/tom/2026-07-31-agent-rag-longcontext-radar.md #3 P0 高价值(Memory for LLMs 综述)+ inbox/stephen/2026-07-31-ai-industry-e1prep.md paper_cards/668 + inbox/jay/2026-07-31-engineering-e1prep.md 增量 2(jay 视角邻接 + 完整展开)+ inbox/jay/2026-07-31T1735-jay-briefing-inference-stack-vecdb-substack.md 第五节(LMCache 2026 Q2 Roadmap GitHub Issues/2923 + vLLM FP8 KV-Cache 50% 显存节省)+ organized/knowledge/llm-infra.md §2.3 KV cache 14 件套 + LMCache crash-safe arXiv:2510.09665 + TurboQuant 6× + MXFP4/MXFP8 第 5 分叉 + Modular Five Eras + §2.10 系统栈 ASPLOS 2026 SwiftSpec + CXL KV Cache Server HotInfra'26 已收

Memory for Large Language Models 综述 arXiv:2607.25380 完整展开: - 核心贡献:系统梳理 LLM 中 memory 的 architecture-centric taxonomy - 三个正交轴: 1. 表征:隐式 vs 显式(implicit vs explicit) 2. 更新策略:各种更新机制 3. 可扩展查找存储:lookup storage 的可扩展性 - 覆盖范围:transient attention + recurrent state dynamics + parameter-efficient adaptations + scalable lookup storage 四大策略族 - 意义:memory 研究碎片化 → 统一框架;入门此方向的完整地图 - 主分类:llm-infra(engineering 邻接 + agent 邻接) - 与已有 MemoryAgentBench ICLR 2026 外挂式评测 + Metis 原生 memory foundation 模型 + Graph-Native Bitemporal 工程化实现形成「2026 H2 Agent Memory 综述 + 原生 + 外挂 + 时态 四线并行」

LMCache 2026 Q2 Roadmap GitHub Issues/2923 完整展开: - 已完成项目(2026 Q2): 1. vLLM Omni KV Caching:完整 KV + hidden states + embedding + diffusion caching 2. Encoder Caching:vLLM Omni 完整支持 3. TRT-LLM KV Caching:与 NVIDIA 合作 4. Modular KV Caching:北向树架构,与各推理引擎解耦 5. SGLang MP Mode:多处理模式集成 - 技术亮点: - Token dropping 方法允许 vLLM 检索已丢弃的 KV cache 并用于前向计算 = KV cache 持久化的关键增强 - LMCache 正成为 KV cache 的"统一抽象层",横跨 vLLM / SGLang / TRT-LLM - 工程意义:LMCache 是 2026 年 KV cache 领域的"基础设施中间件"——不管选哪个推理引擎,LMCache 都能提供统一的缓存层 = KV cache 基础设施中间件立标

vLLM FP8 KV-Cache 50% 显存节省完整展开: - 核心公式(Zylos Research): ``` FP16 KV-Cache: batch × seq_len × layers × kv_heads × head_dim × 2 bytes × 2(K+V) = 8 × 8192 × 64 × 8 × 128 × 2 × 2 ≈ 17.2 GB

FP8 KV-Cache: 同上但 1 byte/值 = 8 × 8192 × 64 × 8 × 128 × 1 × 2 ≈ 8.6 GB 节省: ~50% `` - **适用条件**:Hopper GPU(H100/H200);需要硬件 FP8 支持 - **工程收益**:相同显存可容纳更长序列或更大 batch size;内存带宽需求降低;显存受限 GPU 可部署更大模型 - **实战参数**:--enforce-eager(关闭某些优化用于调试)+--gpu-memory-utilization 0.90(留 10% headroom 给 CUDA context 和碎片)+--max-model-len`(设低可释放 KV cache 空间增加并发) - 与 §1.9 量化路线图第 5 分叉 MXFP4/MXFP8(Kimi K3)互补:FP8 KV-Cache 是 Hopper 硬件支持的 KV cache 量化;MXFP4 是 MoE 权重量化

  • 与活文档关系:§2.3 KV cache 14 件套 + LMCache crash-safe arXiv:2510.09665 + TurboQuant 6× + MXFP4/MXFP8 第 5 分叉 + Modular Five Eras 已收;但 Memory for LLMs 综述(统一架构分类学三个正交轴)未单独作为「memory 研究碎片化 → 统一框架」入位;LMCache 2026 Q2 Roadmap(vLLM Omni KV Caching + SGLang MP Mode + Token dropping)未入位;vLLM FP8 KV-Cache 50% 显存节省公式推导未入位

  • 建议归入:§2.3 KV cache 14 件套(沿用 LMCache + 新增 Memory for LLMs 综述 + LMCache 2026 Q2 Roadmap + vLLM FP8 KV-Cache 公式推导 + Token dropping 方法)+ §2.10 系统栈(沿用 + 新增 LMCache 作为 KV cache 基础设施中间件立标);新增 C86 共识候选:"KV cache 基础设施中间件 = LMCache 2026 Q2 Roadmap 完整接入(vLLM Omni KV Caching + SGLang MP Mode + TRT-LLM KV Caching + Modular KV Caching + Token dropping 允许 vLLM 检索已丢弃 KV) + Memory for LLMs 综述统一架构分类学三个正交轴 + vLLM FP8 KV-Cache 50% 显存节省(Hopper H100/H200 公式推导)";新增 O164 试金石:"LMCache vLLM Omni KV Caching 在 SGLang MP Mode 下多处理模式的 latency 影响;Memory for LLMs 综述三正交轴对 LMCache/Modular MAX/llama.cpp 工程实现的覆盖度"

增量 4【推理引擎 §2.1 / 选型决策树 §2.13】Colibri 纯 C 744B MoE 25GB RAM + TGI 2026-03-21 进入维护模式 + vLLM AI Blog 2026-07-16 生产质量工程(★★ 必补)

  • 来源:inbox/jay/2026-07-31T1735-jay-briefing-inference-stack-vecdb-substack.md 第一/二节(TGI 维护模式 + Colibri)+ 第四节(vLLM FP8 KV-Cache)+ 第五节(LMCache Q2 Roadmap)+ inbox/jay/2026-07-31-engineering-e1prep.md 增量 6(jay 视角 vLLM 生产质量工程 + Spheron H100 Benchmark)+ inbox/jay/2026-07-31T1620-jay-csdn-sglang-bench-eval.md 条目 1/2/3(DGX Spark + SGLang vs vLLM 横向 + 2026 选型指南)+ inbox/jay/2026-07-31T1505-jay-five-category-briefing.md Backend 条目 5/6(DevOpsBeast workload-first + inferenceengineering.tech 对照表)+ inbox/jay/2026-07-31-ai-engineering-trending.md(GitHub Trending 7-31 验证 vLLM 事实标准)+ organized/knowledge/llm-infra.md §2.1 推理引擎 6 寡头 + vLLM v0.19.0/v0.25.1 + Kimi K3 主权开源 2.0 立标 + §2.13 选型决策树 2026 中期 + §2.7 vLLM K8s OOM runbook 已收

TGI(Text Generation Inference)2026-03-21 正式进入维护模式完整展开: - 官方原文:"TGI was HuggingFace's production serving engine, powering Hugging Chat and the Inference API. It introduced continuous batching and Flash Attention to a wide audience. But as of 2026, TGI is officially in maintenance mode." - 官方指引:只接受 minor bug fix PR;新部署推荐迁移至 vLLM 或 SGLang - 历史贡献:TGI 是 continuous batching + Flash Attention 的布道者(2023-2024 标配) - 工程意义:2023-2024 年 TGI 是标配推理引擎,现在工程选型窗口已关闭;还在生产中用 TGI 的团队需要尽快规划迁移路径(3-6 个月迁移计划至 vLLM) - 生态影响:6 框架选型决策树 2026 中期已收 TGI · 现需更新为 5 框架(vLLM/SGLang/TRT-LLM/llama.cpp/LMDeploy)

Colibri 纯 C inference engine · 744B MoE 25GB RAM 完整展开: - 来源:Analytics Vidhya「Top 10 Trending AI GitHub Repositories in July 2026」 - 核心技术:Streaming experts — 专家从磁盘按需流式加载,而非全部加载到内存 - 能力:能在 ~25GB RAM 的消费级机器上运行 GLM-5.2(744B 参数 MoE 模型) - 工程定位:面向本地 LLM 爱好者 + 不想依赖云基础设施的团队 - 与 llama.cpp GGUF 量化路线正交:Colibri 走 streaming experts(MoE);llama.cpp 走量化(密集模型) - 可信度备注:原文 repo 链接模糊,需进一步核验;若属实,这是 2026 年最有工程震撼力的事件之一

vLLM AI Blog 2026-07-16 · Keeping vLLM Production Quality 完整展开: - 2026 年 6 月数据: - 合并 1,918 commits 到 main(平均每天 64 个,与 PyTorch/Kubernetes 规模相当) - CI 耗用 1,300 万 job minutes,峰值 1,400 并发 runner - 发版节奏: - 采用两周一次的发版节奏(two-week cadence,自 2025 年 11 月起) - 分层发版策略:main 持续 → release 分支 → 每两周正式发布 - 500 commits 量级最适合 bisect 管理 feature 和回归追踪 - 工程成熟度:vLLM 工程规模已达 PyTorch/Kubernetes 量级 = LLM serving 事实标准的基础

Spheron H100 Benchmark 2026-03-23 Llama 3.3 70B FP8 完整展开: - 核心数据:

维度 vLLM SGLang TensorRT-LLM
吞吐量 ~120-160 req/s 在 prefix-heavy 工作负载下可达 3.1× vLLM 最高,但 setup 复杂
TTFT(Prefix-heavy) 基线 20-40% 降低 接近 SGLang
冷启动 中等 较快 最慢
峰值 VRAM 中等 中等 最优
工程成本 高(1-2 周 setup)
  • 结论:
  • Prefix-heavy 工作负载(RAG、多轮 agent、共享 system prompt)→ SGLang 领先,RadixAttention 缓存复用效果显著
  • Unique-prompt 批处理 → vLLM 和 SGLang 差距在 5% 以内
  • 最大 NVIDIA 性能 → TensorRT-LLM,但工程复杂度高(28 分钟编译)
  • 最宽模型支持 + 最简部署 → vLLM 是默认选择

DevOpsBeast workload-first 决策框架完整展开: - 决策框架(workload-first,非 engine-first): - Agent 工作负载(多步骤、共享上下文):SGLang 的 RadixAttention + constrained decoding 优势明显 - Chat/RAG 工作负载(独立请求):vLLM 更简单,ecosystem 更大 - 固定 Shape + H100:TensorRT-LLM 值得考虑(28 分钟编译换最高吞吐) - SGLang 在 2026 年成熟的点:structured output(constrained decoding 集成在 scheduler 级别)+ 多模型 serving + LoRA hot-swap - vLLM 仍是最多团队的默认:生态成熟、debug 工具完善、快速启动 - 5 分钟决策问题清单:① 请求是否共享上下文?② 需要 structured output?③ 模型多久更新一次?④ 在什么硬件上?

inferenceengineering.tech 对照表完整展开: - 最易生产部署:vLLM(pip install,一条 CLI,400+ 模型架构) - 最佳 MoE / 高并发:SGLang(RadixAttention + EP,DeepSeek-R1/V3 效果最好) - 最广硬件支持:vLLM(NVIDIA、AMD ROCm、Google TPU、Intel Gaudi、CPU fallback) - 最佳结构化输出吞吐:SGLang(constrained decoding 在 scheduler 级别集成) - 生产成熟度(2026):三者均为 production-grade;TRT-LLM 在 Baseten/scale 场景最多使用

  • 与活文档关系:§2.1 推理引擎 6 寡头 + vLLM v0.19.0/v0.25.1/MRV2 + Kimi K3 主权开源 2.0 立标 + §2.13 选型决策树 2026 中期已收;但 TGI 2026-03-21 进入维护模式(HF 官方引导迁移 vLLM/SGLang)未入位;Colibri 纯 C 744B MoE 25GB RAM 未入位;vLLM AI Blog 2026-07-16 生产质量工程(1,918 commits/月 + 1,300 万 job minutes + 两周一次发版节奏)未入位;vLLM/SGLang 选型决策树 v3.0 多源交叉(Spheron + DevOpsBeast + inferenceengineering.tech + TGI 维护)未入位

  • 建议归入:§2.1 推理引擎 6 寡头(沿用 + 新增 TGI 进入维护模式 · 6 框架→5 框架决策树 · Colibri 纯 C 744B MoE 25GB RAM)+ §2.13 选型决策树(升级为 v3.0 多源交叉:Spheron H100 + DevOpsBeast workload-first + inferenceengineering.tech 对照表 + TGI 维护模式)+ §2.7 vLLM K8s OOM runbook(沿用 + 新增 vLLM AI Blog 2026-07-16 生产质量工程 1,918 commits/月 + 1,300 万 job minutes + 两周一次发版节奏);新增 C87 共识候选:"2026 推理引擎选型决策树 v3.0 = TGI 2026-03-21 进入维护模式(6→5 框架)+ Spheron H100 基准(vLLM 120-160 req/s / SGLang prefix-heavy 3.1× / TensorRT-LLM 最高吞吐但 28min 编译)+ DevOpsBeast workload-first 决策框架(Agent 选 SGLang / Chat-RAG 选 vLLM / 固定 Shape + H100 选 TRT-LLM)+ inferenceengineering.tech 对照表(vLLM 最易部署 / SGLang 最佳 MoE 高并发 / vLLM 最广硬件 / SGLang 最佳结构化输出)+ Colibri 纯 C 744B MoE 25GB RAM 边缘 + vLLM AI Blog 2026-07-16 生产质量工程(1,918 commits/月 + 1,300 万 job minutes + 两周发版节奏)";新增 O165 试金石:"Colibri 真实 GitHub repo 与 25GB RAM 744B MoE 复现路径;TGI 维护模式后 HF Inference API 是否迁移至 vLLM 后端;vLLM CI 1,300 万 job minutes 质量门禁通过率是否公开"

增量 5【paper_cards 主分类 llm-infra / 训练-推理协同 §2.6】paper_cards 主分类 llm-infra 新增 2 张 = 673 CADENCE + 681 Lossy Verification in Speculative Decoding(★★ 必补)

  • 来源:paper_cards/673-2607-16955.md 主分类 llm-infra 形态 method(HF Daily 4★ · tom 7-31 radar #5 追踪 · 7-31 15:00 已建卡)+ paper_cards/681-2607-26627.md 主分类 llm-infra 形态 method(tom 7-31 radar #8 · HF 7-31 推 · 7-31 16:30 已建卡)+ organized/knowledge/llm-infra.md §2.1 推理引擎 6 寡头 + vLLM/SGLang 推理 + SpecDec arXiv:2605.15051 5.08× 已收;§2.3 KV cache 14 件套 + Self-Speculative Forking arXiv:2607.03333 + SpecGen arXiv:2606.17518 已收

arXiv:2607.16955 CADENCE · Coverage-Adaptive On-Policy Distillation 完整展开: - 类型:on-policy knowledge distillation from large teacher to compact student - 三大失效模式: 1. cold-start collapse:fresh student assigns near-zero mass to teacher-preferred tokens 2. state-agnostic divergence scheduling:time-only forward/reverse-KL interpolation ignores student's coverage state 3. binary reward sparsity:pass/fail signals discard information from partially correct traces - CADENCE 方案:统一框架,对每种问题提供针对性修复;DRIFT 机制 schedules per-token forward/reverse-KL 凸混合 - HF Daily 4★ - 与已有 arXiv:2607.25659 CoRT(75▲ HF Daily 7-31 #5 · token-level rubric-guided GRPO)同源:都属"RL 训练-推理一体化"的 credit assignment 精细化 - 主分类:llm-infra(RL 训练-推理协同第二维 · 训练侧与推理侧耦合) - 意义:CADENCE + CoRT + Self-Speculative Forking + SpecGen = RL 训练-推理协同 2026 H2 4 件套立标

arXiv:2607.26627 Revisiting Lossy Verification in Speculative Decoding 完整展开: - 核心问题:Speculative Decoding(SD)通过让轻量级 draft model 提出 tokens,再由更大的 target model 并行验证来加速 LLM inference;最近的方法引入 lossy verification schemes(有损验证方案)以通过放宽严格分布匹配来进一步提高效率;但这种放宽悄悄重写了 decoding distribution,可能以不稳定、有时严重下降的生成质量为代价换来加速 - 本文贡献:principled analysis of the distributions induced by lossy verification mechanisms;形式化分析 lossy verification 引入的分布 - trade-off 谱:加速效率 vs 生成质量稳定性 - failure modes:分布重写导致的失效模式 - 意义:Speculative Decoding lossy verification 立标 = 推理加速算法的理论安全边界;与 arXiv:2605.15051 SpecDec 5.08×、Self-Speculative Forking arXiv:2607.03333、SpecGen arXiv:2606.17518 共同构成「SpecDec 2026 H2 理论 + 工程 4 件套」 - HF 7-31 推(HF Daily 推过但未进前 15) - 主分类:llm-infra(推理加速算法 · speculative decoding 立标) - 与 arXiv:2607.19712 RLHF C++ paper_cards/657 形成「RLHF 训练-推理协同 + SpecDec 推理加速算法」双立标(均为 paper_cards 主分类 llm-infra)

  • 与活文档关系:§2.1 推理引擎 6 寡头 + vLLM/SGLang 推理 + SpecDec arXiv:2605.15051 5.08× 已收;§2.3 KV cache 14 件套 + Self-Speculative Forking arXiv:2607.03333 + SpecGen arXiv:2606.17518 已收;但 paper_cards 主分类 llm-infra 7-31 新增 2 张(673 CADENCE + 681 Lossy Verification)未单独作为「RL 训练-推理协同 + SpecDec 推理加速算法 双立标」入位

  • 建议归入:§2.1 推理引擎(沿用 + 新增 arXiv:2607.26627 Lossy Verification in Speculative Decoding 作为 SpecDec 推理加速算法立标)+ §2.6 训练-推理协同(新增 arXiv:2607.16955 CADENCE + 沿用 arXiv:2607.25659 CoRT + arXiv:2607.19712 RLHF C++ 形成「RL 训练-推理协同 + SpecDec 推理加速算法 2026 H2 4 件套立标」);新增 C88 共识候选:"paper_cards 主分类 llm-infra 7-31 新增 2 张 = 673 CADENCE arXiv:2607.16955(HF Daily 4★ · DRIFT per-token KL 凸混合 · 三大失效模式针对性修复) + 681 Lossy Verification in Speculative Decoding arXiv:2607.26627(HF 7-31 推 · 形式化分布分析 · trade-off 谱) = RL 训练-推理协同 + SpecDec 推理加速算法 2026 H2 4 件套立标";新增 O166 试金石:"CADENCE DRIFT 在 Kimi K3 2.8T MoE + DeepSeek V4 1.6T 蒸馏实测;Lossy Verification 在 vLLM/SGLang SpecDec 实现中的 acceptance rate 损失边界"

增量 6【Harness Engineering §2.4 / Protocol 协议栈 §2.7】MCP 2026-07-28 协议栈无状态化 + A2A Linux Foundation 150+ 组织(★★ 必补)

  • 来源:inbox/jay/2026-07-31T1105-jay-five-category-briefing.md Cloud-Native 条目 9/10(MCP 2026-07-28 + A2A Linux Foundation 150+)+ inbox/jay/2026-07-31-engineering-e1prep.md 增量 8(jay 视角工程化展开)+ inbox/jay/2026-07-31-agent-e1prep.md(已立 MCP 2026-07-28 P0 警示·详尽展开)+ organized/knowledge/llm-infra.md §2.4 Harness Engineering Phase 3 + Microsoft Agent Framework 1.0 + MCP 2026-07-28 RC 6 件 + §2.5 服务层并发安全 + Fail-Plausible 五类 + OWASP Agent ASI01-ASI10 已收

MCP 2026-07-28 协议栈无状态化完整展开(沿用 jay agent-e1prep §增量 8 详细展开): - 核心变化:MCP 从双向有状态协议变为请求/响应无状态协议;远程传输不再需要 initialize handshake 和 session;每个请求自带所有需要的信息,server instance 可以 horizontal scaling 和 serverless 部署 - MRTR(Multi Round-Trip Requests, SEP-2322):无状态协议下工具仍可向用户请求确认/缺失参数(elicitation) - Header-based routing(SEP-2243):Streamable HTTP 请求必须包含 Mcp-MethodMcp-Name;网关/WAF 可直接路由和计量而无需解析 JSON body - List results 可缓存:list_* 结果可被 gateway 缓存 - Authorization 强化:OAuth 流程更新;EMA 从 extension 升级为正式地位 - 正式 Extensions 框架:spec 演进通过 extensions 实现而非大版本号 - 正式弃用生命周期:至少 12 个月兼容 - Deprecated(移除!):Roots(文件系统边界通告)/ Sampling / Logging - SDK 规模:Tier 1 SDK(TypeScript/Python)累计下载量突破 10 亿次;每月近 5 亿次下载 - 距离规范发布 3 天(2026-07-31 距离 2026-07-28)= 仍在迁移窗口 - 破坏性变更警告:Stacklok 警告 2026-07-28 服务器可能不兼容旧版 client

A2A 协议 2026 年 7 月生产采用里程碑完整展开: - 规模:A2A 协议获得 150+ 组织支持,Linux Foundation 治理 - 生态:Google / Microsoft / AWS 三大云平台深度集成 - 生产落地:多个行业已有实际生产部署(first year milestone) - 生产模式:A2A 协调 Agent 间通信 + MCP 连接 Agent 与工具 = 2026 年最合理的双协议栈组合 - 常见错误:用 A2A 替代 MCP 解决工具访问,或用 MCP 处理多 Agent 协调(职责错配)

  • 与活文档关系:§2.4 Harness Engineering Phase 3 + MAF 1.0 + MCP 2026-07-28 RC 6 件 + Microsoft Agent Framework 1.0 已收;但 MCP 2026-07-28 协议栈无状态化(从双向有状态 → 请求/响应无状态 + MRTR + Header-based routing + EMA 正式地位 + Roots/Sampling/Logging 弃用)未单独作为「MCP 协议栈 2026 年最大更新」入位;A2A Linux Foundation 150+ 组织 + 生产落地里程碑未单独作为「MCP+A2A 双协议栈 2026 H1 工程共识」入位

  • 建议归入:§2.4 Harness Engineering Phase 3(沿用 MAF 1.0 + 新增 MCP 2026-07-28 协议栈无状态化 MRTR + Header-based routing + EMA 正式地位 + Roots/Sampling/Logging 弃用 + SDK 10 亿次下载)+ §2.7 服务层并发安全(沿用 + 新增 A2A Linux Foundation 150+ 组织 + MCP+A2A 双协议栈 2026 H1 工程共识);新增 C89 共识候选:"MCP 2026-07-28 协议栈无状态化 = MCP 从双向有状态 → 请求/响应无状态 + MRTR(SEP-2322) + Header-based routing(SEP-2243) + EMA 正式地位 + Extensions 独立版本管理 + Roots/Sampling/Logging 弃用 + SDK 10 亿次下载 = MCP 协议栈 2026 年最大更新;MCP+A2A 双协议栈 2026 H1 = A2A(Linux Foundation 150+ 组织 · 多 Agent 通信)+ MCP(无状态协议 · Agent 与工具连接)";新增 O167 试金石:"MCP 2026-07-28 无状态化在 vLLM/SGLang tool parser 的兼容性;MRTR elicitation 在 enterprise 工具调用的实际部署;Stacklok 警告破坏性变更的兼容窗口"

增量 7【Kernel §2.4 / Harness for Kernel】CADENCE DRIFT per-token forward/reverse KL 凸混合(★★ 必补)

  • 来源:paper_cards/673-2607-16955.md 主分类 llm-infra + HF Daily 4★ + organized/knowledge/llm-infra.md §2.4 Kernel/AI 自动化 + Harness Engineering for Kernel arXiv:2607.17979 MLSys 2026 FlashInfer Contest + Fable 18.71× + Late Chunking + eBPF 已收

arXiv:2607.16955 CADENCE 完整展开(沿用增量 5 内容,本增量强调训练-推理协同维度): - DRIFT 机制 schedules per-token forward/reverse-KL 凸混合 · 针对 on-policy knowledge distillation 三大失效模式 - 意义:RLHF 训练-推理协同第二维(与 arXiv:2607.19712 RLHF C++ + arXiv:2607.25659 CoRT token-level rubric-guided GRPO 共同构成 2026 H2 RL 训练-推理协同 4 件套) - 与 Kernel/Harness 维度:DRIFT 凸混合 = 用 on-policy 蒸馏实现"算法层 kernel"训练-推理协同;与 Harness Engineering for Kernel arXiv:2607.17979 同属"AI 自动化生成算法"方向

  • 与活文档关系:§2.4 Kernel/AI 自动化 + Harness Engineering for Kernel + Fable 18.71× 已收;但 CADENCE arXiv:2607.16955 DRIFT per-token KL 凸混合(RL 训练-推理协同 kernel)未单独作为「AI 自动化生成算法」入位

  • 建议归入:§2.4 Kernel/AI 自动化(沿用 + 新增 CADENCE DRIFT 作为 RL 训练-推理协同 kernel);新增 C90 共识候选:"AI 自动化生成算法 2026 H2 = Harness Engineering for Kernel arXiv:2607.17979 MLSys 2026 FlashInfer Contest + CADENCE arXiv:2607.16955 DRIFT per-token KL 凸混合 + CoRT arXiv:2607.25659 token-level rubric-guided GRPO + RLHF C++ arXiv:2607.19712 = 算法层 kernel 自动生成 + RL 训练-推理协同 kernel 4 件套";新增 O168 试金石:"CADENCE DRIFT 在 Muon/MoE 蒸馏的实际吞吐;CoRT per-token KL 凸混合与 GRPO full-token KL 的 quality 边界"


二、旁证(3 条)

旁证 1【KV cache 存储分离 §2.10】CXL-PIM KV Cache Server HotInfra '26(Mooncake 后继)(★★)

  • 来源:inbox/jay/2026-07-31T1105-jay-five-category-briefing.md Reproduction 条目 1(Mooncake 后继 · CXL-PIM KV Cache Server)+ inbox/jay/2026-07-31-engineering-e1prep.md 增量 5(jay 视角 CXL-PIM + PipeMax 完整展开)+ organized/knowledge/llm-infra.md §2.10 ASPLOS 2026 CXL KV Cache Server HotInfra'26 final59(Uchicago/Purdue Kiyawat+Skadron)已收 · §2.6 Cloud-Native llm-d 已收

CXL-PIM KV Cache Server HotInfra '26 完整展开(2026-06-28 ISCA '26 联合工作坊): - 论文:hotinfra.org/2026/papers/hotinfra26-final59.pdf - 对比:GPU cluster vs CXL-PIM KV cache server(分离式架构) - 关键数据(DeepSeek-R1-671B, 32K tokens 生成): - PIM 方案比 H100 集群吞吐高 2.4× - CapEx 降低 20.6× - OpEx 降低 16.8× - Cost/Mtokens 降低 39.7× - Tokens/Watt:H100 集群 0.051 vs PIM 方案 1.507(29.5× 提升) - 核心洞察:推理成本主要来自 KV cache 存储,而非计算 = 经济学实证 - 意义:与 Mooncake Store 官方 3.8×/46×/8.6× 互补 = Moonshot AI KV cache 分离架构经济学证据双源

  • 建议归入:§2.10 系统栈 ASPLOS 2026 CXL KV Cache Server(沿用 + 强化 HotInfra '26 Mooncake 后继 DeepSeek-R1-671B 32K tokens 数据 2.4× 吞吐 + 39.7× Cost/Mtokens 降低 + 29.5× Tokens/Watt);新增 O169 试金石:"CXL-PIM 方案的 latency SLA 是否满足交互式应用需求(2.4× 吞吐提升 vs latency 影响)"

旁证 2【KV cache 存储分离 §2.10】PipeMax Pipeline Parallelism + KV Cache Offloading arXiv:2605.02189v1(★★)

  • 来源:inbox/jay/2026-07-31T1105-jay-five-category-briefing.md Reproduction 条目 13(PipeMax)+ inbox/jay/2026-07-31-engineering-e1prep.md 增量 5(jay 视角 PipeMax 完整展开)+ organized/knowledge/llm-infra.md §2.2 Disagg 5 节点 + HaoaiLab DistServe + Nexus intra-GPU + PPD Append-Prefill + SPAD 已收

PipeMax arXiv:2605.02189v1 完整展开: - 场景:commodity GPU server(8 GPUs)上的高吞吐 LLM inference - 方案:将 inactive KV cache offload 到 CPU,结合 pipeline parallelism - 技术创新:计算与 offloading 数据传输协同调度,最大化 compute-data overlap - 结果:相比 SOTA 提升最高 2.51×(8 GPUs) - 意义:面向中等规模 GPU 集群的实用方案 = 与 Mooncake 的 rack-scale 方案互补

  • 建议归入:§2.2 Disagg 5 节点(沿用 + 新增 PipeMax commodity GPU 8 GPUs pipeline parallelism + KV cache offloading 2.51× 提升);新增 O170 试金石:"PipeMax 8 GPUs 在 16/32 GPUs 集群的扩展性"

旁证 3【Routing / 分布式推理 §2.2 / §2.6】LAAR Long-Context-Aware 分布式 LLM 路由 arXiv:2604.15732v1(★★)

  • 来源:inbox/jay/2026-07-31T1505-jay-five-category-briefing.md Database 条目 3(LAAR 完整展开)+ organized/knowledge/llm-infra.md §2.6 Cloud-Native llm-d 已收 · §2.2 调度 9 学派已收

LAAR arXiv:2604.15732v1 完整展开(已详述于增量 2,本旁证强调 routing 工程化): - 实现:Envoy Endpoint Picker(EPP)policy;external processing filter 注入 - 集成:调用 llm-d 的 MaxScorePicker - 意义:与 MC-SF 形成"理论 + 工程"双立标;LAAR 是 MC-SF 理论在 llm-d 生态的工程化实现 - 与 §2.6 Cloud-Native llm-d v0.7 路由特性对照:llm-d 自身有 KV-cache-aware LoRA 路由 + active-active HA;LAAR 在 Envoy EPP 层加 Long-Context-Aware cost 函数

  • 建议归入:§2.6 Cloud-Native(沿用 llm-d + 新增 LAAR arXiv:2604.15732v1 Envoy EPP policy + llm-d MaxScorePicker 集成);新增 O171 试金石:"LAAR 在 llm-d v0.7+ 的实际部署路径;LAAR cost 函数与 vLLM/SGLang prefix sharing 的交互"

三、警示(1 条)

警示 1【推理引擎 §2.1 / 主题接力 §0】⚠️ Tom inference E1 连续 5 日缺失延续第 6 日 + spark 7-31 morning 节奏反转后第 7 棒静默期(本棒恢复)

  • 来源:inbox/tom/2026-07-31-* 7 件(1440-agent-rag-longcontext-radar 7-30 evening + 2040-agent-rag-longcontext-radar 7-30 evening 补充版 + 0840-agent-rag-longcontext-radar 7-31 + 0852-rag-e1prep 7-31 + 0900-hf-daily-2026-07-31 + 1005 RSS yt-lex-fridman + 1005 RSS yt-yannic-kilcher + 1541-evaluation-e1prep)· 无独立 inference-e1prep + inbox/spark/2026-07-31-* 4 件(1337 agent-e1prep-v57 + 1339 llm-infra-e1prep-v11 + 3 RSS 通稿)· 无 morning 独立 engineering/llm-infra E1 · 本棒 llm-infra-e1prep-v12 恢复 spark E1 产出
  • 警示内容:
  • Tom inference 主题 E1 7-27/7-28/7-29/7-30/7-31 连续 5 日缺失 = 7-29 evening 单棒恢复 + 7-30 再次缺失后延续 7-31 = 连续 5 日缺失信号延续第 6 日(继 7-27 4 主线 → 7-28 0 件 → 7-29 单棒 → 7-30 0 件 → 7-31 0 件 = 信号流失累计 6 日)
  • Spark 7-31 morning 节奏反转后第 7 棒静默期(继 7-30 morning 第 6 棒静默 → 7-30 evening 第 11 棒 llm-infra-e1prep-v11 恢复 → 7-31 morning 再次静默 = 节奏反转后第 7 棒静默期)
  • Stability of spoken 接力:stephen 7-31 1245 coordination-check-noon 强提醒 spark 7-31 evening 棒必须确认恢复
  • 风险:
  • tom inference 主题信号密度连续 6 日衰减:7-27 4 主线 → 7-28 0 件 → 7-29 单棒恢复 → 7-30 0 件 → 7-31 0 件 = 信号流失累计
  • spark llm-infra 主题:7-27 evening → 7-28 evening → 7-29 evening(双 E1)→ 7-30 morning 静默 → 7-30 evening 恢复 → 7-31 morning 静默 → 7-31 evening 本棒恢复 = 节奏反转后第 7 棒静默期判断
  • 建议行动:
  • 本棒 llm-infra-e1prep-v12 补全 7 主线 + 3 旁证 + 1 警示(SIGMOD 三件套 + MC-SF/LAAR + Memory for LLMs 综述 + LMCache Q2 Roadmap + Colibri/TGI 维护 + paper_cards 2 张主 llm-infra + MCP 2026-07-28 + CADENCE) = spark E1 节奏回归
  • 待 tom inference E1 7-31 evening 或 8-1 morning 恢复时核对信号丢失条目;spark 7-31 evening 棒继续稳定产出 llm-infra E1 第 13 棒

四、值得警惕的矛盾或待核实说法

# 矛盾/待核实项 来源 风险级别 建议行动
1 TGI 2026-03-21 进入维护模式后 HF Inference API 是否迁移至 vLLM 后端 jay 1735 briefing 第一/二节 🟡 待核实 HF 官方文档 + HF Blog 2026-07 沿用观察
2 Colibri 真实 GitHub repo 与 25GB RAM 744B MoE 复现路径(原文 repo 链接 github.com/pricing/Colibri 模糊) jay 1735 briefing 第二节 🟡 待核实 追踪 Analytics Vidhya 原文 + GitHub 搜索 "Colibri LLM inference C streaming experts"
3 LMCache 2026 Q2 Roadmap 中 vLLM Omni KV Caching + SGLang MP Mode 的实际部署 SLA jay 1735 briefing 第五节 🟡 待核实 LMCache GitHub Issues/2923 + 测试报告
4 MCP 2026-07-28 协议栈无状态化在 vLLM/SGLang tool parser 的兼容性(MRTR elicitation) jay 1105 briefing Cloud-Native C3 + stephen ai-industry 增量 🟡 待核实 vLLM/SGLang GitHub 跟踪 issue + Stacklok 警告细节
5 MC-SF arXiv:2502.07115v5 的 v5 与 v4 差异(持续更新中) jay 1105 briefing Reproduction 条目 14 🟢 已发版 5 次 查 v5 vs v4 changelog
6 Memory for LLMs 综述 arXiv:2607.25380 三个正交轴对 LMCache/Modular MAX/llama.cpp 工程实现的覆盖度 tom radar #3 + jay engineering-v40 增量 2 🟡 待核实 综述 §5-§6 表格对照
7 CADENCE DRIFT arXiv:2607.16955 在 Kimi K3 2.8T MoE + DeepSeek V4 1.6T 蒸馏实测 paper_cards/673 🟡 待核实 MoonshotAI + DeepSeek 官方 RLHF 流水线对照
8 Lossy Verification arXiv:2607.26627 在 vLLM/SGLang SpecDec 实现中的 acceptance rate 损失边界 paper_cards/681 🟡 待核实 vLLM/SGLang SpecDec 仓库代码 + 论文 §4 实验
9 CXL-PIM KV Cache 方案的 latency SLA 是否满足交互式应用需求(2.4× 吞吐提升 vs latency 影响) jay 1105 briefing Reproduction 条目 1 + jay engineering-v40 增量 5 🟡 待核实 HotInfra '26 论文 §4/§5 latency breakdown
10 SIGMOD 2026 三件套(CoDec/AlignedServe/HotPrefix)与 SGLang RadixAttention / vLLM PagedAttention 的实现路径对照 jay 1105 briefing Reproduction 条目 11/12/13 🟡 待核实 SIGMOD 2026 论文配套代码库 + vLLM/SGLang GitHub issues
11 LAAR Envoy EPP policy 在 llm-d v0.7+ 的实际部署路径 jay 1505 briefing Database 条目 3 🟡 待核实 llm-d GitHub issue + Envoy EPP 实现细节
12 vLLM AI Blog 2026-07-16 1,300 万 CI job minutes 质量门禁通过率是否公开 jay 1105 briefing Backend 条目 6 🟢 信息密度低 vLLM 官方 GitHub Insights + bisect 报告

五、本次涉及 arXiv 号列表

arXiv 号 论文/主题 增量归属 建议归位节
2502.07115v5 MC-SF Online Scheduling for LLM Inference with KV Cache Constraints(MIT+MSR+Amazon) 增量 2 §2.2 调度 / §2.6 Cloud-Native
2604.15732v1 LAAR Long-Context-Aware 分布式 LLM 路由(Envoy EPP + llm-d MaxScorePicker) 增量 2 + 旁证 3 §2.2 调度 / §2.6 Cloud-Native
2605.02189v1 PipeMax Pipeline Parallelism + KV Cache Offloading(commodity GPU 8 GPUs 2.51×) 旁证 2 §2.2 Disagg 5 节点
2607.16955 CADENCE · Coverage-Adaptive On-Policy Distillation(DRIFT per-token KL 凸混合 · HF Daily 4★ · paper_cards/673 主分类 llm-infra 7-31 15:00 建卡) 增量 5 + 增量 7 §2.1 推理引擎 / §2.4 Kernel / §2.6 训练-推理协同
2607.25380 Memory for Large Language Models 综述(三个正交轴:表征隐式 vs 显式 + 更新策略 + 可扩展查找存储 · paper_cards/668 主分类 llm-infra) 增量 3 §2.3 KV cache
2607.26627 Revisiting Lossy Verification in Speculative Decoding(principled distribution analysis · HF 7-31 推 · paper_cards/681 主分类 llm-infra 7-31 16:30 建卡) 增量 5 §2.1 推理引擎 / §2.6 训练-推理协同
2607.19712 RLHF C++ vs PyTorch Inference Runtimes(ONNX Runtime C++ engine · paper_cards/657 主分类 llm-infra 7-29 evening 立基础) 沿用 7-30 evening 旁证 1 §2.1 推理引擎 / §1.6 Harness Engineering
2504.19874 TurboQuant ICLR 2026 arXiv(沿用 7-29 evening §VII) 横向参照 §2.3 KV cache / §1.9 量化
2510.09665 LMCache 跨引擎 KV 缓存 crash-safe(沿用 §VII) 横向参照 §2.3 KV cache
2607.18141 HyMCache CXL 三层 KV cache(沿用 §VII) 横向参照 §2.3 KV cache
2605.01280 MathOpt Chen et al. 2026 Ω(√(B log G))(沿用 §VII) 横向参照 §2.2 调度
2607.17979 Harness Engineering for Kernel MLSys 2026 FlashInfer Contest(沿用 §VII) 横向参照 §2.4 Kernel
2607.22529 Skill Self-Play(沿用 §VII) 横向参照 §1.6 Agent 自改进
2607.21557 OpenForgeRL Harness(沿用 §VII) 横向参照 §1.5 Harness Engineering

说明:7-31 新增 2 张主分类 llm-infra paper_cards = arXiv:2607.16955(CADENCE · 增量 5 + 增量 7)+ arXiv:2607.26627(Lossy Verification · 增量 5)· 沿用 2 张主分类 llm-infra paper_cards = arXiv:2607.19712(RLHF C++ · 7-30 evening 旁证 1)+ arXiv:2607.25380(Memory for LLMs · 增量 3)· 主分类 llm-infra 近 3 天新卡 4 张


六、已检查来源清单

以下来源经本次扫描确认无 llm-infra 主增或已在上方增量中覆盖,避免重复检索:

inbox/jay(7-30 evening → 7-31 18:40 共 16 件,全部已读): - ✅ 2026-07-31T1105-jay-five-category-briefing.md → 五大类目补编 #16 17.5KB(已纳入增量 1 SIGMOD 三件套 + 增量 2 MC-SF + 增量 3 LMCache + 增量 6 MCP 2026-07-28) - ✅ 2026-07-31T1335-jay-engineering-filter.md → 工程筛选报告(无 llm-infra 主增) - ✅ 2026-07-31-ai-engineering-trending.md → GitHub Trending vLLM 事实标准(已纳入增量 4 选型决策树) - ✅ 2026-07-31-engineering-database-backend-cloudnative.md → 数据库/Cloud-Native(无 llm-infra 主增) - ✅ 2026-07-31-csdn-weekly.md → CSDN vLLM 部署 + DeepSeek-R1 微调 + RAG 进阶(无 llm-infra 主增) - ✅ 2026-07-31T1505-jay-five-category-briefing.md → 五大类目补编 #15 19.2KB(已纳入增量 2 LAAR + 旁证 3 LAAR 工程化) - ✅ 2026-07-31T1620-jay-csdn-sglang-bench-eval.md → DGX Spark + SGLang/vLLM 横向 + 选型指南(已纳入增量 4 vLLM 选型决策树 v3.0) - ✅ 2026-07-31T1735-jay-briefing-inference-stack-vecdb-substack.md → TGI 维护 + Colibri + vLLM FP8 KV + LMCache Q2 Roadmap(已纳入增量 3 + 增量 4 + 旁证 1) - ✅ 2026-07-31-engineering-e1prep.md → engineering-v40 准备棒 43.5KB(已纳入增量 1 SIGMOD 三件套 + 增量 2 MC-SF + 增量 3 LMCache + 增量 4 vLLM 生产质量 + 旁证 1 CXL-PIM + 旁证 2 PipeMax + 增量 6 MCP 2026-07-28) - ✅ 2026-07-31-csdn-substack-ai-research.md → CSDN vLLM 推理优化 + RAG 下一代 + Agent 上下文工程(无 llm-infra 主增) - ✅ 2026-07-31-1140-news-x-tech-radar.md → X 硬核干货雷达(无 llm-infra 主增) - ✅ 2026-07-31-1000/1002/1003 RSS → 7 RSS 通稿(无 llm-infra 主增) - ✅ 2026-07-31-1005/1006 RSS yt-karpathy/yt-fireship → 2 RSS YT 通稿(无 llm-infra 主增)

inbox/tom(7-30 evening → 7-31 共 7 件,全部已读): - ✅ 2026-07-30T1440-agent-rag-longcontext-radar.md → 4 件 P0(已纳入 ai-industry/RAG/agent 主题) - ✅ 2026-07-30T2040-agent-rag-longcontext-radar.md → 补充版(已纳入 ai-industry 主题) - ✅ 2026-07-31-0840-agent-rag-longcontext-radar.md → 8 件候选 3 P0 高价值(已纳入增量 3 Memory for LLMs 综述 + 增量 5 CADENCE + 增量 7 CADENCE) - ✅ 2026-07-31-0852-rag-e1prep.md → RAG E1(已纳入 RAG 主题) - ✅ 2026-07-31-0900-hf-daily-2026-07-31.md → HF Daily 7-31 票榜 15 件(已纳入 ai-industry/multimodal 主题) - ✅ 2026-07-31-1005-rss-yt-lex-fridman.md → RSS 通稿(无 llm-infra 主增) - ✅ 2026-07-31-1005-rss-yt-yannic-kilcher.md → RSS 通稿(无 llm-infra 主增) - ✅ 2026-07-31-1541-evaluation-e1prep.md → evaluation E1(已纳入 evaluation 主题) - ⚠️ tom 7-31 inference E1 连续 5 日缺失延续第 6 日(警示 1)

inbox/flyp(7-30 evening → 7-31 共 8 件,全部已读): - ✅ 2026-07-30-risk-e1prep.md → risk 主题 - ✅ 2026-07-31-0950-SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read.md → 跨任务技能 vs 原生记忆双线(已纳入 ai-industry/agent 主题 · 增量 3 Memory for LLMs 综述沿用其上下文) - ✅ 2026-07-31-multimodal-e1prep.md → multimodal-e1prep v34 第四棒(已纳入 multimodal 主题) - ✅ 2026-07-31-risk-e1prep.md → risk 主题 - ✅ 2026-07-31-1550-VisualPatchWorld-code-world-model-as-third-paradigm-critical-read.md → multimodal 主题 - ✅ 2026-07-31-1000/1002/1005 RSS → 4 RSS 通稿(无 llm-infra 主增) - flyp 7-30 evening → 7-31 0 件 llm-infra 主线产出(multimodal + risk 双轨主导)

inbox/spark(7-30 evening → 7-31 共 4 件,全部已读): - ✅ 2026-07-30-1337-agent-e1prep.md → Agent E1(已纳入 agent 主题) - ✅ 2026-07-30-1339-llm-infra-e1prep.md → 7-30 evening E1 v11(已纳入 7-30 evening 增量 1-6 + 3 旁证 + 1 警示) - ✅ 2026-07-31-1001-rss-gradient-flow.md → RSS 通稿(无 llm-infra 主增) - ✅ 2026-07-31-1002-rss-chip-huyen.md → RSS 通稿(无 llm-infra 主增) - ✅ 2026-07-31-1005-rss-yt-3blue1brown.md → RSS 通稿(无 llm-infra 主增) - ✅ 2026-07-31-1337-agent-e1prep.md → Agent E1 7-31 13:30(已纳入 agent 主题) - ⚠️ spark 7-31 morning 节奏反转后第 7 棒静默期(本棒恢复 llm-infra-e1prep-v12)

inbox/stephen(7-30 evening → 7-31 共 13 件,全部已读): - ✅ 2026-07-30-1245-stephen-coordination-check-noon.md → 协调棒(已纳入 ai-industry 主题) - ✅ 2026-07-30-2245-stephen-coordination-check-evening.md → 协调棒(已纳入 ai-industry 主题) - ✅ 2026-07-30-1026-ai-industry-e1prep.md → v32 准备棒(已纳入 ai-industry 主题) - ✅ 2026-07-30-ai-industry-e1prep.md → ai-industry 主题 - ✅ 2026-07-30-llm-application-e1prep.md → llm-application 主题 - ✅ 2026-07-31-0910-news-x-vip-radar.md → X VIP radar 8.7KB(已纳入增量 4 OpenAI GPT-5.6 Sol GPU kernel 自优化 + speculative decoding 提速 15%+) - ✅ 2026-07-31-1003-news-anthropic-news/deepmind-news/openai-news → 9 frontier lab news 通稿(已纳入 ai-industry 主题) - ✅ 2026-07-31-1004-news-bens-bites/google-ai/hf-blog/tldr-ai → 9 frontier lab news 通稿(已纳入 ai-industry 主题) - ✅ 2026-07-31-1006-news-yt-anthropic/deepmind/openai → 9 frontier lab news 通稿(已纳入 ai-industry 主题) - ✅ 2026-07-31-1031-ai-industry-e1prep-v33.md → v33 准备棒(已纳入 ai-industry 主题 + 增量 6 MCP 2026-07-28) - ✅ 2026-07-31-1245-stephen-coordination-check-noon.md → 协调棒 noon(已纳入 llm-infra 警示 1)

paper_cards(7-30 evening → 7-31 18:40 新卡 IDs 666-681 共 16 张,全部已读): - ✅ 主分类 llm-infra 新增 2 张 = 673 arXiv:2607.16955 CADENCE(增量 5 + 增量 7)+ 681 arXiv:2607.26627 Lossy Verification in Speculative Decoding(增量 5) · 7-31 15:00 + 16:30 建卡 - ✅ 主分类 llm-infra 沿用 2 张 = 657 arXiv:2607.19712 RLHF C++ + 668 arXiv:2607.25380 Memory for LLMs 综述(668 已纳入增量 3) - ✅ 副分类 llm-infra 0 张新卡 - ✅ 邻接 llm-infra 主分类 engineering 0 张新卡 - ✅ 邻接 agent 主分类 9 张新卡 = 654 HANDBOOK.md / 656 Agent Retrieval Bench / 658 Metis / 659 SkillRise / 662 CAST / 664 StealthBench / 665 Grading Narrators / 666 Graph-Native Bitemporal / 667 KAMR(已纳入 ai-industry/agent/rag 主题) - ✅ 主分类 rag 4 张新卡 = 674 DualG-MRAG / 675 GLM-RAG / 676 ConMem / 677 OptGraph(已纳入 RAG 主题) - ✅ 主分类 multimodal 2 张新卡 = 678 CoMem · Understanding Is Done Early / 680 LEDGERMIND(已纳入 multimodal 主题) - ✅ 主分类 evaluation 1 张新卡 = 679 Beyond Borrowed Histories(已纳入 evaluation 主题) - ✅ 主分类 engineering 1 张新卡 = 672 πR² Reactive Real-time Flow Policies(已纳入 engineering 主题) - ✅ 主分类 agent + multimodal 邻接 1 张新卡 = 671 Voice Memory arXiv:2607.26410(已纳入 ai-industry/agent 主题)


七、本次 E1 预消化结论

增量条数:7 主线 + 3 旁证 + 1 警示

结论:llm-infra 主题 7-30 18:40 → 7-31 18:40 约 24h 窗口为中密度,主因是 jay 7-31 全天 4 件 briefing(1105 五类目补编 + 1505 五类目补编 + 1620 CSDN SGLang bench + 1735 推理工程实战)共 70KB 饱和度极高,加上 paper_cards 主分类 llm-infra 新增 2 张(673 CADENCE + 681 Lossy Verification)信号恢复,加上 stephen ai-industry-v33 + 9 frontier lab news + X-VIP-radar 的 OpenAI GPT-5.6 Sol GPU kernel 自优化 + speculative decoding 提速 15%+ 增量,加上 LMCache 2026 Q2 Roadmap + TGI 进入维护模式 + Colibri 纯 C 744B MoE 等工程化亮点饱和 = 7 主线立标级增量。

核心动作: 1. SIGMOD 2026 LLM Serving 三件套(CoDec/AlignedServe/HotPrefix)入 §2.1 推理引擎 / §2.10 系统栈(2026 数据库顶会议 LLM inference systems track 集中爆发 + 与 SGLang RadixAttention / vLLM PagedAttention 实现路径对照) 2. MC-SF 在线调度 arXiv:2502.07115v5 + LAAR 路由 arXiv:2604.15732v1入 §2.2 调度(LLM serving 调度理论 2026 H2 两大理论突破 · ILP 最优基准 + Envoy EPP 在线路由 · 共同方法论:仅需输出长度上界预测) 3. Memory for LLMs 综述 arXiv:2607.25380 + LMCache 2026 Q2 Roadmap(vLLM Omni KV Caching + SGLang MP Mode + Token dropping)+ vLLM FP8 KV-Cache 50%入 §2.3 KV cache / §2.10 系统栈(KV cache 基础设施中间件立标 + 三正交轴统一架构分类学) 4. Colibri 纯 C 744B MoE 25GB RAM + TGI 2026-03-21 进入维护模式 + vLLM AI Blog 2026-07-16 生产质量工程(1,918 commits/月)+ Spheron H100 + DevOpsBeast workload-first + inferenceengineering.tech 对照表入 §2.1 推理引擎 / §2.13 选型决策树 v3.0 / §2.7 vLLM K8s(6→5 框架决策树 + 工程成熟度 PyTorch/Kubernetes 量级) 5. paper_cards 主分类 llm-infra 新增 2 张 = 673 CADENCE + 681 Lossy Verification入 §2.1 推理引擎 / §2.4 Kernel / §2.6 训练-推理协同(RL 训练-推理协同 + SpecDec 推理加速算法 2026 H2 4 件套立标) 6. MCP 2026-07-28 协议栈无状态化(MRTR + Header-based routing + EMA + Roots/Sampling/Logging 弃用 + SDK 10 亿次下载)+ A2A Linux Foundation 150+ 组织入 §2.4 Harness Engineering / §2.7 服务层并发安全(MCP+A2A 双协议栈 2026 H1 工程共识 + 距规范发布 3 天 = 仍在迁移窗口) 7. CADENCE DRIFT per-token KL 凸混合入 §2.4 Kernel/AI 自动化(AI 自动化生成算法 2026 H2 4 件套立标) + 3 旁证:CXL-PIM KV Cache HotInfra '26(Mooncake 后继 · 39.7× Cost/Mtokens 降低)+ PipeMax arXiv:2605.02189v1(commodity GPU 8 GPUs 2.51×)+ LAAR arXiv:2604.15732v1(Envoy EPP 路由) + 1 警示:tom 7-31 inference E1 连续 5 日缺失延续第 6 日 + spark 7-31 morning 节奏反转后第 7 棒静默期(本棒恢复 llm-infra-e1prep-v12)

新增共识 C84-C90 共 7 条 + 新增试金石 O162-O171 共 10 条

涉及 arXiv 号 14 个(本轮核心新增 4 个 + 存量沿用 10 个): - 本轮核心新增 4 个:arXiv:2607.16955 CADENCE(增量 5 + 增量 7)+ arXiv:2607.26627 Lossy Verification(增量 5)+ arXiv:2607.25380 Memory for LLMs(增量 3)+ arXiv:2502.07115v5 MC-SF(增量 2) - 本轮新增 4 个(旁证):arXiv:2604.15732v1 LAAR + arXiv:2605.02189v1 PipeMax + arXiv:2607.19712 RLHF C++(7-30 evening 已立)+ 本场新立 CXL-PIM(非 arXiv) - 存量沿用 10 个:arXiv:2504.19874 TurboQuant + arXiv:2510.09665 LMCache + arXiv:2607.18141 HyMCache + arXiv:2605.01280 MathOpt + arXiv:2607.17979 Harness Engineering for Kernel + arXiv:2607.22529 Skill Self-Play + arXiv:2607.21557 OpenForgeRL + arXiv:2604.15732v1 LAAR + arXiv:2605.02189v1 PipeMax + arXiv:2607.19712 RLHF C++


八、建议今晚活文档接力动作清单

  1. §2.1 推理引擎 6 寡头新增 TGI 2026-03-21 进入维护模式(6→5 框架决策树)+ Colibri 纯 C 744B MoE 25GB RAM
  2. §2.2 调度新增 MC-SF arXiv:2502.07115v5 MIT+MSR+Amazon + LAAR arXiv:2604.15732v1 Envoy EPP 路由作为「LLM serving 调度理论 2026 H2 两大理论突破」
  3. §2.3 KV cache新增 Memory for LLMs 综述 arXiv:2607.25380 统一架构分类学三正交轴 + LMCache 2026 Q2 Roadmap vLLM Omni KV Caching + SGLang MP Mode + Token dropping + vLLM FP8 KV-Cache 50% 显存节省
  4. §2.1 推理引擎新增 SIGMOD 2026 LLM Serving 三件套(CoDec/AlignedServe/HotPrefix · 2026-05-18 published)
  5. §2.4 Kernel/AI 自动化新增 CADENCE arXiv:2607.16955 DRIFT per-token KL 凸混合
  6. §2.4 Harness Engineering / §2.7 服务层并发安全新增 MCP 2026-07-28 协议栈无状态化(MRTR + Header-based routing + EMA + Roots/Sampling/Logging 弃用)+ A2A Linux Foundation 150+ 组织
  7. §2.1 推理引擎 / §2.6 训练-推理协同新增 paper_cards 主分类 llm-infra 7-31 新增 2 张 = 673 CADENCE + 681 Lossy Verification(SpecDec 推理加速算法立标 + RL 训练-推理协同 2026 H2 4 件套)
  8. §2.13 选型决策树升级为 v3.0 多源交叉(Spheron H100 + DevOpsBeast workload-first + inferenceengineering.tech 对照表 + TGI 维护模式)
  9. §2.7 vLLM K8s OOM runbook新增 vLLM AI Blog 2026-07-16 生产质量工程(1,918 commits/月 + 1,300 万 job minutes + 两周一次发版节奏)
  10. §2.10 系统栈 ASPLOS 2026 CXL KV Cache Server沿用 + 强化 HotInfra '26 Mooncake 后继 DeepSeek-R1-671B 32K tokens 数据 2.4× 吞吐 + 39.7× Cost/Mtokens 降低 + 29.5× Tokens/Watt
  11. §2.2 Disagg 5 节点新增 PipeMax arXiv:2605.02189v1 commodity GPU 8 GPUs pipeline parallelism + KV cache offloading 2.51× 提升
  12. §2.6 Cloud-Native新增 LAAR arXiv:2604.15732v1 Envoy EPP policy + llm-d MaxScorePicker 集成
  13. C84-C90 共识候选 + O162-O171 试金石写入对应候选池(7 共识 + 10 试金石)
  14. §6 引用清单扩至 257+ ID(本轮新增 4 arXiv + 3 旁证 arXiv + 3 个非 arXiv 工程化条目)
  15. §3.2 争议 / §4 开放问题沿用 §VII + 警示 1 接力观察(tom inference E1 + spark 节奏反转静默期)

本文件由 spark E1 自动生成 · 2026-07-31 18:40 (Asia/Shanghai) 仅供今晚活文档接力参考,不作为知识库最终内容 基线:organized/knowledge/llm-infra.md Wave3 §VII 32 轮抢修完成版(2026-07-29 05:00 收官) 7-30 evening E1 v11 已并入 v33 接力基线 · 本棒 v12 为第 12 棒 下一步:今晚活文档接力棒按上述 15 项动作归位 → 7-31 evening coordination-check-evening · 8-1 morning spark E1 第 13 棒