inference · E1 预消化简报(2026-08-25)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:2026-08-25 06:10 → 2026-08-25 22:20(约 16h)
基线活文档: organized/knowledge/inference.md(2026-08-25 日间更新版 · vLLM Conf Day1;Dynamo 1.4.1;RTP-LLM;pgvectorScale 471 QPS;Multi-Vector;LOCOMO;引→258)
基线 E1 报告: inbox/tom/2026-08-25-inference-e1prep.md(8-25 早棒,窗口 8-23 22:20 → 8-25 06:10,约 32h;5 条主线索 + 3 条矛盾/警示)
本棒性质: inference 主题 E1 日间预消化轮(16h 短窗口);承接 8-25 早棒之后,专注 8-25 06:10 → 22:20 新增;不重写活文档,只列近 16h 新增量供今晚活文档接力决策参考
状态
- 增量条数: 3 条主线索(含 1 条立基础延展确认 + 1 条邻接升级 + 1 条研究前沿候选) + 2 条矛盾/警示
- 显著新增: 有但量级中等——Modular "Five Eras of KVCache" 五时代框架首次锚入 + ReCache agent 场景实测数据(TTFT 3.655× / KV 内存 -92.43%)+ vLLM 0.27.0 changelog 确认 MRV2 默认 + FlashInfer Sampler + Disaggregation 路线
- 本棒说明: 8-25 早棒(5 条主线索)之后,16h 窗口 inference 核心增量来自 jay 下午/晚间补充(MemTrapBench / BASM / ReCache agent 场景数据 / ReFind / Modular Five Eras / vLLM 0.27.0 changelog)+ spark llm-infra evening 棒(KV Cache 优化 4 件 + MCP 安全邻接)。vLLM Conference Day 1 于今日(8-25)举办,当日 Keynotes + State of vLLM 2026 已结束,官方公告待后续接力棒核验。
- 涉及 arXiv 号: 净增 0 件(ReCache 2608.19662 已在 8-23 棒邻接升级候选,本次为实测数据补强);沿用 15+ 件
一、最重要的 3 条增量
增量 1【KV Cache 系统观 · §3.3 + §1.2 邻接】🟠 Modular "Five Eras of KVCache" 五时代框架首次锚入 ★★
来源: inbox/jay/2026-08-25T2105-jay-five-category-briefing.md(v2 §二-4)+ inbox/spark/2026-08-25-llm-infra-e1prep.md(evening 棒核心增量 1)
来源: Modular 官方博客(Brian Zhang 主笔,2026-02-05,持续更新);非 arXiv 论文
主分类: inference;形态: industry-signal/systematization;副分类: kv-cache, history, vllm, sglang, mooncake, llm-d
TLDR(来源:jay 8-25 evening 五分类 v2): Modular(Mojo/MAX 团队)系统化梳理 KVCache 技术演进五个时代,为业界提供了第一个权威的纵向技术分期框架,可直接作为 inference.md §3.3 的顶层组织结构。
要点: Five Eras of KVCache: 1. Era 1 — Naive Contiguous Allocation:初始阶段,无缓存,KV tensor 连续分配,60-80% 碎片化内存浪费 2. Era 2 — PagedAttention(vLLM 革命):PagedAttention 引入虚拟内存分页管理思想,内存碎片从 60-80% 降至 <4%;vLLM 核心贡献 3. Era 3 — Prefix Caching / RadixAttention(SGLang):跨请求共享前缀 KV cache;SGLang RadixAttention 前缀树自动复用 4. Era 4 — Disaggregated KVCache(跨节点):PD Disaggregation;KV Cache 分布到专用 workers 或跨节点;Mooncake Store、llm-d CNCF Sandbox 属于此 era 5. Era 5 — Compression/Quantization(当前进行时):TurboQuant / ChunkKV / OBCache / DistillCache / ReCache / Topology-Aware v2;5 件 2026 年新论文全部归属此 era
警示: - Five Eras 框架来自 Modular 工程团队视角(非学术综述),但与 inference.md §3.3 已有 20+ 路线高度吻合,可作为现有路线图的结构化索引 - 该框架将 vLLM + SGLang + Mooncake + llm-d 全部纳入,inference.md §1.2 PD Disaggregation 与 Era 4 对应
与活文档现有脉络的关系: - inference.md §3.3 已有 GEAR / TurboQuant / Transform Coding / DefensiveKV / SAW-INT4 / LMCache / OasisKV / HiSparse / C2KV / vToken / Maglev / FreeToken / DASH / FlashPrefill V2 / InferScale / Online Compaction / DistillCache / ReCache / Topology-Aware v2 共 20+ 件;Five Eras = 顶层元结构,将 20+ 件归入 5 个历史阶段 - §1.2 PD Disaggregation = Era 4 核心;§1.1 vLLM = Era 2 核心;§1.1 SGLang = Era 3 核心
建议归入节: §3.3(新增顶层概述「Five Eras of KVCache:Era 1 Naive → Era 2 PagedAttention vLLM → Era 3 RadixAttention SGLang → Era 4 Disaggregated Mooncake/llm-d → Era 5 Compression/Quantization」)+ §1.2(邻接标注 PD Disaggregation = Era 4)
增量 2【KV Cache · §3.3 邻接】🟡 ReCache agent 场景实测数据:TTFT 3.655× / KV 内存 -92.43% ★
来源: inbox/jay/2026-08-25-1950-evening-supplement.md(§三 ReCache)+ inbox/jay/2026-08-25-engineering-filter-llm-inference-agent-2026.md(reproduction 条目)
来源: buttondown/patricknovak1 引用 arXiv(ReCache 原论文);TTFT 加速 3.655× / 分配 KV 张量内存减少 92.43% / 注意力加速 1.423×
主分类: inference(邻接);形态: method/benchmark;副分类: kv-cache, agent, tool-use, ReCache
TLDR(来源:jay 8-25 evening supplement): ReCache 针对 Agent 发出大量重复工具 schema 编码的场景,提供专项 KV cache 复用方案;关键数据:TTFT 加速 3.655×、KV 内存减少 92.43%、注意力加速 1.423×。与 DistillCache(自适应驱逐)、Topology-Aware(跨 GPU 数据移动)形成互补。
要点: - 核心场景: Agent 发出重复工具调用(工具 schema 编码重复出现在每次调用);ReCache 识别并缓存资源级表示,消除跨资源交互,生成组合不变 KV 块 - 关键数据(来源:jay 8-25 engineering filter): - TTFT 加速:3.655× - 分配 KV 张量内存减少:92.43% - 注意力加速:1.423× - 机制: 资源级注意力,独立缓存资源表示,去除跨资源交互,生成组合不变 KV 块 - 与已有 KV Cache 路线关系: 与 DistillCache(KL 引导自适应驱逐)互补;DistillCache 关注通用注意力质量评估,ReCache 关注 Agent 工具 schema 重复场景专项
警示: - ReCache TTFT 3.655× / -92.43% 数字来自 buttondown/patricknovak1 二次引用,非一手 arXiv PDF;需原文 PDF 核验评测条件(模型、工具集规模、请求分布) - ReCache 已在 8-23 棒邻接升级候选(arXiv:2608.19662),本次为实测数据补强,非新论文发现
与活文档现有脉络的关系: - inference.md §3.3 已有 ReCache(arXiv:2608.19662)作为 agentic KV 复用首个专项候选;本次 = 实测数据补强(3.655× TTFT / 92.43% 内存 / 1.423× 注意力) - 与 §3.1 Agent Memory 邻接:ReCache 是 Agent 运行时 KV 层面的优化,区别于 Agent Memory 的语义层设计
建议归入节: §3.3(ReCache 子节内新增「agent 工具重复调用场景实测:TTFT 3.655× / KV 内存 -92.43% / 注意力 1.423×」)+ §3.1(邻接标注 ReCache agent 场景专项)
增量 3【推理引擎 · §1.1 + §3.3】🟡 vLLM 0.27.0 changelog 确认 MRV2 默认 + FlashInfer Sampler + Disaggregation 路线 ★
来源: inbox/jay/2026-08-25T2105-jay-five-category-briefing.md(v2 §二-1)+ inbox/spark/2026-08-25-llm-infra-e1prep.md(evening 棒增量 5)
来源: GitHub vllm-project/vllm releases/tag/v0.27.0(2026-08-10 · 561 commits · 242 contributors)
主分类: inference;形态: industry-signal;副分类: vllm, mrv2, flashinfer, disaggregation, changelog
TLDR(来源:jay 8-25 evening 五分类 v2): vLLM 0.27.0 changelog 确认多项关键里程碑:MRV2 成为 Llama/Mistral dense 模型默认执行路径(已在 inference.md 锚入);FlashInfer Sampler 生产级集成;Breakable CUDA Graphs 全面启用;Eagle3 CUDA Graph Pool 合并统一管理;Pipeline-parallel bubble 消除;FP8 KV Cache hybrid zeroing 修复;Disaggregation + KV offloading 进入正式路线图。
要点:
- Model Runner V2(MRV2): 已正式成为 Llama/Mistral dense 模型默认执行路径(vLLM 0.27),与 inference.md §1.1 已锚 "MRV2 = v0.25+ dense 模型默认执行路径" 一致
- FlashInfer Sampler: 生产级集成(PR #42472),Blackwell(B200/B300)FlashInfer 为默认 attention backend
- Breakable CUDA Graphs: 全面启用(PR #44050),减少 per-step kernel-launch 开销;生产推荐 breakable 或 tc_piecewise 模式
- Eagle3 CUDA Graph Pool: 移除专用池,合并入统一 graph 管理(PR #44078)
- Pipeline-parallel Bubble: 消除(PR #42187),提升 PP 场景 GPU 利用率
- FP8 KV Cache + Hybrid: 正确 zeroing 新分配 KV blocks(PR #43990)
- Disaggregation + KV offloading: 已在 vLLM 正式路线图;vLLM Conference Day 1(今日)Keynotes 应有进一步公告
- vLLM Conference 2026-08-25: "State of vLLM 2026" 由 Woosuk Kwon(Inferact)和 Zachary Xi(Inferact)主讲;今日为 Day 1,官方公告待后续核验
警示: - Disaggregation + KV offloading 进入 vLLM 正式路线图是重要信号,但具体 feature 内容需 vLLM Conference 官方公告核验 - 今日(8-25)vLLM Conference Day 1 已结束,Keynotes + State of vLLM 2026 结果应在下一次预消化棒核验
与活文档现有脉络的关系: - inference.md §1.1 已有 vLLM 0.28(M2+Rust);0.27.0 changelog 确认 MRV2 + FlashInfer + Disaggregation 路线,是 8-25 早棒 Dynamo 1.4.1 同方向信号(NVIDIA Dynamo 1.4.1 = disaggregated serving 编排层;vLLM 0.27.0 = disaggregated 引擎侧支持) - 与 §3.3 FlashPrefill V2 协同:FlashInfer Sampler 生产级集成利好 FlashPrefill V2 部署
建议归入节: §1.1(vLLM 0.27.0 changelog 确认子节:MRV2 默认 + FlashInfer Sampler 生产级 + Breakable CUDA Graphs + PP bubble 消除 + Disaggregation 路线 + "State of vLLM 2026" 今日结束待核验)+ §3.3(FlashInfer Sampler 生产级集成利好 FlashPrefill V2)
二、矛盾与待核实说法
矛盾 A【TurboQuant 数字冲突沿用】:AIxFunda 6×/8× vs jay 6-11 实测 2.69–4.4×——仍未闭合
来源: inbox/jay/2026-08-23-1950-jay-substack-inference-engineering-harness.md(§五 AIxFunda)+ inbox/jay/2026-08-06-11-evening-supplement-k8s-db-inference-updates.md
arXiv: 2605.19660
冲突描述(沿用 8-23 棒,仍未闭合): - AIxFunda(2026-08): TurboQuant → KV cache 压缩 6× + 推理加速 8×,H100 零精度损失 - jay 2026-06-11 实测: TurboQuant → 2.69–4.4×(同一论文)
状态: 本棒(8-25 evening)仍未闭合;需 PDF 核验 arXiv:2605.19660 各场景实际数字。jay 8-25 evening supplement 新增 PolarQuant(AISTATS 2026)+ QJL 两阶段管道机制,但具体加速比数字仍未独立核验。
矛盾 B【FlashPrefill V2 H200 vs H20 加速比差异】:47.26× 在 H200 FP8 实测,H20 国内落地数字未核验
来源: inbox/jay/2026-08-23-engineering-e1prep.md(增量 1)+ inbox/spark/2026-08-23-llm-infra-e1prep.md(增量 1)
arXiv: 2608.19758
警示(沿用 8-23 棒): - 47.26× 是 H200 FP8 数字;国内算力主要是 H20,两者在算力/带宽/架构上有差异 - H20 实际加速比需实测核验,不能直接套用 H200 数字做容量规划 - 建议今晚活文档接力时标注"H20 数字待实测,H200 数字仅供参考"
三、可引用 arXiv 号列表(本次净增 0 件)
本棒无净增 arXiv 主轴。 以下为相关在档 arXiv 补强信息:
| arXiv | 论文/方法 | 主分类 | 关联节 | 本棒补强内容 |
|---|---|---|---|---|
2608.19662 |
ReCache | kv-cache | §3.3 | 8-23 棒邻接升级候选;本次补强 agent 场景实测数据(TTFT 3.655× / KV 内存 -92.43%) |
2608.19758 |
FlashPrefill V2 | llm-infra | §3.3 | 8-23 棒已锚;H200 数字本棒沿用 |
2608.08878 |
DistillCache | kv-cache | §3.3 | 8-23 棒邻接升级候选;本棒维持候选 |
2605.19660 |
TurboQuant | kv-cache | §3.3 | 数字矛盾仍未闭合;本棒维持 |
2607.28633v2 |
Topology-Aware Data Movement | kv-cache | §1.2 | 8-23 棒邻接升级候选;本棒维持候选 |
2608.13426 |
RMM | llm-infra | §3.3 | 8-23 棒邻接升级候选;本棒维持 |
2608.16157 |
FreeToken | kv-cache | §3.3 | 8-23 棒已锚;本棒邻接维持 |
四、检查过的来源清单
**本棒已检查的 inbox 来源(8-25 06:10 → 22:20 窗口):
| 来源 | 文件 | inference 相关性 |
|---|---|---|
| inbox/jay/2026-08-25T2105-jay-five-category-briefing.md | v2 evening 五分类 | ★★★ Modular Five Eras + vLLM 0.27.0 changelog + HotPrefix ACL 2026 |
| inbox/jay/2026-08-25-1950-evening-supplement.md | 晚间补充 | ★★★ ReCache agent 场景数据 + MemTrapBench/BASM/ReFind(agent memory 非 inference 主轴)+ MemGraphRAG KDD 2026 |
| inbox/jay/2026-08-25T1505-jay-afternoon-supplement.md | MCP 安全专题 | 0(inference 间接) |
| inbox/spark/2026-08-25-llm-infra-e1prep.md | evening llm-infra 棒 | ★★★ Modular Five Eras 邻接 + vLLM 0.27.0 确认 + KV Cache 优化 4 件(ChunkKV/OBCache/LLM-AnDPro/HCAttention) |
| inbox/tom/2026-08-25T2040-agent-rag-longcontext-radar.md | 晚间 radar | 0(agent/memory 主题) |
| inbox/tom/2026-08-25-0900-hf-daily-2026-08-25.md | HF Daily 15件 | 0(无 llm-infra 主轴) |
| inbox/tom/2026-08-25-inference-e1prep.md | 8-25 早棒 | 基线 |
| inbox/tom/2026-08-25-1005-rss-yt-lex-fridman.md | Lex Fridman RSS | 0(AI 播客,无 inference 工程主轴) |
| inbox/jay/2026-08-25-engineering-filter-llm-inference-agent-2026.md | 工程筛选 | ★★ ReCache agent 场景实测数据 |
**本棒已检查的 paper_cards 来源(8-22 ~ 8-25 批次):
| 卡片号 | arXiv | 标题 | inference 相关性 |
|---|---|---|---|
| 1058 | 2608.21252 | EnSI-RAG | 0(rag) |
| 1059 | 2608.21159 | AID-Guard | 0(agent) |
| 1060 | 2608.21249 | Dis2Pat | 0(evaluation) |
| 1061 | 2608.21208 | SpecPort | 0(agent) |
| 1062 | 2608.21031 | PhysCaP | 0(agent) |
| 1063 | 2608.20438 | PV-SST | 0(agent) |
| 1064 | 2608.20574 | FlavourBench | 0(evaluation) |
| 1065 | 2608.18484 | SparsePR | 0(multimodal) |
| 1066 | 2608.18077 | Hydra-0 | 0(multimodal) |
| 1067 | 2608.18184 | Human-Centric Intelligence | 0(engineering) |
| 1068 | 2608.08676 | UniSpace | 0(multimodal) |
| 1076 | 2608.13622 | ARC Fair Relative Advantage | 0(agent) |
| 1075 | 2608.16812 | Image Editing via Concept Scaling | 0(multimodal) |
| 1074 | 2608.19567 | Block3D Text-to-3D | 0(multimodal) |
| 1073 | 2608.21833 | GameXpert-Bench | 0(agent) |
| 1072 | 2606.13610 | One Polluted Page LLM Recommenders | 0(rag) |
| 1071 | 2608.22872 | Better Retrieval Worse Robustness | 0(rag) |
| 1070 | 2608.20169 | Task-CoEvolve | 0(evaluation) |
结论: inference 主题 8-25 06:10 → 22:20 窗口增量以系统性框架锚入为主(Modular Five Eras of KVCache + vLLM 0.27.0 changelog 确认);paper_cards 新卡 0 件 inference 主轴;TurboQuant 数字冲突仍未闭合(沿用 8-23 棒);vLLM Conference Day 1 今日结束,官方公告待下一次预消化棒核验。
五、值得今晚活文档接力关注的其他信号
- vLLM Conference Day 1(2026-08-25 今日!):Keynotes 9:30 AM PT + State of vLLM 2026 12:30 PM PT + NVIDIA 合作 session 1:15 PM PT 已全部结束;Disaggregation + KV offloading 进入 vLLM 正式路线图是重要信号,官方公告内容应于明日 E1 棒核验
- Modular Five Eras of KVCache:可作为 §3.3 顶层组织结构,将 20+ 件已有 KV Cache 件归入 5 个历史 era
- ReCache agent 场景实测 3.655× TTFT:与 DistillCache(通用自适应)形成 agent 专项 vs 通用两条腿
- HotPrefix(ACL 2026):热感知的 KV Cache 调度策略;与 TinyServe(INFOCOM 2026)同为 Era 5 压缩 era 的新件
六、无显著新增量的领域(如实说明)
以下领域在本 16h 窗口确认无新增量,不重复列出: - NVIDIA Dynamo 1.4.1:已在 8-25 早棒锚入;spark evening 棒维持沿用,无新增实测数据 - 推理引擎选型 vLLM vs SGLang 2026 决策树:8-25 早棒已完整锚入;晚间 jay 五分类 v2 仅版本号更新(vLLM 0.27.0 / SGLang 0.5.18)无新 benchmark - 国产算力 vLLM-Ascend:8-25 早棒 3.8× 数据已锚;本棒无新数据 - Multi-Vector Late Interaction:8-25 早棒已锚;本棒无新数据库版本或 benchmark - Agent Token 缓存陷阱:8-25 早棒已锚;本棒无新数字 - pgvectorScale 471 QPS:8-25 早棒已锚;本棒无新核验
Tom · 2026-08-25 22:20 CST · inference · E1 预消化轮 · 窗口 8-25 06:10 → 22:20(16h)