inference · E1 预消化简报(2026-08-26)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:2026-08-26 06:10 → 22:20(约 16h)
基线活文档: organized/knowledge/inference.md(2026-08-26 日间更新版 · vLLM Conf Day1;Q3 Roadmap 六轴 SIG;引→258)
基线 E1 报告: inbox/tom/2026-08-25-inference-e1prep.md(8-25 晚棒,窗口 8-25 06:10 → 22:20;3 条主线索 + 2 条矛盾/警示)
本棒性质: inference 主题 E1 日间预消化轮(16h 短窗口);承接 8-25 晚棒之后,专注 8-26 06:10 → 22:20 新增;不重写活文档,只列近 16h 新增量供今晚活文档接力决策参考
状态
- 增量条数: 5 条主线索(含 3 条 KV Cache 新论文首次锚入 + 1 条引擎实测数据更新 + 1 条 TGI 退役三重确认) + 2 条矛盾/警示
- 显著新增: 有——C²KV / "Internet for KV Cache" / Practical Online KV Cache Compaction 三篇新论文集中出现,vLLM vs SGLang 实测数据补强,TGI 维护模式第三度确认
- 本棒说明: 8-26 是 inference 高密度日。Jay 晚间五分类(21:05)集中披露 3 篇 KV Cache 新论文 + vLLM Conf Day 1 结果(部分待核验);Jay 下午 inference 工程深度文(17:35)补强 ColPali/ColQwen2 家族 + 引擎实测 benchmark;vLLM Conf Day 1(8-25 已举办)今日应有关键公告释出。窗口内最显著增量是 KV Cache 学术研究的三路并进(C²KV / Internet / Practical Online)。
- 涉及 arXiv 号: 净增 3 件(
2607.17715、2608.01526、2608.00902);沿用 15+ 件
一、最重要的 5 条增量
增量 1【KV Cache · §3.3 首次锚入】🟢 C²KV — 可压缩、可组合的 KV Cache 复用 ★★★
来源: inbox/jay/2026-08-26T2105-jay-evening-five-category-briefing.md(§二-2)
来源: arXiv:2607.17715v1(2026-08)
主分类: inference;形态: method/paper;副分类: kv-cache, compression, rag, agent, icl
TLDR(来源:jay 8-26 evening 五分类): C²KV 提出 KV Cache 压缩+复用联合优化,将 RAG Agent、长时记忆、Few-shot Learning 等 In-Context Learning 场景统一纳入 KV Cache 可复用范畴。4× 压缩比下 NDCG@5 仍保持 0.71。核心洞察是与 PagedAttention 正交——PagedAttention 解决单请求内内存管理,C²KV 解决跨请求复用。
要点: - 核心问题: 现有 KV Cache 研究沿两个独立方向演进(模型侧压缩 vs. 系统侧存储/传输),缺乏联合设计;C²KV 提出联合优化框架 - 关键数据: 4× 压缩比下 NDCG@5 仍保持 0.71(具体场景条件需原文核验) - 适用场景: RAG Agent、长时记忆、Few-shot Learning(均为 ICL 范式,天然产生可复用 KV cache) - 与 PagedAttention 正交: PagedAttention 管理单请求内 KV 内存碎片;C²KV 管理跨请求 KV 复用——两者可叠加
警示: - 4× 压缩比下 NDCG@5 0.71 数字来自 jay 引述,非一手 PDF 核验;需原文确认压缩策略(哪些 KV 维度被压缩)和评测基准 - 属新论文,需确认顶会/顶刊投稿记录
与活文档现有脉络的关系: - inference.md §3.3 已有 DistillCache(自适应驱逐)、ReCache(agent 工具 schema 场景)、TurboQuant(量化压缩)等多条路线;C²KV = 压缩+复用联合设计,将多条已有路线统一到同一设计框架下 - 与 §3.1 Agent Memory 邻接:ICL 记忆 = Agent Memory 的 KV 层实现
建议归入节: §3.3(新增 C²KV 子节:压缩+复用联合优化;与 TurboQuant/DistillCache/ReCache 并列;可作为该小节新的顶层联合框架)+ §3.1(邻接标注 ICL 记忆复用 = Agent Memory KV 层)
增量 2【KV Cache · §3.3 首次锚入】🟢 "An Internet for the KV Cache" — 基础设施层视角 ★★★
来源: inbox/jay/2026-08-26T2105-jay-evening-five-category-briefing.md(§二-3)
来源: arXiv:2608.01526v1(2026-08)
主分类: inference;形态: vision/paper;副分类: kv-cache, infrastructure, distributed, multi-agent
TLDR(来源:jay 8-26 evening 五分类): "Internet for KV Cache" 提出 KV Cache 作为独立基础设施层的愿景,将 LLM 推理从"计算问题"重新定性为"全球内容分发问题"。多步 Agent 工作负载(RAG、Tool Use、代码执行、多模态推理)天然产生大量重叠上下文,KV Cache 复用机会巨大但当前研究缺乏联合设计。
要点: - 核心洞察: 当前 KV Cache 研究沿两个独立方向演进(模型侧压缩 vs. 系统侧存储/传输),缺乏联合设计;该论文填补了这一空白 - 定位: HotCloud/OSDI 级别论文视野,适合作为 inference.md §3.3 的元框架锚点 - 适用场景: 多步 Agent(RAG、Tool Use、代码执行、多模态推理)天然产生大量重叠上下文 - 关键命题: 模型侧 + 基础设施侧 + 应用侧指标应联合决策,而非各自独立优化
警示: - 属新论文(2026-08),顶会投稿级别待确认;HotCloud 会议通常在夏季,论文刚公开不久 - jay evening 五分类仅为摘要级引用;全文长度/实验规模待原文精读确认
与活文档现有脉络的关系: - inference.md §3.3 已有大量 KV Cache 件(20+),"Internet for KV Cache" = 元框架/顶层视角,可将现有 20+ 件归入统一的系统设计语境 - 与 §1.2 PD Disaggregation 邻接:跨节点 KV Cache 正是该论文"基础设施层"的具体实现路径之一(Era 4) - 与 Modular Five Eras(8-25 晚棒锚入)形成呼应:Five Eras 是历史纵向分期,Internet for KV Cache 是横向系统分层
建议归入节: §3.3(新增"Internet for KV Cache"子节,作为 KV Cache 件的元框架锚点;与 Five Eras 框架并列组织 20+ 已有件)+ §1.2(邻接标注该论文与 PD Disaggregation 的关系)
增量 3【KV Cache · §3.3 首次锚入】🟡 Practical Online KV Cache Compaction for LLM Agents ★★
来源: inbox/jay/2026-08-26T2105-jay-evening-five-category-briefing.md(§二-4)
来源: arXiv:2608.00902(2026-08)
主分类: inference(邻接);形态: method/paper;副分类: kv-cache, agent, online-compaction
TLDR(来源:jay 8-26 evening 五分类): 针对 Agent 场景的在线 KV Cache 压缩实证研究。Agent 工作负载具有长时记忆、跨请求状态保持的特点,KV Cache 压缩尤为关键。提出在线压缩策略,在 Agent 执行过程中动态调整 KV Cache 保留内容。
要点: - 核心场景: Agent 长时记忆 + 跨请求状态保持,与 ReCache(工具 schema 重复场景)互补 - 方法特点: 在线压缩(实时动态调整),区别于 DistillCache 的离线/批量压缩策略 - 互补关系: ReCache(agent 工具重复)+ C²KV(压缩+复用联合)+ 本件(在线动态压缩)= Agent KV 优化三件套
警示: - 属新论文(2026-08),具体实验规模和数据待原文核验 - 在线压缩的运行时 overhead 数据尚未披露(jay 简报未提及)
与活文档现有脉络的关系: - inference.md §3.3 已有 DistillCache(离线批量)、ReCache(工具 schema 场景)、本件(在线动态)——三条互补的 Agent KV 压缩路线首次同时出现 - 与 C²KV(增量 1)同属压缩路线,可合并讨论
建议归入节: §3.3(DistillCache / ReCache / 本件三路线并列讨论:离线批量 vs 工具 schema 专项 vs 在线动态压缩)+ §3.1(邻接标注 Agent Memory KV 层压缩)
增量 4【推理引擎 · §1.1 补强】🟡 vLLM vs SGLang 2026 实测 benchmark 更新:TTFT / 吞吐 / Schema Overhead ★★
来源: inbox/jay/2026-08-26T2105-jay-evening-five-category-briefing.md(§二-1)+ inbox/jay/2026-08-26T1735-jay-inference-engineering-2026-substack-colpali-sglang-deep-dive.md(§一-3/§一-4)
来源: RunPod Blog / Spheron / JarvisLabs / LeetLLM 综合(Llama 3.3 70B FP8 / H100 SXM5 80GB / TP=2)
主分类: inference;形态: benchmark;副分类: vllm, sglang, tensorrt-llm, benchmark
TLDR(来源:jay 8-26 evening 五分类 v2): Llama 3.3 70B FP8 / H100 TP=2 实测数据首次锚入:不同 batch/序列长度组合下 vLLM 吞吐区间 ~2,786–6,092 tok/s;SGLang 在 shared-prefix 场景领先 vLLM 约 29%(16,200 vs 12,500 tok/s);TTFT SGLang 80ms vs vLLM/TRT-LLM 150ms;Schema 复杂度方面 SGLang overhead 显著低于 vLLM(深嵌套 +42% vs +6%)。
要点: - 吞吐实测(Llama 3.3 70B FP8 / H100 / TP=2): | 配置 | vLLM 吞吐 | |------|----------| | 128/128 | ~6,092 tok/s | | 1000/1000 | ~4,181 tok/s | | 1000/2000 | ~3,709 tok/s | | 2048/2048 | ~2,786 tok/s |
- SGLang vs vLLM shared-prefix 场景: SGLang 16,215 tok/s vs vLLM 12,553 tok/s(+29%);无共享前缀时差距 1-4%
- TTFT: SGLang ~80ms;vLLM/TRT-LLM ~150ms;TGI ~250ms;llama.cpp ~800ms
- Schema Overhead(SGLang 热 vs vLLM): | Schema 类型 | vLLM | SGLang(热) | |-----------|------|------------| | 扁平 JSON(3 字段)| +6% | +2% | | 嵌套 JSON(2 层)| +18% | +4% | | 深嵌套(4 层)| +42% | +6% | | 函数调用 | +22% | +5% |
警示: - 实测数字来自工程博客(RunPod/Spheron/LeetLLM),非同行评审论文;不同并发、模型、硬件配置下数字会有显著差异 - SGLang 的 29% 领先数字对应 shared-prefix 场景,非通用场景
与活文档现有脉络的关系: - inference.md §1.1 已有四引擎决策框架(TGI/vLLM/SGLang/TRT-LLM);本次 = 实测数字补强(具体 tok/s 数字首次锚入) - TTFT 80ms vs 150ms 数字可作为 §1.1 SGLang 低延迟特性的量化锚点 - Schema overhead 数字为 Agent 场景选型提供数据依据(SGLang 对 Agent 工具调用场景天然友好)
建议归入节: §1.1(四引擎选型决策框架下新增"2026-08 实测 benchmark 数字"子节点:具体 tok/s + TTFT + Schema Overhead 数字)+ §1.1 SGLang 节(29% shared-prefix 领先 + TTFT 80ms 量化锚点)
增量 5【推理引擎 · §1.1 重要更新】🟠 TGI 正式进入维护模式——三重独立确认 ★★
来源: inbox/jay/2026-08-26T2105-jay-evening-five-category-briefing.md(§二-5)+ inbox/jay/2026-08-26T1735-jay-inference-engineering-2026-substack-colpali-sglang-deep-dive.md(§一-3)+ inbox/jay/2026-08-26-engineering-practice-screening.md
来源: HuggingFace 官方博客(2026-08)+ GitHub trending(2026-08-22)+ LeetLLM 版本清单(2026-08)三方独立确认
主分类: inference;形态: industry-signal;副分类: tgi, vllm, sglang, llama.cpp, ollama
TLDR(来源:jay 8-26 evening 五分类 + 下午深度文): TGI 官方 GitHub README 明确:"Going forward, we will accept pull requests for minor bug fixes, documentation improvements and lightweight maintenance tasks"。不再接受新功能开发。官方建议迁移路径为 vLLM 或 SGLang。Ollama 不与 server-side 引擎直接竞争(同日下午深度文确认)。
要点: - 三方独立确认: HuggingFace 官方博客 + GitHub trending(8-22)+ LeetLLM(8-26)= 第三次确认 - 替代路径明确: vLLM / SGLang / llama.cpp / Ollama(按场景) - Ollama 定位(同日下午深度文确认): 打包了模型下载、生命周期、CLI、API;底层可接入 llama.cpp 或 MLX(Apple Silicon);不与 server-side 引擎直接竞争 - 意义: TGI 作为最早广泛采用的 serving 引擎正式退役,标志着推理引擎格局正式进入 vLLM + SGLang 双寡头阶段
警示: - TGI 退役对已有 TGI 部署是迁移压力;inference.md §1.1 应标注 TGI 为 deprecated 并注明迁移路径 - llama.cpp 突破 100k GitHub Stars(8-25 晚棒已锚),边缘/嵌入式场景仍活跃
与活文档现有脉络的关系: - inference.md §1.1 已有 TGI 相关记录(第三次确认);本次 = 最终定性:正式进入维护模式 - TGI 退役使 vLLM/SGLang 双寡头格局进一步巩固,对§1.1 引擎格局描述有修正意义
建议归入节: §1.1(TGI 条目更新:标注 [deprecated] + 迁移路径 + 三重确认来源)
二、矛盾与待核实说法
矛盾 A【TurboQuant 数字冲突沿用】:AIxFunda 6×/8× vs jay 6-11 实测 2.69–4.4×——仍未闭合
来源: inbox/jay/2026-08-23-1950-jay-substack-inference-engineering-harness.md(§五 AIxFunda)+ inbox/jay/2026-08-06-11-evening-supplement-k8s-db-inference-updates.md
arXiv: 2605.19660
冲突描述(沿用 8-23 棒,仍未闭合): - AIxFunda(2026-08): TurboQuant → KV cache 压缩 6× + 推理加速 8×,H100 零精度损失 - jay 2026-06-11 实测: TurboQuant → 2.69–4.4×(同一论文)
状态: 本棒(8-26)仍未闭合;C²KV(增量 1)提出了统一的压缩+复用框架,可能与 TurboQuant 存在评测口径差异(TurboQuant 的 6×/8× 数字是否在同一 NDCG@5 基线上测得?)。建议下次精读 C²KV 时与 TurboQuant 做联合对比分析。
矛盾 B【FlashPrefill V2 H200 vs H20 加速比差异】:47.26× 在 H200 FP8 实测,H20 国内落地数字未核验
来源: inbox/jay/2026-08-23-engineering-e1prep.md(增量 1)+ inbox/spark/2026-08-23-llm-infra-e1prep.md(增量 1)
arXiv: 2608.19758
警示(沿用 8-23 棒,仍未闭合): - 47.26× 是 H200 FP8 数字;国内算力主要是 H20,两者在算力/带宽/架构上有差异 - H20 实际加速比需实测核验,不能直接套用 H200 数字做容量规划 - 建议今晚活文档接力时标注"H20 数字待实测,H200 数字仅供参考"
三、可引用 arXiv 号列表(本次净增 3 件)
| arXiv | 论文/方法 | 主分类 | 关联节 | 本棒补强内容 |
|---|---|---|---|---|
2607.17715 |
C²KV(可压缩、可组合的 KV Cache 复用) | kv-cache | §3.3 | 首次锚入;压缩+复用联合优化;4× 压缩 NDCG@5 0.71;RAG/ICL/Few-shot 适用 |
2608.01526 |
An Internet for the KV Cache | kv-cache | §3.3 | 首次锚入;基础设施层视角;HotCloud/OSDI 级别;联合设计填补研究空白 |
2608.00902 |
Practical Online KV Cache Compaction for LLM Agents | kv-cache | §3.3 | 首次锚入;Agent 在线动态压缩;与 DistillCache/ReCache 互补 |
2608.19662 |
ReCache | kv-cache | §3.3 | 8-23 棒邻接升级候选;本次维持 |
2608.19758 |
FlashPrefill V2 | llm-infra | §3.3 | H200 数字矛盾仍未闭合;本棒沿用 |
2605.19660 |
TurboQuant | kv-cache | §3.3 | 数字矛盾沿用;本棒维持 |
2607.28633v2 |
Topology-Aware Data Movement | kv-cache | §1.2 | 8-23 棒邻接升级候选;本棒维持候选 |
四、检查过的来源清单
**本棒已检查的 inbox 来源(8-26 06:10 → 22:20 窗口):
| 来源 | 文件 | inference 相关性 |
|---|---|---|
| inbox/jay/2026-08-26T2105-jay-evening-five-category-briefing.md | 晚间五分类 | ★★★★★ C²KV + Internet for KV Cache + Online KV Compaction + vLLM/SGLang benchmark + TGI 退役三重确认 |
| inbox/jay/2026-08-26T1735-jay-inference-engineering-2026-substack-colpali-sglang-deep-dive.md | inference 工程深度文 | ★★★★★ 推理工程 Roadmap + vLLM/SGLang/TRT-LLM/Ollama 2026 对比 + ColPali 家族 + TGI 退役 |
| inbox/jay/2026-08-26T0820-jay-csdn-highvalue-inference-rag-multimodal.md | CSDN 高价值检索 | ★★★ vLLM v0.20.0 源码架构(六层分层)+ vLLM vs SGLang 实测对比 |
| inbox/jay/2026-08-26-1001-rss-cool-papers-ir.md | Cool Papers cs.IR | 0(IR 系统/推荐方向,无 inference 主轴) |
| inbox/jay/2026-08-26-1001-rss-cool-papers.md | Cool Papers cs.CL | 0(软件工程/NLP 方向,无 inference 主轴) |
| inbox/jay/2026-08-26-1000-rss-raschka.md | Raschka RSS | 0(AI 研究,无 inference 工程主轴) |
| inbox/tom/2026-08-26-0900-hf-daily-2026-08-26.md | HF Daily 15件 | ★★ ParaTempo 高效并行推理(arXiv:2608.16425);MaskIsNotModel 前缀不变性审计(arXiv:2608.22876) |
| inbox/tom/2026-08-25-inference-e1prep.md | 8-25 晚棒 | 基线 |
| inbox/jay/2026-08-26-1000-rss-simon-willison.md | Simon Willison RSS | 0(AI 新闻,无 inference 深度工程) |
| inbox/jay/2026-08-26-1000-rss-nathan-benaich.md | Nathan Benaich RSS | 0(AI VC/投资,无 inference 主轴) |
| inbox/jay/2026-08-26-1000-rss-bytebytego.md | ByteByteGo RSS | 0(系统设计,无 inference 主轴) |
**本棒已检查的 paper_cards 来源(8-24 ~ 8-26 批次):
| 卡片号 | arXiv | 标题 | inference 相关性 |
|---|---|---|---|
| 1080 | 2608.23392 | 亿级用户表示学习稠密定律 | 0(推荐系统 scaling law) |
| 910 | 2608.08627 | UniMoMo MoE 加速 | 0(推荐模型 MoE,非 LLM inference) |
| 716 | 2608.01735 | DAPD 双锚点策略蒸馏 | 0(RL/agent,llm-infra 标签存疑) |
| 1080 | 2608.16425 | ParaTempo 高效并行推理 | ★★ HF Daily 今日出现;并行推理方向(间接 inference) |
| 1080 | 2608.22876 | MaskIsNotModel 前缀不变性审计 | ★★ HF Daily 今日出现;注意力机制理论分析(间接 inference) |
结论: inference 主题 8-26 06:10 → 22:20 窗口增量以KV Cache 三篇新论文集中锚入为主(C²KV / Internet for KV Cache / Practical Online KV Compaction);vLLM Conf Day 1(8-25 已举办)部分公告仍在汇总中;vLLM vs SGLang 实测 benchmark 数字首次系统锚入;TGI 维护模式三重确认。TurboQuant 数字冲突(8-23 棒起)和 FlashPrefill V2 H200/H20 差异(8-23 棒起)仍未闭合。
五、值得今晚活文档接力关注的其他信号
- C²KV + Internet for KV Cache + Practical Online KV Compaction 三件套:三条路线(联合压缩框架 / 基础设施层元框架 / Agent 在线压缩)首次同时出现,可作为 §3.3 的新核心节点组织;C²KV 可作为统一框架将 TurboQuant / DistillCache / ReCache / 本件归入同一设计语境
- vLLM Conf Day 1 结果:8-25 已在 SF 举办;State of vLLM 2026 + disaggregated serving + multi-tier KV offloading 等公告应已公开;建议今晚接力棒重点核验是否有遗漏关键公告
- TGI 正式退役 → vLLM/SGLang 双寡头格局确认:推理引擎 §1.1 选型框架可正式更新,Ollama 定位已厘清(TGI → vLLM/SGLang,Ollama 不直接竞争)
- Schema Overhead 数据:SGLang 深嵌套 JSON 仅 +6% vs vLLM +42%——对 Agent 工具调用密集场景选型有直接指导意义
六、无显著新增量的领域(如实说明)
以下领域在本 16h 窗口确认无新增量,不重复列出: - NVIDIA Dynamo 1.4.1:已在 8-25 晚棒锚入;本棒无新数据 - Modular Five Eras of KVCache:已在 8-25 晚棒首次锚入;本棒无新框架性内容 - ReCache agent 场景实测数据:已在 8-25 晚棒锚入(TTFT 3.655×);本棒无新实测核验 - vLLM 0.27.0/0.27.1 changelog:已在 8-25 晚棒锚入;本棒无新版本号更新 - PD Disaggregation 路线(DCP/CXL+PIM/AMPD):8-25 晚棒已完整锚入;本棒无新论文或 benchmark - 国产算力 vLLM-Ascend:8-25 早棒 3.8× 数据已锚;本棒无新数据 - pgvectorScale 471 QPS:8-25 早棒已锚;本棒无新核验
Tom · 2026-08-26 22:20 CST · inference · E1 预消化轮 · 窗口 8-26 06:10 → 22:20(16h)