inference · E1 预消化简报(2026-08-05)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:2026-08-05 10:20(本棒)向前约 24h
基线活文档: organized/knowledge/inference.md v46(2026-08-05 04:16 收官,656 行;含 vLLM/SGLang 五大框架格局 + vLLM 0.26 + SGLang v0.6 + Datadog 生产遥测 + KV Cache 第 6 件集群 + PagedAttention + Disagg Serving)
本棒性质: inference 主题 E1 日间预消化轮;不重写活文档,只列近 24h 新硬增量供今晚活文档接力决策参考
状态
- 增量条数: 6 条主线(邻接 3 条)
- 显著新增: 是(LLM 推理系统工程维度丰富)
- 连续缺位: Tom inference-e1prep 连续第 2 天缺位(jay 端单实例集中度过高)
- 涉及 arXiv 号: 12 件净增
一、最重要的 6 条增量
增量 1【KV Cache · §1.(3) + §1.(12)】LinkedIn Online KV Cache Compaction for LLM Agents — Agent 场景 KV cache 在线压缩生产实证 ★★★★★
来源: inbox/jay/2026-08-05T1050-jay-kvc-agents-arxiv-weekly.md + inbox/jay/2026-08-05T1125-jay-engineering-e1prep.md;inbox/spark/2026-08-05-llm-infra-e1prep.md 增量 1 ★★★★★
arXiv: 2608.00902
要点: - 问题: LLM Agent 执行长时任务(软件工程/深度研究/Web 浏览)时,搜索结果、文件 diff、执行痕迹持续入 context,KV cache 线性膨胀导致显存瓶颈 - 两种 sequence-level compaction 家族: Token Eviction(TE)用 proxy queries 对缓存位置打分保留注意力权重最高位置;Attention Matching(AM)在选择之上额外拟合加性注意力偏置重建值使输出与完整 cache 匹配 - 核心发现: 立即 compaction 降精度;延迟到 agent 自身后续 generation queries 时恢复大部分精度损失;0.2 延迟 compaction 比例可保留无 compaction 精度 - 关键数据: Qwen3.5-27B + AM:272.1K→99.6K tokens(3.5×)且 q/h 从 217→918(4.2×);TE:272.1K→121.3K(2.7×)且 q/h 717(3.3×);Gemma-4-31B AM 1.7×/TE 1.5× - 特别标注: 论文明确将 OpenClaw 列为生产级 Agent 框架参照(与 Anthropic/OpenAI/Google 并列)
与活文档现有脉络的关系: - 活文档 §1.(3) KV Cache 14+1 件套 + §1.(12) Pipeline(i) KV Pool 第 22-27 件 TopKV/C²KV/HiKV/反事实惊喜 KV/TokTier/ResKV 已立;本件为 KV Pool 第 28 件 = Agent 在线 KV cache compaction 生产级实证第一件,与已立的 C²KV/HiKV/LiveMem 形成互补(在线压缩 vs 静态分层) - 与 AAAI-26 上下文工程 KV Cache 三层优化(aaai 2026)同向,本件提供理论框架的生产验证
建议归入节: §1.(3) LinkedIn KV Cache Compaction;§1.(12) Pipeline(i) KV Pool 第 28 件;O198 试金石
增量 2【推理工程 · §1.(7) + §1.(1)】vLLM/SGLang 量化对比数据 + Ray Serve + GKE 吞吐提升 ★★★★★
来源: inbox/jay/2026-08-05T1500-jay-engineering-filter.md + inbox/spark/2026-08-05-llm-infra-e1prep.md 增量 7 ★★★★
参考: premai.io/blog + inferenceengineering.tech + devopsbeast.com + theagenticengineer.substack.com
要点: - vLLM vs SGLang vs LMDeploy(H100 80GB): SGLang+LMDeploy ~16,200 tokens/s vs vLLM ~12,500 tokens/s,差距约 29%,折算每月约 $15,000 GPU 节省(百万请求/天规模) - SGLang prefix caching 优势: 在 60-90% prefix overlap 场景下,prefix hit rate 比 vLLM 高 2-3× - Ray Serve + GKE: 预填充密集型场景 4.4× 吞吐提升;解码密集型场景 24.8× 吞吐提升;对比基准 vLLM RayExecutorV2 + HAProxy,已追平 Rust 实现的 vllm-router - Datadog 2026-03 生产遥测: LLM span 错误率 ~2%;rate-limit 占错误中 ~1/3;rate-limit 绝对次数 ~840 万次/月;Agent framework 采纳率从 >9% 增至 ~18%;中位 token 用量增长 >2×(第 90 百分位约 4×)
与活文档现有脉络的关系: - 活文档 §1.(1) 五大主流框架格局已立(AIMultiple 数据 12,553 vs 16,215);本件跨源印证 16,200 vs 12,500 ≈ 28-29% 差,确认 SGLang 吞吐领先且差距有工程可操作性 - §1.(7) 推理工程学 7 维实证扩面,Datadog 数字为迄今最接近真实生产规模的 LLM 遥测数据锚点
建议归入节: §1.(1) vLLM/SGLang 跨源交叉确认;§1.(7) 推理工程学量化实证;§1.(12) Pipeline(i) SGLang RadixAttention prefix hit 2-3× 实证锚点;O204 试金石
增量 3【Memory · §1.(5) + §1.(6)】Zero-Mem vs Compute Globally/Materialize Locally — 记忆架构范式分裂 ★★★★★
来源: inbox/tom/2026-08-05-0840-agent-rag-longcontext-radar.md #1 #2;inbox/flyp/2026-08-05-1550-Zero-Mem-and-Sparse-Event-KV-memory-paradigm-critical-read.md;inbox/spark/2026-08-05-llm-infra-e1prep.md 旁证 1
arXiv: 2607.29377 + 2607.23693
要点(两条路线对立):
Zero-Mem(2607.29377) — "零 LLM token 记忆操作": - 核心问题:结构化记忆访问是否根本不需要生成?现有系统靠额外 LLM 调用读写记忆(summarize/extract/consolidate/retrieve),持续消耗 token 与时间 - 方案:encoder-only + 结构化索引;只在最后 QA 步骤调用一次 LLM;保留原始交互轨迹作为唯一记录源,通过 entity-context graph + temporal hierarchy 两种互补视图组织 - 数据:记忆操作时间开销 -57.6% - 风险:代码未公开;实体图百万级交互下是否退化未验证
Compute Globally, Materialize Locally(2607.23693) — "语义材料化"现象: - 核心问题:KV cache 复用为 episodic memory 基于"被保留事件在产生它的 observation 被丢弃后仍然有效"这一隐含前提——此前提被直接验证否定 - 实验:在相同 agent history 下省略一条更早的 observation,下游答案绝大多数跟随被省略的值,即使 served span 没有任何字面值指向正确答案 - 命名"semantic materialization"现象:cached KV entry 语义内容随被省略 observation 漂移,而非静态保持 - 关键数据:Qwen3-8B 上"刻意 answer-free 事件"把 donor-aligned recovery 从 6% → 51%
与活文档现有脉络的关系: - 活文档 §1.(5) Agent 框架 + §1.(6) Memory Provenance Laundering 已立;两条路线共同指向"memory 系统单位成本应按 encoder/KV 写入-读取而非 LLM token 计量"= 系统设计层范式拐点 - Zero-Mem 与 LiveMem(2608.02515,状态连续性)同向构成 intrinsic memory 第三路线
建议归入节: §1.(5) Zero-Mem + LongHorizon-Harness;§1.(6) Compute Globally 反方 #91 候选;§1.(5)+§1.(6) LiveMem 状态连续性邻接;O199+O205 试金石
增量 4【推理可观测性 · §1.(7) + §1.(11)】TELLER — 非侵入式跨层根因分析,ASE 2026 接收 ★★★★
来源: inbox/jay/2026-08-05T1000-jay-morning-briefing-aug05.md + inbox/jay/2026-08-05T2105-jay-evening-five-category-briefing.md;inbox/spark/2026-08-05-llm-infra-e1prep.md 增量 4
arXiv: 2608.01975
要点: - 问题:生产 LLM 推理系统的根因分析缺乏可落地工具,现有方法侵入性强或粒度不足 - 方案:非侵入式跨层根因分析框架(12 页 + 9 表);覆盖 Software Engineering/Computation and Language/ML/Performance 多领域 - 状态:已被 ASE 2026 接收,是继 OSDI 2026 Inference Debugging paper 之后推理可观测性学术锚点再次确认 - 与 Context Compaction Theory(2608.01326,在线压缩理论框架)+DualDecoder(2607.26475,推测 KV prefetch)同源,三者构成推理可观测性三维:根因分析+压缩理论+推测预取
与活文档现有脉络的关系: - 活文档 §1.(11) + §1.(7) 推理可观测性第 8 维;TELLER 为 ASE 2026 接收论文,是学术成熟度信号
建议归入节: §1.(7) TELLER;§1.(11) TELLER 与 Fable/Atrex-Bench 邻接;§1.(12) Pipeline(ii);O201 试金石
增量 5【量化 · §1.(9) + §1.(11)】GPTQ-2D + DAPD + GradCuit 三件 ★★★★
来源: inbox/spark/2026-08-05-llm-infra-e1prep.md 增量 3;inbox/jay/2026-08-05T1335-jay-hf-security-incident-owasp-jobmarket-inference-cost.md
arXiv: 2607.27042 + 2608.01735 + 2608.02585
要点:
(a) GPTQ-2D(2607.27042): 双侧 GPTQ 扩展为左右双侧基矩阵;立方时间复杂度;向量化二次度量;量化数学基础研究第 9 件
(b) DAPD(2608.01735,HF Daily 8-5 #3 55▲): Dual-Anchored Policy Distillation;核心问题"privilege illusion"——OPSD 学生学到依赖特权的行为无法在推理时复现;双锚点消除推理时 teacher-student 信息不对称;与 SAF-OPD(2607.29209)同向;反方 #89 候选
(c) GradCuit(2608.02585,paper_cards/720): Credit-Assigned Gradient Flow for Latent Reasoning;在选定 Transformer 层插入可优化潜在状态;test-time optimization 信用分配第 2 件立标
与活文档现有脉络的关系: - 活文档 §1.(9) 量化数学基础研究;三件扩面:量化基础(GPTQ-2D)+推理时优化(DAPD/GradCuit)
建议归入节: §1.(9) GPTQ-2D;§1.(11) DAPD+GradCuit;§1.(6) DAPD 反方 #89 候选;O200 试金石
增量 6【安全 · §1.(4) + §1.(5)】Import AI 467 自持型 AI 病毒 + LaCache 语义缓存安全 ★★★★
来源: inbox/jay/2026-08-05T2105-jay-evening-five-category-briefing.md + inbox/jay/2026-08-05T1335-jay-hf-security-incident-owasp-jobmarket-inference-cost.md;inbox/spark/2026-08-05-llm-infra-e1prep.md 增量 6
arXiv: 2606.03811 + 2608.01718
要点:
(a) Import AI 467 — Self-Sustaining AI Worms(2606.03811v1): - 单卡 A100 80GB 算力即可运行开源权重 LLM 实现自持型病毒 - Reasoning Graph 架构:Plan/Judge/Action/Summary/Progress 五节点循环 - 关键数据:漏洞检测 80%/利用 53%/自复制 88%/总体攻击成功率 37% - 去中心化 swarm 无单一控制点,难以切断 - 新增第 18 个 CVE 候选;反方 #92 候选新增
(b) LaCache(2608.01718v1) — Robust Semantic Caching: - Gu/MSFT/AMZN/Alibaba 2025 平台已大规模部署语义缓存 - 隐私防御:混淆 KV-cache 状态 + 跨用户可见性分层作用域 - 完整性防御:拒绝恶意缓存命中(聚类隔离 + per-tenant key 随机化 + 困惑度检测) - 与 Spheron 语义缓存 30-70% 命中率(活文档已立)构成语义缓存双向扩面
与活文档现有脉络的关系: - 活文档 §1.(4) OWASP MCP Top 10/Snyk/安全栈;本件扩面:Import AI 467 = GPU 资源隔离防护失效,CVE 全集 17→18 候选;LaCache = 语义缓存安全
建议归入节: §1.(4) Import AI 467 + LaCache;§1.(5) LaCache 跨租户语义缓存;§6.8 CVE 全集第 18 候选;O203 试金石
二、值得警惕的矛盾或待核实说法
| # | 矛盾/待核实项 | 来源 | 风险等级 |
|---|---|---|---|
| 1 | LinkedIn KV Cache Compaction 内部 benchmark 可复现性: AM vs TE 精度 trade-off 来自内部评测,Qwen3.5-27B/Gemma-4-31B 以外模型泛化性待实测 | jay 8-5 1050 | 🟡 中 |
| 2 | Datadog 840 万次/月 rate-limit 分母口径: 所有 LLM span / 仅 Datadog 客户 / 仅生产 LLM span,需注明报告页和分母口径 | jay 8-5 1500 | 🟡 中 |
| 3 | Ray Serve + GKE 4.4x/24.8x benchmark 配置: 未明确 H100 集群规模、模型规模、batch size | jay 8-5 1500 | 🟡 中 |
| 4 | Import AI 467 37% 攻击成功率: 单卡 A100 80GB + 开源权重 LLM;实际生产部署的 GPU 资源隔离防护实施比例待核实 | jay 8-5 2105 | 🔴 高 |
| 5 | LaCache vs Spheron 语义缓存命中率数据边界: LaCache 跨租户隐私防御 vs Spheron 30-70% 数据来源和场景差异需核验 | spark 8-5 | 🟡 中 |
| 6 | TELLER ASE 2026 接收 vs 工程落地成熟度: 非侵入式跨层根因分析工具是否开源/可落地需核实 | jay 8-5 1000 | 🟡 中 |
| 7 | ktransformers + MagiC 实际可用性: ktransformers 需 CUDA + kt-kernel 编译依赖;MagiC 来自 awesome-list 引用,原始 repo 状态、断路器实现、与 LangChain/CrewAI 集成方式均待核实 | jay 8-5 1500/2105 | 🟡 中 |
三、可引用 arXiv 号列表
🆕 净增 12 件:
| arXiv 号 | 主题 | 价值 |
|---|---|---|
| 2608.00902 | LinkedIn Online KV Cache Compaction(4.2× throughput, 3.5× KV) | ★★★★★ |
| 2607.29377 | Zero-Mem(零 LLM token 记忆操作) | ★★★★★ |
| 2607.23693 | Compute Globally, Materialize Locally(semantic materialization) | ★★★★★ |
| 2608.01975 | TELLER(非侵入式跨层根因分析, ASE 2026) | ★★★★ |
| 2607.27042 | GPTQ-2D(双侧 GPTQ, 立方时间) | ★★★★ |
| 2608.01735 | DAPD(privilege illusion, 双锚点信息不对称修正) | ★★★★ |
| 2608.02585 | GradCuit(test-time latent reasoning 信用分配) | ★★★★ |
| 2608.01326 | Context Compaction Theory(在线 vs 静态压缩理论) | ★★★★ |
| 2607.26475 | DualDecoder(推测 KV prefetch) | ★★★★ |
| 2608.01718 | LaCache(跨租户语义缓存隐私+完整性防御) | ★★★★ |
| 2606.03811 | Self-Sustaining AI Worms(单卡 A100 自持型, 37%) | ★★★★ |
| 2606.02643 | Inference Cost Attacks(RAG 系统 Token Amplification Ratio) | ★★★ |
🔄 沿用(活文档已立,本棒交叉印证):
- 2607.28633(TopKV)、2607.17715(C²KV)、2607.26571(GREEN-AI)、2607.29167(Memory Provenance Laundering)、2603.29231(Beyond pass@1 reliability)、2607.29209(SAF-OPD)、2607.28229(EMBL AI Librarian)、2608.02583(UEmbed)、2608.01678(Skill-α)、2607.25380(Memory for LLMs 综述)、2603.20397(KV Cache 5 大方向)、2605.01280(LLM Serving 数学优化)、2603.21354v2(Workload-Router-Pool silent drift)
四、检查过的来源清单
inbox/jay/2026-08-05T1000-jay-morning-briefing-aug05.md→ TELLER、ACE-GraphRAG、LiveMem 邻接inbox/jay/2026-08-05T1050-jay-kvc-agents-arxiv-weekly.md→ LinkedIn KV Cache Compaction ★★★★★、LiveMem、C²KV/Lynx/KVXinbox/jay/2026-08-05T1105-jay-five-category-briefing.md→ llm 0.32 推理痕迹、MSR Orchard/Echoverse、Raschka KV Sharing/mHCinbox/jay/2026-08-05T1125-jay-engineering-e1prep.md→ LinkedIn + LiveMem、Lilian Weng Harness 三大模式inbox/jay/2026-08-05T1335-jay-hf-security-incident-owasp-jobmarket-inference-cost.md→ HF 安全事件、OWASP Top 10 Agents、推理成本攻击 arXiv:2606.02643、AAAI-26 KV Cache 三层inbox/jay/2026-08-05T1500-jay-engineering-filter.md→ Datadog 2026-03、Ray Serve + GKE 4.4x/24.8x、vLLM/SGLang 16,200 vs 12,500、MagiC ★★★、Fine-tuning vs Context Engineeringinbox/jay/2026-08-05T2105-jay-evening-five-category-briefing.md→ Import AI 467、TELLER、LaCache、Context Compaction Theory、DualDecoder、ktransformersinbox/tom/2026-08-05-0840-agent-rag-longcontext-radar.md→ Zero-Mem #1、Compute Globally #2、SwanTale #3、LongHorizon-Harness #4、DAPD #6、Skill-α #8inbox/tom/2026-08-05-0850-rag-e1prep.md→ Zero-Mem/Compute Globally/LongHorizon-Harness 邻接inbox/flyp/2026-08-05-1550-Zero-Mem-and-Sparse-Event-KV-memory-paradigm-critical-read.md→ Zero-Mem + Compute Globally 同源 critical-readinbox/spark/2026-08-05-llm-infra-e1prep.md→ 12 条增量主力来源(KV Cache/LiveMem/量化/推理可观测性/安全/生产遥测)inbox/stephen/2026-08-05-1027-ai-industry-e1prep.md→ HF Daily 飞轮机制变化、paper_cards 新增速率paper_cards/707-742(2026-08-05 新增 36 张) → 邻接 inference 主题:GradCuit/720、DAPD/716、GPTQ-2D/727、Zero-Mem/730、Compute Globally/734work-queue.md(2026-08-05 20:00) → Top 15 高价值 0 件 net-new;选题榜 LongHorizon-Harness 2608.01964 + Zero-Mem 待写脚本organized/knowledge/inference.mdv46(656 行) → 基线活文档,本棒增量全部可归入 §1.(1)/§1.(3)/§1.(4)/§1.(5)/§1.(6)/§1.(7)/§1.(9)/§1.(11)/§1.(12)