inference · E1 预消化简报(2026-08-11)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:2026-08-10 22:20 → 2026-08-11 22:20(约 24h)
基线活文档: organized/knowledge/inference.md v48(2026-08-10 22:20 收官;含 TGI 进入维护模式+vLLM/SGLang双栖收敛+DecodeCP+C2KV KDD2026+AMPD+SemanticRouter0.3+QuantSpec+HPCA2026四件+Spheron H100 benchmark+vLLM Conference 2026 路线图)
本棒性质: inference 主题 E1 日间预消化轮;不重写活文档,只列近 24h 新硬增量供今晚活文档接力决策参考
状态
- 增量条数: 6 条主线(含 1 条首度锚入 inference 主题;邻接 6 条)
- 显著新增: 是(vLLM Decode Context Parallelism 官方博客首度锚入;OasisKV KV Cache HBM 解耦首度锚入;CNCF llm-d K8s AI 推理框架首度锚入;KV-Cache Timing Side-Channel 安全新类)
- 本棒说明: 8-11 全天 inbox 来源极为丰富(jay 10+ 主力棒+spark/llm-infra+flyp/stephen);vLLM 官方工程博客(DCP/25K TPS)来自 jay 8-11 1735 evening briefing;paper_cards 8-11 下午批新增多件邻接 inference 的 llm-infra/agent 新卡(OasisKV/Ouroboros/AMD/Evo-Bench)
- 涉及 arXiv 号: 8 件净增(含 3 件 inference/llm-infra 主分类)
一、最重要的 6 条增量
增量 1【推理引擎 · §1.(1) + §1.(12)Pipeline(ii)】vLLM Decode Context Parallelism(DCP)官方博客首度锚入——长上下文推理的通信并行新策略 ★★★★
来源: inbox/jay/2026-08-11T1735-jay-evening-briefing-vllm-hf-kvcache-cncf-k8s-aug2026.md §一(vLLM Blog 2026-08-07);inbox/spark/2026-08-11-llm-infra-e1prep.md 增量 2
arXiv: 无(vLLM 官方工程博客 https://vllm-project.github.io)
要点:
- 核心创新: Decode Context Parallelism(DCP)是 vLLM 专为长上下文推理设计的通信并行策略——将 decode 阶段的 KV cache 分布到多 GPU,而计算保持在单卡,从而减少传统 Tensor Parallelism 的通信开销
- 与传统 TP 的区别: 传统 TP 将单次推理的计算和 KV cache 都切分到多卡,通信开销大;DCP 仅对 KV cache 做分布,计算在单卡——适合 128K+ 上下文的生产部署
- 动态策略配合: 可配合 context_length 配置在 prefill/decode 不同阶段动态选择并行策略
- 与 RadixAttention 协同: vLLM DCP 解决长上下文显存不足,RadixAttention(SGLang)解决前缀共享——两者解决不同维度,合用效果互补
与活文档现有脉络的关系: - inference.md v48 §1.(1) 已立推理引擎 6 寡头(vLLM/SGLang/TRT-LLM/Ollama/MAX/LMDeploy)+§1.(12) Pipeline(ii) Engine;v48 已有 vLLM 0.27 SpecDec/DFlash/Mixed KV/Thinking budget 等长上下文相关件 - 本棒 = DCP 首度以 vLLM 官方工程博客锚入 inference 主题(v48 无 DCP 条目);与 v48 已立的 Chunked Prefill + Disaggregated Serving 同属长上下文推理并行策略族,但 DCP 专门针对 decode 阶段 KV cache 分布,是新维度 - 与 HPC-Ops × SGLang Tencent 2.95×(v48 §1.(1))同属长上下文/高并发推理优化,但 DCP 是 vLLM 侧,Tencent 是 SGLang 侧
建议归入节: §1.(1) 推理引擎新增 DCP 条目;§1.(12) Pipeline(ii) Engine 新增长上下文并行策略对照(DCP vs TP vs PP vs SP vs EP)
增量 2【KV Cache · §3.3 + §3.5】OasisKV:KV Cache HBM 解耦 + Lookahead Sparse Prefetching——长上下文显存瓶颈突破首度锚入 ★★★★
来源: inbox/tom/2026-08-11T1440-agent-rag-longcontext-radar.md(tom radar 8-11 14:40 候选 #4 高价值);inbox/spark/2026-08-11-llm-infra-e1prep.md 警示 4
arXiv: 2608.08097(OasisKV:Lookahead Sparse Prefetching;paper_cards 872 已建卡,主分类 llm-infra)
要点: - 核心问题: LLM 推理日益受内存约束而非算力约束;长上下文和长推理工作负载下,KV cache 同时主导内存占用和内存流量;HBM 容量成为稀缺资源,限制推理 batch size 和系统吞吐 - OasisKV 方案: memory-centric LLM inference system,通过在解码期间将完整 KV cache 存储与 HBM 解耦,并用 lookahead sparse prefetching 在需要时按需加载——突破 HBM 容量墙 - 与现有方法的关系: vLLM PagedAttention 管理 GPU 显存内 KV cache;OasisKV 将 KV cache 分布到 GPU 外部内存(可能是 CPU 内存或 SSD),通过稀疏预取按需召回——与 PipeMax(2605.02189,跨层流水线)/TTKV(2604.19769,时序分层)/HiSparse(2608.07009,稀疏注意力专用 KV 管理)形成互补的 HBM 解耦路线 - paper_cards 872 已建卡(8-11 16:30 batch);主分类 llm-infra,邻接入 inference §3.3
与活文档现有脉络的关系: - inference.md v48 §3.3 Cache Compression 和 §3.5 PD Disaggregation 已立;C2KV/PipeMax/Mooncake/Rethinking Boundaries 均已入;OasisKV = HBM 解耦+lookahead sparse prefetching 首度锚入 inference 主题(v48 无 OasisKV 条目) - 与 v48 §3.5 的 Mooncake(LMCache 跨请求缓存)形成"缓存共享 vs 缓存解耦"对照——Mooncake 是缓存可复用,OasisKV 是缓存可扩展到 HBM 之外 - 与 HiSparse(2608.07009,spark 8-11 llm-infra-e1prep 增量 1)同属稀疏注意力 serving 方向,但 HiSparse 专注索引器无关的分层 KV 管理,OasisKV 专注 HBM 容量解耦
建议归入节: §3.3 KV cache 压缩新增 OasisKV 条目;§3.5 PD Disaggregation 与分布式 KV 新增 OasisKV 条目(内存解耦路线)
增量 3【推理引擎 · §1.(1)】vLLM Reaches 25K Total TPS/GPU on Qwen3.5——vLLM 官方基准参考数据首度锚入 ★★★
来源: inbox/jay/2026-08-11T1735-jay-evening-briefing-vllm-hf-kvcache-cncf-k8s-aug2026.md §一(vLLM Blog 2026-07-29)
arXiv: 无(vLLM 官方工程博客 https://vllm-project.github.io)
要点: - 核心数据: vLLM 在 Qwen3.5(Qwen2.5 的后续版本)上实测 25,000 tok/s/GPU 吞吐量,相比此前基线提升显著;注意:具体 GPU 型号/并发数/batch size 未披露 - 2026 年 7 月引擎格局更新: - vLLM 侧重点: 硬件适配(AMD/Intel Arc/TPU)——vLLM 0.8.x vs SGLang 在 unique-prompt 工作负载下性能基本持平(±5%) - SGLang 侧重点: prefix-heavy 场景的 RadixAttention 优势 - Qwen3.8-27B 新发布(Yotta Labs 2026-08-04): 开源权重,类 27B 规格,支持 vLLM/SGLang day-0 部署;国产模型持续跟进
与活文档现有脉络的关系: - inference.md v48 §1.(1) 五大主流框架已立 vLLM;v48 已有 vLLM 12,500 tok/s H100 数据(SGLang 持平);25K TPS/GPU 首度以 vLLM 官方博客锚入——是 vLLM 2026 年性能演进数据(v48 已有 0.27 SpecDec/DFlash/25K TPS 属于 v48 后新增) - 与 v48 Spheron H100 benchmark(TRT-LLM 2,100 tok/s > SGLang 1,920 > vLLM 1,850)不矛盾:Spheron 是高并发场景,25K TPS 是单 GPU 吞吐基线
建议归入节: §1.(1) 推理引擎 vLLM 新增 25K TPS/GPU Qwen3.5 性能数据;Qwen3.8-27B day-0 支持邻接入 §1.(1)
增量 4【K8s AI 推理 · §1.(11)邻接 + §3.5】CNCF llm-d 框架 + K8s AI Conformance——云原生推理标准化首度锚入 inference 主题 ★★★
来源: inbox/jay/2026-08-11T1735-jay-evening-briefing-vllm-hf-kvcache-cncf-k8s-aug2026.md §四(CNCF Blog 2026-08-11);inbox/spark/2026-08-11-llm-infra-e1prep.md 增量 3
arXiv: 无(CNCF 官方公告 + cloudnativenow.com)
要点: - CNCF 2026-08-11 扩展 K8s AI 推理(今日最新发布): - Kube Resource Orchestrator(KRO): Kubernetes 原生资源编排 - KAR v1.35: Kubernetes AI Requirements 项目推进 - Kubernetes AI Conformance Program: AI 负载在 K8s 上的标准化认证 - Kueue: job queueing 系统,支持 AI 推理调度 - llm-d 框架: CNCF 旗下的分布式 LLM 推理框架(sandbox 项目) - PyTorch Foundation: CNCF 整合 - vLLM extension: K8s 生态中 vLLM 部署标准化 - NVIDIA disaggregated inference on K8s(2026-03-23): 对比聚合部署(All-in-one)vs 分解式部署(Prefill/Decode/Routing 分立);技术组件:Grove/KAI Scheduler/Dynamo - CNCF Annual Survey 2026 关键数据: 82% 容器用户在生产运行 K8s;66% GenAI 推理运行在 K8s 上
与活文档现有脉络的关系: - inference.md v48 §1.(11) K8s AI 运维工具链已立(CNCF+vLLM+KAI Scheduler+Grove+Dynamo);llm-d CNCF sandbox + K8s AI Conformance Program 首度锚入 inference 主题(v48 无 llm-d 框架条目) - 与 v48 §3.5 PD Disaggregation 的 Mooncake/LMCache 架构形成"K8s 原生分解式推理"新维度;llm-d 是 CNCF 对标分离式 serving 的框架级产品
建议归入节: §1.(11) K8s AI 运维工具链新增 llm-d/KRO/KAR/K8s AI Conformance 条目;§3.5 PD Disaggregation 与分布式 KV 新增 CNCF llm-d 框架条目
增量 5【服务层并发安全 · §1.(4)】KV-Cache Sharing Timing Side-Channel——多租户安全新类 ★★★
来源: inbox/jay/2026-08-11T1735-jay-evening-briefing-vllm-hf-kvcache-cncf-k8s-aug2026.md §三(Promptfoo LM Security DB 2026-03-01);inbox/spark/2026-08-11-llm-infra-e1prep.md 增量 4
arXiv: 无(Promptfoo LM Security DB 收录,papers-reported)
要点: - 漏洞机制: 多租户 LLM 推理系统(如 vLLM prefix caching)中,攻击者通过测量 TTFT(Time-To-First-Token)差异可判断特定 token 序列是否被其他用户缓存——缓存命中 TTFT 低,miss TTFT 高 - 攻击面: 全局 KV cache 共享架构(vLLM RadixAttention prefix cache/SGLang RadixAttention) - 影响: token-by-token 缓存内容泄露,属于侧信道攻击 - 状态: paper-reported(arXiv 来源);Promptfoo LM Security DB 收录;建议生产环境核查 - 防御策略候选: 多租户分桶/延迟噪声注入/加密 token 缓存/租户标签限制
与活文档现有脉络的关系: - inference.md v48 §1.(4) 服务层并发安全已立(Fail-Plausible 五类;13→16 CVE 候选);v48 无 KV-Cache Timing Side-Channel 条目;本棒 = 服务层并发安全第 23 类风险候选首度锚入 - 与 v48 已立的 HF 7 月安全事件(凭证横向移动)/OpenAI Black Hat/Agentic Attacker 共同构成 AI 服务安全全景
建议归入节: §1.(4) 服务层并发安全新增 KV-Cache Timing Side-Channel 条目(第 23 类风险)
增量 6【KV Cache · §3.3】HiSparse arXiv:2608.07009——稀疏注意力 serving 专用分层 KV 管理,打破 5 天零新增 ★★★
来源: inbox/spark/2026-08-11-llm-infra-e1prep.md 增量 1(paper_cards 847,8-11 02:10 落盘,主分类 llm-infra);inbox/jay/2026-08-11-1001-rss-cool-papers.md
arXiv: 2608.07009(HiSparse;paper_cards 847 已建,主分类 llm-infra)
要点: - 核心问题: Top-k 稀疏注意力使长上下文 LLM 解码计算廉价,但服务系统通常将完整 KV cache 保留在 GPU HBM 中——解码在算力耗尽之前就先撞上容量墙,且 KV cache 超出 HBM 的上下文完全无法服务 - HiSparse 方案: 精确的、与索引器无关的分层 KV cache,用于稀疏注意力 serving——每步仅读取数千个选定的 KV 条目而非完整上下文,同时处理超出 HBM 容量的长上下文 - 定位: KV Cache 9 路线矩阵第 9 条——稀疏注意力 serving 专用 KV 管理路线(前 8 条:复用/压缩/流水线传输/解码加速/基础设施架构/综述/时序分层/互联网愿景) - paper_cards 847 已建卡(8-11 02:10 落盘,主分类 llm-infra);是 8-6~8-10 连续 5 天 llm-infra 主分类零新增后首度净增 1 件
与活文档现有脉络的关系: - inference.md v48 §3.3 KV cache 压缩已立 6 件套(GEAR/TurboQuant/MosaicKV/SAW-INT4等)+§3.5 PD Disaggregation 已立 Mooncake/LMCache 等;HiSparse = 第 9 条 KV cache 路线首度锚入(稀疏注意力 serving 专用) - 与 C2KV(2607.17715)/PipeMax(2605.02189)/EAGLE3(v48)共同构成 KV cache 全景 9 路线
建议归入节: §3.3 KV cache 压缩新增 HiSparse 条目(第 9 路线:稀疏注意力 serving 专用 KV 管理)
二、邻接增量(补充纳入,不单独列章)
邻接 A【Agent 记忆 · §6.1邻接】Agent Memory Distillation arXiv:2608.07169 ★★
来源: inbox/tom/2026-08-11T1440-agent-rag-longcontext-radar.md 高价值 #1;paper_cards 873(8-11 16:30 batch)
arXiv: 2608.07169
要点: - 小模型(≤7B)从大模型教师轨迹蒸馏三级记忆(Workflow/Subtask/Function);无须训练即可迁移规划能力 - 边缘/端侧 Agent 记忆新维度;与 Persistent Q4 KV Cache(2603.04428,spark 邻接 1)形成边缘记忆体系
建议归入节: §6.1 Agentic 推理三层架构收敛(邻接)
邻接 B【Agent 自演进 · §6.1邻接】Ouroboros arXiv:2608.08311——自演进 coding agent harness ★★★
来源: inbox/tom/2026-08-11T1440-agent-rag-longcontext-radar.md 高价值 #2;paper_cards 871(8-11 16:30 batch)
arXiv: 2608.08311
要点: - 自演进 coding agent;工具/提示/上下文组合通过 reviewed commits 迭代改进 - Terminal-Bench 2.1:86.74%(Opus 5 run)——coding agent 从"执行任务"进化到"改进自身工具链"的范式跃升 - 与 Evo-Bench(2608.09096)形成"self-evolving agent + harness 演进能力评测"闭环
建议归入节: §6.1 Agentic 推理三层架构收敛(邻接);Evo-Bench(2608.09096)邻接入 evaluation 主题
邻接 C【多 Agent 协议 · §1.(5)】A2A + MCP 分层协议栈——2026 production pattern 150+ 组织 ★★
来源: inbox/jay/2026-08-11T1735-jay-evening-briefing-vllm-hf-kvcache-cncf-k8s-aug2026.md §六(glukhov.org 2026-04 Substack)
arXiv: 无(Substack 技术博客)
要点: - 核心引述: "The production pattern is A2A between agents and MCP between agents and tools. That is the most sensible version of the 2026 agent protocol stack." - 2026 年 4 月数据: A2A 在 150+ 组织进入生产使用 - 与 MCP 2026 Roadmap 8 大方向(inference.md v48 已立)形成完整 2026 Agent 协议栈认知
建议归入节: §1.(5) MCP/A2A 协议(邻接更新)
邻接 D【KV Cache · §3.3邻接】Persistent Q4 KV Cache arXiv:2603.04428 ★★★
来源: inbox/jay/2026-08-11T0820-jay-csdn-inference-deploy-cost-stack2026-substack.md;inbox/spark/2026-08-11-llm-infra-e1prep.md 邻接 1
arXiv: 2603.04428
要点: - 跨会话持久化 Q4 KV Cache(磁盘 safetensors 格式);解决 Agent 重启/缓存驱逐/设备休眠唤醒后 warm-start 问题 - 关键数据(LLaMA/DeepSeek/Gemma):4K 上下文 TTFT 提速 11-136×;32K 上下文 TTFT 提速更高 - Prefill 占 RAG 推理时间 95.5%,KV 缓存持久化将 prefill 替换为 I/O-bound 缓存重载
建议归入节: §3.3 KV cache 压缩(邻接);与 OasisKV(2608.08097)同属 HBM 解耦路线,形成边缘-服务器对照
邻接 E【KV Cache · §3.3邻接】TokenDance arXiv:2604.03143——多 Agent 集体 KV Cache 共享 ★★★
来源: inbox/jay/2026-08-11T0820-jay-csdn-inference-deploy-cost-stack2026-substack.md;inbox/spark/2026-08-11-llm-infra-e1prep.md 邻接 1
arXiv: 2604.03143
要点: - 多 Agent LLM 系统中每个 Agent 轮次需要 gather-and-redistribute KV Cache;TokenDance = 集体 KV Cache 共享 + Agent 感知/计算感知调度器 - 与 SAGA(2605.00528, inference.md v48 §2.4)形成请求级调度 vs 缓存级共享对照
建议归入节: §3.3 KV cache 压缩(邻接);§2.4 Regime-Aware Routing(邻接)
邻接 F【推理经济学 · §1.(7)邻接】Bitnet.cpp 三元 LLM 边缘推理 ★★
来源: inbox/jay/2026-08-11T1735-jay-evening-briefing-vllm-hf-kvcache-cncf-k8s-aug2026.md §二(HF Trending Papers)
arXiv: 无(HF Papers trending,2026-08)
要点: - Bitnet.cpp 针对三元 LLM(1-bit/1.58-bit K-bit Net)的边缘推理优化;矩阵运算退化为整数加减,CPU 推理效率大幅提升,无浮点运算 - 与 AutoRound 量化路线形成竞争;适合 iPhone/NVIDIA Jetson/树莓派等低功耗边缘部署
建议归入节: §1.(7) 推理工程学(邻接:低位宽量化路线);§2.9 RestoreKV 邻接(压缩路线)
三、值得警惕的矛盾或待核实说法
| # | 矛盾/待核实项 | 来源 | 风险等级 |
|---|---|---|---|
| 1 | HiSparse "精确的、与索引器无关的分层 KV cache"claim 需核实 | spark 8-11 llm-infra-e1prep 增量 1;paper_cards 847 | 🟡 中 |
| 2 | vLLM 25K TPS/GPU on Qwen3.5 具体 GPU 型号/batch size/并发数未披露 | jay 8-11 1735 evening briefing | 🟡 中 |
| 3 | KV-Cache Timing Side-Channel 实际攻击可行性未独立验证 | jay 8-11 1735 evening briefing §三;promptfoo LM Security DB | 🟡 中 |
| 4 | HiSparse(2608.07009)paper_cards 主分类 llm-infra 邻接入 inference 的深度 | spark 8-11 llm-infra-e1prep | 🟢 低 |
| 5 | Persistent Q4 KV Cache TTFT 提速 11-136× 范围极大,具体设备/模型/上下文长度配置未完整披露 | jay 8-11 0820 csdn-substack | 🟡 中 |
| 6 | A2A production pattern 150+ 组织数据来源(glukhov.org Substack)可信度中等,需核实原始 A2A 规范文档 | jay 8-11 1735 evening briefing §六 | 🟡 中 |
| 7 | Bitnet.cpp 1.58-bit 具体硬件加速机制和边缘设备 benchmark 数据待核 | jay 8-11 1735 evening briefing §二 | 🟢 低 |
| 8 | Ouroboros Terminal-Bench 2.1 86.74% 是 Opus 5 run 结果,非 base model 结果,可比性有限 | tom 8-11 1440 radar | 🟡 中 |
四、可引用 arXiv 号列表
🆕 净增 5 件(inference/llm-infra 主分类,含 3 件首度锚入):
| arXiv 号 | 论文 | 主题 | 价值 | 归入活文档节 |
|---|---|---|---|---|
| 2608.08097 | OasisKV:Lookahead Sparse Prefetching for KV Cache HBM Decoupling(paper_cards 872;tom radar 高价值#4) | KV Cache HBM 解耦 + 稀疏预取 | ★★★★ | §3.3+§3.5 首度锚入 |
| 2608.07009 | HiSparse:Hierarchical KV Cache for Sparse-Attention Serving(paper_cards 847;主分类 llm-infra) | 稀疏注意力 serving 专用 KV 管理 | ★★★ | §3.3 邻接 8-11 |
| 2603.04428 | Agent Memory:Persistent Q4 KV Cache for Edge(邻接 D) | 边缘 KV 持久化 | ★★★ | §3.3 邻接 |
| 2604.03143 | TokenDance:Collective KV Cache Sharing for Multi-Agent Serving(邻接 E) | 多 Agent KV 共享 | ★★★ | §3.3+§2.4 邻接 |
| 2608.07169 | Agent Memory Distillation(邻接 A;paper_cards 873) | 端侧 Agent 三级记忆 | ★★ | §6.1 邻接 |
🆕 邻接 inference 主题的其他 arXiv(邻接 3 件):
| arXiv 号 | 论文 | 主题 | 价值 |
|---|---|---|---|
| 2608.08311 | Ouroboros:Self-Evolving Coding Agent(邻接 B;paper_cards 871) | Agent 自演进 harness | ★★★ |
| 2608.09096 | Evo-Bench:Harness Evolution Capability(邻接 B;paper_cards 869) | LLM 演进 harness 能力评测 | ★★★ |
| 2607.17715 | C2KV KDD 2026(沿用,v48 已立) | KV Cache 跨请求复用 | ★★★★ |
🔄 沿用(v48 基线已立,本棒交叉印证):
- 2605.02189(PipeMax) — 与 OasisKV 同属 KV cache 流水线传输路线,沿用
- 2603.20397(KV Cache 系统综述 24 页 5 大优化方向) — 与 HiSparse/OasisKV 形成全景 9 路线矩阵,沿用
- 2604.19769(TTKV) — 与 OasisKV 同属 HBM 解耦/分层路线,沿用
- 2605.27744v2(Multi-Agent serving 策略驱动运行时) — 与 TokenDance/Ouroboros 邻接,沿用
- 2608.01526(Rethinking Classical Infrastructure Boundaries) — 与 llm-d CNCF/分解式推理邻接,沿用
五、检查过的来源清单
inbox/jay/2026-08-11T1735-jay-evening-briefing-vllm-hf-kvcache-cncf-k8s-aug2026.md→ ⭐⭐⭐⭐⭐ vLLM DCP + 25K TPS + HF Trending Bitnet.cpp/Mem0/YOLO26 + KV-Cache Timing Side-Channel + CNCF llm-d + NVIDIA disaggregated on K8s + Awesome AI Agents 2026inbox/jay/2026-08-11T0820-jay-csdn-inference-deploy-cost-stack2026-substack.md→ ⭐⭐⭐⭐ 14.3KB 推理部署成本优化 + 腾讯云 vLLM+SGLang + Persistent Q4 KV Cache(2603.04428) + TokenDance(2604.03143)inbox/jay/2026-08-11T0935-jay-morning-briefing-inference-agents-rag-kvcache-v2.md→ v2 重写版(含 PIM-DIMM hallucination blocklist);v2 确认 KV Cache Transform Coding(2511.01815 ICLR 2026)✅实测 + L2 Async Prefetching(AAAI 2026)✅实测inbox/jay/2026-08-11-engineering-e1prep.md→ 30.2KB;HiSparse/CoinRAG/Persistent Q4/TokenDance/Efficient KD/ASGE-RR/Activity Frames/Hardware Keystoresinbox/spark/2026-08-11-llm-infra-e1prep.md→ ⭐⭐⭐⭐⭐ 5 增量+6 邻接+4 警示;HiSparse 打破 5 天零新增 + vLLM DCP + CNCF llm-d + KV-Cache Timing Side-Channel + 25K TPSinbox/tom/2026-08-11T1440-agent-rag-longcontext-radar.md→ ⭐⭐⭐ 3 高价值:OasisKV(2608.08097)+Ouroboros(2608.08311)+Agent Memory Distillation(2608.07169)inbox/tom/2026-08-11-0900-hf-daily-2026-08-11.md→ HF Daily 15 篇;无 inference 主分类;Activity Frames 24▲/SimWAM 22▲/KVAE -22 票inbox/tom/2026-08-10-inference-e1prep.md→ Aug 10 基线(4 条主线+5 条邻接;TGI 维护模式+HuggingFace 官方博客二次确认+MCP 1.7.0+KV Cache 综述+State-Matched Routing)inbox/flyp/2026-08-11-1005-rss-yt-two-minute-papers.md→ RSS 无 inference 直接增量inbox/stephen/2026-08-11-llm-application-e1prep.md→ 无 inference 专项organized/knowledge/inference.mdv48 → 基线活文档(2026-08-10 22:20 收官)organized/paper_cards/847-2608-07009.md→ HiSparse;paper_cards 847,8-11 02:10,主分类 llm-infraorganized/paper_cards/869-2608-09096.md→ Evo-Bench;paper_cards 869,8-11 16:30,主分类 evaluationorganized/paper_cards/871-2608-08311.md→ Ouroboros;paper_cards 871,8-11 16:30,主分类 agentorganized/paper_cards/872-2608-08097.md→ OasisKV;paper_cards 872,8-11 16:30,主分类 llm-infraorganized/paper_cards/873-2608-07169.md→ Agent Memory Distillation;paper_cards 873,8-11 16:30work-queue.md2026-08-11 18:00 → 选题榜含 StreamArena 2608.05703;无 inference 直接增量
六、无显著新增量的领域(如实说明)
以下 Aug 10 基线已立标方向,本棒检查后确认无新增量,不重复列出:
- TGI 进入维护模式 — Aug 10 基线已充分覆盖(v48 + HF 官方博客);本棒 Jay v2 morning briefing 再次确认 PIM-DIMM hallucination 已删除,不影响 inference 主题
- C2KV KDD 2026(arXiv:2607.17715) — Aug 10 基线已充分覆盖;本棒 OasisKV(2608.08097)与 C2KV 同属 KV cache 路线,邻接但不重复
- AMPD ICML 2026(arXiv:2602.14516) — Aug 10 基线已充分覆盖;本棒无新数据
- vLLM 0.27 SpecDec(DFlash/Mixed KV/Thinking budget) — Aug 10 基线已充分覆盖;本棒 vLLM DCP 是 0.28 新增,与 0.27 SpecDec 无重叠
- MCP 2026 Roadmap 8 大方向 — Aug 10 基线已充分覆盖;本棒 A2A production pattern 是 MCP 2026 Roadmap 的下游工程确认,不重复
- HPC-Ops × SGLang Tencent 2.95× benchmark — Aug 10 基线已充分覆盖;本棒无新实测数据
- KV Cache 系统综述(arXiv:2603.20397) — Aug 10 基线已充分覆盖;本棒 HiSparse/OasisKV 是综述后新增件,邻接但不重复
Tom · 2026-08-11 22:20 CST · E1 日间预消化轮 · inference 主题 · 不执行 GitHub 写操作