inference · E1 预消化简报(2026-08-01)

执行人: Tom · E1 日间预消化轮(inference 主题) 覆盖时段: 2026-07-31 22:00 → 2026-08-01 22:00(约 24 小时) 基线: organized/knowledge/inference.md(2026-08-01 更新 · Lossy Verification + ACL SpecVerif + TGI EOL 校正 + vLLM Conf 2026-08-25 · 十节 · 引用→123) 基线快照(昨日 E1 收官状态): inference.md §1 已收五大框架(TGI 2026-03-21 EOL/Colibri/LMDeploy)+vLLM Conf 2026-08-25+vLLM AI Blog 1,918 commits/月+1,300万CI minutes;§2.1 已收 PagedAttention 2.0 + vLLM MRV2 + SGLang v0.6(DSpark/DFlash+SpecV2/ReplaySSM 6.4×/GLM-5.2 DSA/PD Disagg);§2.2 调度已收 OmniServe + Blink + Disagg 5 节点;§2.3 KV cache 已收 KVServe/SpectrumKV + LMCache;§3 投机解码已收 EAGLE3/DFlash+SpecV2/QuantSpec/VeriCache + arXiv:2607.26627 Lossy Verification;§8 共识/争议已收 TGI EOL 校正+vLLM 1,918 commits 工程规模 检查来源: work-queue.md + inbox/jay/(2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026 22.2KB GoodServe+AMPD+LLM-MathOpt+AIConfigurator+Workload-Router-Pool+Fluid-Guided 6件套 · 2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb 21.7KB DUAL-BLADE+Shadow-in-Cache+MCP2+ByteByteGo+LilianWeng+LLaMA-Stack+MirrorCode · 2026-08-01T1735-jay-inference-engines-open-llms-2026 21.1KB vLLM/SGLang/TGI/TensorRT-LLM H100 benchmark+2026模型格局+Kimi-K3/DeepSeek-V4 · 2026-08-01T1950-jay-kvcache-vecdb-rag-2026 19.6KB KV-Cache-TransformCoding+Harvest+Agent-Memory+Token-Operations四层+Particula-SGLang-29% · 2026-08-01-engineering-filter-arxiv-inference-harness 10.6KB AMPD+LAAR+SuperInfer+KernelSight+FlashKDA+ECC+superpowers+jcode · 2026-08-01T2105-jay-evening-five-category-briefing 5件 · 2026-08-01-csdn-substack-weekly · 2026-08-01T1220-jay-csdn-rag-agent-moe-2026 · 2026-08-01T1620-jay-csdn-rag-agent-tensorrt-deploy) + inbox/tom/(2026-08-01-0900-hf-daily-2026-08-01 · 2026-08-01-1003-rss-yt-yannic-kilcher · 2026-08-01-1004-rss-yt-lex-fridman · 2026-08-01-evaluation-e1prep · 2026-08-01-rag-e1prep · 2026-08-01-agent-rag-longcontext-radar · 2026-08-01T1440-agent-rag-longcontext-radar-v2 · 2026-08-01T2040-agent-rag-longcontext-radar) + inbox/spark/(2026-08-01-llm-infra-e1prep · 2026-08-01-agent-e1prep · 2026-08-01-1001-rss-gradient-flow · 2026-08-01-1002-rss-chip-huyen · 2026-08-01-1004-rss-yt-3blue1brown) + inbox/flyp/(2026-08-01-multimodal-e1prep · 2026-08-01-risk-e1prep · 2026-08-01-1550-ShadowDancer-See2Think · 2026-08-01-1030-sat-adversarial-review-rag · 2026-08-01-1000-rss-cameron-wolfe · 2026-08-01-1001-rss-interconnects · 2026-08-01-1003-rss-yt-two-minute-papers · 2026-08-01-1004-rss-yt-ai-explained · 2026-08-01-0950-shadowdancer-comem-vla-and-depth-memory) + paper_cards/(682-688 共7张新卡;主分类 inference-systems 0张;主分类 llm-infra 0张;其余677 RAG/684 evaluation/686 agent 均为其他主题) 性质: 预消化简报 · 不重写活文档 · 供今晚活文档接力参考


0. 综述判断

本场 inference 主题 24h 窗口增量性质:中密度(6 主线 + 2 旁证 + 1 警示)。

本场新增 paper_cards 0 张(主分类 inference-systems 连续第 2 个零新增日),但 inbox 层面 inference 相关工程和系统论文涌入量大、质量高,是近 5 个 E1 周期中工程密度最高之一。本场核心增量集中在三个维度:① Jay 多棒战场(1335/1505/1735/1950)产出 6 件套 arXiv inference-systems 新论文——GoodServe(E2E-SLO goodput)、AMPD(multi-round PD 分 离)、LAAR(NUMA-aware long-context routing)、Token-Operations 四层架构、Harvest(P2P GPU cache)、Agent Memory(edge Q4 KV)——其中 GoodServe/AMPD/LAAR 为 inference.md 未收录的全新节点;② MCP 2.0(2026-07-28 正式发布)无状态协议对 agentic inference 架构的影响(Lilian Weng Harness Engineering + ByteByteGo OpenAI Agent Loop 为证);③ 工程筛选保留的 GitHub Trending 高价值 inference/agent-harness 项目(FlashKDA + ECC + superpowers + jcode)。本场是近一个月来 inference 系统论文密度最高的一个 E1 周期,建议今晚接力优先处理 GoodServe/AMPD/LAAR 三篇的 §2 入位。


1. 核心增量(6 主线,按建议归位节排序)

增量 1【调度 §2.2 / Agent生产推理 §7】GoodServe arXiv:2605.16867:Agentic LLM 推理的 E2E-SLO Goodput 调度(★★ 建议补)

来源: inbox/jay/2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026.md A1 + inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md ✅保留条目

arXiv:2605.16867 核心展开

  • 核心问题:Agentic LLM 推理有明确的端到端延迟 SLO 要求(E2E-SLO),系统需最大化 goodput(满足 SLO 的请求比例)。现有 batched serving 模式下 request-rr 在 GPU 上的实际执行效率受 token 形状(LinL 和 LoutL)和竞争请求共同影响,难以精确计算
  • 关键技术贡献: 1. 问题建模:在 GPU 异构资源上调度 agentic LLM 推理,将 GPU 组合作为输入条件而非优化目标(与 SageServe、llm-d 互补) 2. Goodput 定义:满足 SLO 的请求比例(区别于 pure throughput) 3. 在线调度框架:异构 GPU 资源下最大化 goodput 的算法
  • 与 llm-d/CNCF 的互补关系:llm-d 是 K8s 协调层解决跨实例调度;GoodServe 是单节点 GPU 组合优化;两者互补
  • arXiv: https://arxiv.org/abs/2605.16867v1

与活文档关系:inference.md §2.2 调度已收 OmniServe(CPU-GPU 异构)+ Blink(CPU-Free)+ Disagg 5 节点 + 9 学派;§7 Agent 生产推理已收 Memory for LLMs 综述;但 GoodServe arXiv:2605.16867(E2E-SLO goodput 调度 + agentic inference 专属)与 llm-d/SageServe 互补关系未入位

建议归入:§2.2 调度(新增「GoodServe arXiv:2605.16867:Agentic LLM 推理 E2E-SLO Goodput 调度 · GPU 异构资源 goodput 最大化 + GPU 组合作为输入条件 · 与 SageServe/llm-d 互补」小节)+ §7 Agent 生产推理(邻接,agentic 推理 SLO 保障的调度层支撑);新增 C117 共识候选:"Agentic 推理 SLO 保障 = GoodServe goodput 调度(单节点)+ llm-d(K8s 协调层)+ vLLM MRV2 streaming parser(模型执行层)三层协同";新增 O173 试金石:"GoodServe goodput 最大化 vs vLLM continuous batching 在真实 agentic 工作负载(SWE-bench/BFCL)下的 SLO 达标率对照"


增量 2【调度 §2.2 / 选型决策树 §2.13】AMPD arXiv:2602.14516v2:Multi-round Disaggregated LLM Serving(ReAct Agent 场景专项)(★★ 建议补)

来源: inbox/jay/2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026.md A2 + inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md ✅保留条目

arXiv:2602.14516v2 核心展开

  • 核心问题:多轮 LLM 推理(ReAct 风格 agent)中,prefill 和 decode 工作负载交替出现——传统 co-location 或固定 PD 分离策略均无法高效适应这种交错模式
  • AMPD 方案: 1. 自适应路由机制(Adaptive Routing):根据运行时 prefill/decode 负载动态分配资源 2. Prefill 重新排序策略(Prefill Reordering Policy):平衡 prefill 和 decode 负载 3. 与 Dynamo(NVIDIA 固定 PD 分离)的对比:Dynamo 是静态分离,AMPD 是动态分 离
  • 对比基线:vLLM(PD co-location)、NVIDIA Dynamo(固定 PD 分离)
  • 目标基准:SWE-Bench、BFCL 等 agent 基准
  • arXiv: https://arxiv.org/abs/2602.14516v2

与活文档关系:inference.md §2.2 调度已收 Disagg 5 节点(O1/Continuum/Mooncake/Aegis/Tita);但 AMPD arXiv:2602.14516v2(Multi-round 自适应 PD 分离 + prefill reorder 策略 + ReAct agent 场景专项)未入位

建议归入:§2.2 调度(扩展 Disagg 节点,新增「AMPD arXiv:2602.14516v2:Multi-round 自适应 PD 分离 · Adaptive Routing + Prefill Reordering · 动态适应 prefill/decode 交替模式 · 对比 vLLM co-location / Dynamo 固定分离 · 目标 SWE-Bench/BFCL」);新增 O174 试金石:"AMPD prefill reorder 策略迁移到 vLLM/SGLang 的可行性;AMPD vs Dynamo 在真实多轮 agent 工具调用工作负载下的端到端延迟分布"


增量 3【调度 §2.2 / 系统栈 §2.10】LAAR arXiv:2604.15732v1:Long-Context-Aware NUMA-Aware 分布式 LLM 路由(GH200 实测)(★ 建议补)

来源: inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md ✅保留条目 + inbox/jay/2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026.md A2 相关

arXiv:2604.15732v1 核心展开

  • 核心问题:Long-context 场景下 GPU-CPU 之间的 NUMA 内存访问成为分布式 LLM serving 的瓶颈(GH200 NVL2 配置:144GB HBM + 480GB DRAM)
  • 关键工程实现: 1. NUMA亲和性配置numactl 控制 NUMA memory affinity(GH200 真实环境) 2. Envoy EPP Filter 实现:作为 External Processing Filter 策略实现,接入 llm-d MaxScorePicker 3. 路由逻辑:提取 request feature → 评估 Q(m,x) 成功率和 L(m,x) 延迟 → 选最低 cost 端点
  • 硬件平台:NVIDIA GH200 NVL2(144GB HBM + 480GB DRAM)
  • 工程信号:long-context 场景下 cache locality + load-aware routing 的生产级实现路径
  • arXiv: https://arxiv.org/abs/2604.15732v1

与活文档关系:inference.md §2.2 调度已收 Disagg 5 节点;§2.10 系统栈(硬件/网络/存储)已收;但 LAAR arXiv:2604.15732v1(NUMA-aware routing + GH200 实测 + Envoy EPP 接入 llm-d)未入位

建议归入:§2.2 调度(新增「LAAR arXiv:2604.15732v1:Long-Context NUMA-Aware 分布式路由 · numactl NUMA 亲和性 + Envoy EPP filter 接入 llm-d MaxScorePicker · GH200 NVL2 实测 · 适合 long-context RAG/多文档推理场景」小节)+ §2.10 系统栈(邻接,NUMA 内存架构层);新增 O175 试金石:"LAAR 在 1M context 实测 GH200 vs A100/H100 的路由收益差异;numactl 配置在非 GH200 平台的通用性"


增量 4【推理优化 §2.5 / 系统栈 §2.10】Token-Operations Oriented Inference Optimization 四层架构 arXiv:2606.20295v1(★ 建议补)

来源: inbox/jay/2026-08-01T1950-jay-kvcache-vecdb-rag-2026.md E4

arXiv:2606.20295v1 核心展开

  • 四层架构框架
  • Layer 1 Multi-model Fusion:模型能力量化、智能路由、级联、集成
  • Layer 2 Model Optimization:Attention 改进、MoE、CoT、KV Cache 压缩、投机解码、量化、蒸馏
  • Layer 3 Compute-Model Fusion:算子融合、内存访问优化、基础算子加速、引擎参数调优
  • Layer 4 Compute-Network-Model Fusion:多节点并行、KV Cache 集群调度、粘性会话路由、语义缓存复用、动态批处理
  • 重要背景数据:中国国家数据局 2026 年 3 月数据——中国日均 token 处理量已超 140 万亿(年化约 5 京),说明为什么 token 成本优化在中国是工程优先问题
  • 新技术点名(2026 ICLR/SOSP): | 技术 | 出处 | 说明 | |------|------|------| | P-EAGLE | 2026(替代 EAGLE)| 并行预测多个 draft token,集成到 vLLM | | SPEED-Bench | 2026 | 多语义域投机解码评估框架 | | MeanCache | ICLR 2026(中国联通)| Jacobian-Vector Product 区间平均速度 + 轨迹稳定性调度 | | Cortex | Wang et al. 2026 | 超大规模分布式语义感知映射 + 边缘智能预取 |
  • arXiv: https://arxiv.org/abs/2606.20295v1

与活文档关系:inference.md §2.5 稀疏注意力/系统协同优化已收;但 Token-Operations 四层架构全景图(含 P-EAGLE/MeanCache/Cortex/140T tokens/day 中国数据)未作为独立全景节点入位

建议归入:§2.5(或新增 §2.11 推理优化全景图节):新增「Token-Operations Oriented Inference arXiv:2606.20295v1 四层架构:Multi-model Fusion → Model Optimization → Compute-Model Fusion → Compute-Network-Model Fusion · 中国日均 140T tokens(2026-03)· P-EAGLE/MeanCache/Cortex 2026 新技术 · 作为 LLM 推理优化全景图框架基础」小节;新增 O176 试金石:"Token-Operations 四层在国产算力(昇腾)环境下的适用性;MeanCache 在 vLLM 的集成可行性"


增量 5【KV Cache §2.3】Harvest P2P GPU Cache 共享 arXiv:2602.00328v1:生产集群 GPU 利用率 43.48% 实证(★ 建议补)

来源: inbox/jay/2026-08-01T1950-jay-kvcache-vecdb-rag-2026.md E3 + inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md ✅保留条目(与 SuperInfer/KernelSight 并列)

arXiv:2602.00328v1 核心展开

  • 核心问题:GPU 显存利用率低(生产集群平均 43.48%,中位数 28.78%),大量 GPU 内存在等待时闲置。传统 vLLM 单机 KV Cache 无法跨节点复用
  • Harvest 方案: 1. 机会主义 P2P GPU Cache 共享:利用其他 GPU 的空闲显存存储 KV Cache 2. 跨节点 KV Cache 传输:测了 DeepSeekV3、Mistral-Large-3-675B、Kimi-K2 三种模型的 KV Cache 传输时间 3. 与 vanilla vLLM CPU swap 对比:显著降低延迟
  • 关键数据(FlexPipe 两大云厂商两周实测)
  • 平均 GPU 显存利用率:43.48%
  • 中位数:28.78%
  • 38.44% 的采样落在 10-30% 利用率区间
  • 这组数据是截至 2026-08 最新、最系统的生产集群 GPU 利用率实证
  • arXiv: https://arxiv.org/abs/2602.00328v1

与活文档关系:inference.md §2.3 KV cache 14 件套已收 LMCache/Mooncake/HyMCache;但 Harvest arXiv:2602.00328v1(P2P GPU cache 共享 + 生产集群 43.48% GPU 利用率实证 + DeepSeekV3/Mistral-Large-3/Kimi-K2 传输时间)未入位

建议归入:§2.3 KV cache(新增「Harvest arXiv:2602.00328v1:P2P GPU Cache 共享 · 生产集群平均 GPU 利用率 43.48%/中位数 28.78% 实证 · 38.44% 落在 10-30% 利用率区间 · 机会主义跨节点 KV Cache 复用 · 对比 vanilla vLLM CPU swap · 适合多租户/多用户 GPU 资源共享场景」小节);新增 C118 共识候选:"生产 LLM 推理 GPU 平均利用率约 43% = 大量 GPU 在空转;Harvest P2P 共享适合多租户/跨用户场景;单机 vLLM KV Cache 节点内前缀复用适合单用户多轮";新增 O177 试金石:"Harvest 在 DeepSeek V4/Mistral-Large-3-675B/Kimi-K2 上的 KV Cache 传输时间实测;P2P 共享在多租户环境的安全隔离边界"


增量 6【KV Cache §2.3 / Agent生产推理 §7】Agent Memory 持久化 Q4 KV Cache arXiv:2603.04428v1:Edge 设备多轮推理冷启动优化(★ 建议补)

来源: inbox/jay/2026-08-01T1950-jay-kvcache-vecdb-rag-2026.md E2 + inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md ✅保留条目

arXiv:2603.04428v1 核心展开

  • 核心问题:Edge 设备(手机/笔记本)上的多轮 Agent 推理,每次重启后 KV Cache 全部丢失,冷启动 TTFT 代价极高——论文实测 15.7s = 78.5s dead time(总计)
  • 方案: 1. 跨会话持久化 KV Cache 到 disk(safetensors 格式) 2. 支持 cache eviction 和 device sleep/wake 循环后的 warm-start 3. Q4(INT4)压缩减少存储开销
  • 关键数据(论文实测)
  • vllm-mlx 在 Apple Silicon 上比 llama.cpp 吞吐高 21-87%(MLX 框架优势)
  • 本系统与 vllm-mlx 正交,解决的是跨会话持久化而非 prefix caching
  • 与 OpenClaw 本地节点场景关联:Anan 的 OpenClaw 支持 node 部署,Agent Memory Q4 KV Cache 方案有直接参考价值
  • arXiv: https://arxiv.org/abs/2603.04428v1

与活文档关系:inference.md §2.3 KV cache 已收 LMCache/HyMCache/Mooncake;§7 Agent 生产推理已收 Memory for LLMs;但 Agent Memory arXiv:2603.04428v1(Edge Q4 KV Cache 持久化 + 78.5s dead time 实测 + warm-start)未入位

建议归入:§2.3 KV cache(新增「Agent Memory arXiv:2603.04428v1:Edge 设备 Q4 KV Cache 持久化 · 冷启动 15.7s/78.5s dead time 实测 · safetensors 格式跨会话持久化 + sleep/wake warm-start + INT4 压缩 · vllm-mlx 21-87% vs llama.cpp on Apple Silicon · 适合 OpenClaw node 本地部署场景」小节)+ §7 Agent 生产推理(邻接,edge agent 冷启动优化);新增 O178 试金石:"Agent Memory 在 OpenClaw node 上的实测 warm-start TTFT 改善;vllm-mlx 跨设备 KV Cache 格式兼容性"


2. 旁证(2 条)

旁证 1【Agent生产推理 §7 / 推理协议 §4】MCP 2.0(2026-07-28)+ Lilian Weng Harness Engineering + ByteByteGo OpenAI Agent Loop——Agentic 推理架构三层栈(★★)

来源: inbox/jay/2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb.md B1/B3/B4(⭐⭐⭐⭐⭐)+ inbox/jay/2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026.md S3/S4

三条来源综合展开

MCP 2.0 无状态协议(2026-07-28 官方发布): - 废除 initialize/initialized 握手和 Mcp-Session-Id header - 每个请求独立携带协议版本、客户端身份、客户端能力(放在 _meta 中) - 任何请求可路由到任何服务器实例,支持原生 round-robin 负载均衡 - MRTR(Multi Round-Trip Requests):替代 server-initiated 双向流 - 攻击面新增:Handle Hijacking(模型可见字符串可被 echo 和传递) - 工程行动项:网关升级传递 Mcp-Method/Mcp-Name header;审查基于 session 的状态管理是否需迁移到 handle 模式

Lilian Weng Harness Engineering(2026-07-04): - Harness 定义:Harness = LLM + Memory + Tools + Planning + Action + Workflow Design + Eval + Permission Controls + Persistent State - 三大设计模式:Workflow Automation(Goal-oriented loop)、File System as Persistent Memory、Sub-agent and Backend Jobs - Coding Agent 工具集参考:文件系统/Shell/IO/LSP/git/MCP tools/Web/Artifacts/Backend 进程/Agent 委托

ByteByteGo OpenAI Agent Loop(2026-08-01 今日新): - Harness → API → Inference 三层架构 - Harness 层:Persistent WebSockets、Stable prompt prefixes、Deferred tool discovery、Code Mode - API 层:Tokenize only delta、Parallel safety checks(race 机制) - Inference 层:Cache-aware routing、KV cache lifecycle management、Speculative decoding、PD separation

综合信号:MCP 2.0 无状态化 + Lilian Weng Harness 定义 + ByteByteGo OpenAI 实证,共同指向 agentic inference 架构正在收敛至「Harness 编排层 + 无状态协议 + GPU 推理层」三层栈

建议归入:§7 Agent 生产推理(新增「MCP 2.0 + Lilian Weng Harness + ByteByteGo OpenAI Agent Loop = Agentic 推理三层架构收敛:Harness 编排层(无状态 MCP 2.0 协议)+ 无状态协议层(round-robin 负载均衡)+ GPU 推理层(KV cache/speculative decoding)」小节);新增 O179 试金石:"MCP 2.0 handle hijacking 在生产环境中的实际风险边界;Lilian Weng 三大 Harness 模式在 vLLM/SGLang 中的工程实现差异"


旁证 2【推理引擎 §1 / 系统栈 §2.10】SuperInfer GH200 Superchip 推理 + KernelSight-LM Kernel 级推理仿真器(★)

来源: inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md ✅保留条目

SuperInfer arXiv:2601.20309v2 核心: - 硬件 testbed:NVIDIA GH200 NVL2(144GB HBM + 480GB DRAM) - 软件基线:vLLM v0.6.6.post1(V1 engine)、TensorRT-LLM v1.1.0 - 核心问题:KV cache 耗尽时的 HOL blocking → GPU-CPU via NVLink-C2C offloading 方案 - TTFT/TBT SLO 严格目标下的性能数据 - 工程信号:Superchip 架构下 KV cache offloading 的最新生产系统设计

KernelSight-LM arXiv:2606.28565v1 核心: - 对比框架:Vidur(离散事件仿真)、AIConfigurator(算子级表插值) - Benchmark 数据:GB200 上 Tier B vs AIConfigurator 对比表 - 场景:新 GPU 型号或新模型 variant 的性能预测,不需要每次都做完整 profiling - 解决痛点:procurement 前无法实测的工程规划问题

建议归入:§2.10 系统栈(新增 SuperInfer GH200 KV offloading + KernelSight-LM 容量规划工具);新增 O180 试金石:"KernelSight-LM vs Vidur 在 procurement 场景的选型建议;GH200 NVL2 vs H100 在 KV cache offloading 上的实测收益差异"


3. 值得警惕的矛盾或待核实说法

# 矛盾/待核实项 来源 风险级别 建议行动
1 GoodServe arXiv:2605.16867 机构/作者信息模糊(jay 1335 briefing 标注"具体机构待确认") jay 1335 briefing 🟡 待核实 核验 arXiv 原文作者/机构
2 LAAR arXiv:2604.15732v1 Envoy EPP 实现:需确认是否已开源及与 llm-d MaxScorePicker 的具体集成方式 jay engineering-filter 🟡 待核实 LAAR GitHub 仓库 + llm-d EPP 文档
3 Harvest arXiv:2602.00328v1 生产集群 GPU 利用率 43.48%:两大云厂商是哪两家?数据是否有选择性偏差? jay 1950 briefing 🟡 待核实 FlexPipe 原始报告
4 Token-Operations arXiv:2606.20295v1 P-EAGLE/MeanCache/Cortex 2026 新技术:部分来自"2026 ICLR/SOSP"标注,具体会议归属需核实 jay 1950 briefing 🟡 待核实 各技术原始 arXiv
5 AMPD arXiv:2602.14516v2 vs NVIDIA Dynamo 2026 对比数据:jay 1335 briefing 标注"具体数据需精读原文",建议交叉验证 jay 1335 briefing 🟡 待核实 AMPD 原论文 §4 实验数据
6 KernelSight-LM arXiv:2606.28565v1 "Tier B"指 GB200 的哪个配置:Tier A/B/C 分类体系需核验 jay engineering-filter 🟡 待核实 KernelSight-LM 原文 §2

4. 本次涉及 arXiv 号列表

arXiv 号 论文/主题 增量归属 建议归位节
2605.16867v1 GoodServe Agentic LLM Goodput 调度(E2E-SLO · 2026-05 · jay 1335 ★★) 增量 1 §2.2 调度 / §7 Agent 生产推理
2602.14516v2 AMPD Multi-round Disaggregated LLM Serving(ReAct agent · jay 1335 ★★) 增量 2 §2.2 调度 / §2.13 选型决策树
2604.15732v1 LAAR Long-Context NUMA-Aware Routing(GH200 · jay eng-filter ★) 增量 3 §2.2 调度 / §2.10 系统栈
2606.20295v1 Token-Operations Oriented Inference 四层架构(jay 1950 ★) 增量 4 §2.5 推理优化全景图
2602.00328v1 Harvest P2P GPU Cache 共享(43.48% GPU 利用率 · jay 1950 ★) 增量 5 §2.3 KV cache
2603.04428v1 Agent Memory Edge Q4 KV Cache 持久化(jay 1950 ★) 增量 6 §2.3 KV cache / §7 Agent 生产推理
2601.20309v2 SuperInfer GH200 Superchip Inference(旁证 2) 旁证 2 §2.10 系统栈
2606.28565v1 KernelSight-LM Kernel级推理仿真器(旁证 2) 旁证 2 §2.10 系统栈
2511.01815 KV Cache Transform Coding(ICLR 2026 · 已在 jay 1950 覆盖,Jay 傍晚档已收录,inference.md §2.3 尚未确认入位) 横向参照 §2.3 KV cache
2605.16867 GoodServe(同上,仅重列) §2.2
2604.26557 DUAL-BLADE NVMe KV offloading(NDSS 2026 · jay 1505 B2) 横向参照 §2.3 KV cache
2508.09442 Shadow in the Cache KV-cache 隐私安全(NDSS 2026 · jay 1505 B2) 横向参照 §2.6 安全
2603.12831 OmniServe(已在 inference.md §2.2) §2.2
2606.29708 KVServe(已在 inference.md §2.3) §2.3
2606.08635 SpectrumKV(已在 inference.md §2.3) §2.3
2604.11001 Flow-Controlled Scheduling(已在 inference.md §2.2) §2.2
2604.07609 Blink CPU-Free(已在 inference.md §2.1) §2.1
2607.26627 Lossy Verification(已在 inference.md §3/§8) §3/§8
2607.19712 RLHF C++/ONNX(已在 inference.md §5) §5

5. 已检查来源清单

以下来源经本次扫描确认无 inference 主题新增或已在上方增量中覆盖,避免重复检索:

  • inbox/jay/2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026.md主要来源:已提取 A1 GoodServe + A2 AMPD + A3 LLM-MathOpt(§2.13 已有选型树 v2)+ A4 AIConfigurator(已有 AIConfigurator 多框架配置)+ A5 Workload-Router-Pool(vLLM semantic routing,愿景类)+ A6 Fluid-Guided(已在 inference.md §2.3);S1 The AI Engineer(TGI 维护已在 7-31 E1 覆盖);S2 WTF In Tech(工程经济学 newsletter);余为 vecdb/模型/其他主题归档
  • inbox/jay/2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb.md主要来源:B1 MCP 2.0(归入旁证 1)+ B3 Lilian Weng Harness(归入旁证 1)+ B4 ByteByteGo OpenAI Agent Loop(归入旁证 1)+ B2 DUAL-BLADE/Shadow-in-Cache(横向参照);C1 MCP 2.0 云原生影响(归档);CS1 企业 Agent 工程化(其他主题);CS2 vLLM 投机解码源码(CSDN);R1 MirrorCode(coding benchmark);R2 X Tech Radar(robotic/encoder/PDF 解析)——无 pure inference 新增
  • inbox/jay/2026-08-01T1735-jay-inference-engines-open-llms-2026.md主要来源:D1 推理引擎 H100 benchmark(Spheron/YottaLabs/DeployBase)+ D3 2026 模型格局(Kimi K3/DeepSeek V4/GLM 5.2/Gemma 4 ——均已在 inference.md §2.1 覆盖);D4 HF State of Open Source(已在 agent 侧覆盖);D5/D6 AI Engineer 职位需求(engineering 主题);D9 向量数据库选型(database 主题归档)
  • inbox/jay/2026-08-01T1950-jay-kvcache-vecdb-rag-2026.md主要来源:E1 KV Transform Coding(横向参照,§2.3 待补)+ E2 Agent Memory(增量 6)+ E3 Harvest(增量 5)+ E4 Token-Operations 四层(增量 4)+ E9 SGLang vs vLLM 差异(已在 7-30 E1 覆盖);E6 8周生产 LLM(engineering);E7/E8 RAG 评估工具(rag 主题)
  • inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md主要来源:✅ AMPD + LAAR + SuperInfer + KernelSight-LM(已归入增量/旁证);❌ 丢弃条目均为综述/无工程数据;FlashKDA(GitHub 归档);余为 agent harness(engineering 主题)
  • inbox/jay/2026-08-01T2105-jay-evening-five-category-briefing.md → 五大分类简报,无 pure inference 新增
  • inbox/jay/2026-08-01-csdn-substack-weekly.md → CSDN 周刊,无 inference 新增
  • inbox/jay/2026-08-01T1220-jay-csdn-rag-agent-moe-2026.md → RAG/Agent/MoE 主题
  • inbox/jay/2026-08-01T1620-jay-csdn-rag-agent-tensorrt-deploy.md → RAG/Agent/TensorRT 部署主题
  • inbox/tom/2026-08-01-0900-hf-daily-2026-08-01.md → HF Daily 15件(Kimi-K3/DKFV4-0711/Unbounded-Attention/seed-converter 等;无 pure inference-systems 新增)
  • inbox/tom/2026-08-01-1003-rss-yt-yannic-kilcher.md → YouTube RSS(无 inference 新增)
  • inbox/tom/2026-08-01-1004-rss-yt-lex-fridman.md → YouTube RSS(无 inference 新增)
  • inbox/tom/2026-08-01-evaluation-e1prep.md → evaluation 主题
  • inbox/tom/2026-08-01-rag-e1prep.md → RAG 主题
  • inbox/tom/2026-08-01-agent-rag-longcontext-radar.md + v2 + v3 → Agent/RAG/Long-Context 主题
  • inbox/spark/2026-08-01-llm-infra-e1prep.md → llm-infra 主题专属(与 inference 有交叉,但主要增量为 llm-infra 侧,本 E1 仅提取 inference 邻接部分)
  • inbox/spark/2026-08-01-agent-e1prep.md → Agent 主题
  • inbox/spark/2026-08-01-1001-rss-gradient-flow.md → RSS(无 inference 新增)
  • inbox/spark/2026-08-01-1002-rss-chip-huyen.md → RSS(无 inference 新增)
  • inbox/spark/2026-08-01-1004-rss-yt-3blue1brown.md → RSS(无 inference 新增)
  • inbox/flyp/2026-08-01-multimodal-e1prep.md → multimodal 主题
  • inbox/flyp/2026-08-01-risk-e1prep.md → risk 主题
  • inbox/flyp/2026-08-01-1550-ShadowDancer-See2Think.md → multimodal/video world model 主题
  • inbox/flyp/2026-08-01-1030-sat-adversarial-review-rag.md → RAG adversarial 主题
  • inbox/flyp/2026-08-01-0950-shadowdancer-comem-vla-and-depth-memory.md → multimodal/vla 主题
  • inbox/flyp/2026-08-01-1000-rss-cameron-wolfe.md → RSS(无 inference 新增)
  • inbox/flyp/2026-08-01-1001-rss-interconnects.md → RSS(无 inference 新增)
  • inbox/flyp/2026-08-01-1003-rss-yt-two-minute-papers.md → RSS(无 inference 新增)
  • inbox/flyp/2026-08-01-1004-rss-yt-ai-explained.md → RSS(无 inference 新增)
  • paper_cards/682-688 共 7 张新卡 → 主分类 inference-systems 0 张(677 OptGraph RAG;684 Fairness Pruning evaluation;682 ShadowDancer multimodal;686 Filesystem-based Memory agent;685 ???;683 ???;688 ???);主分类 llm-infra 0 张;其余为其他主题

6. 本次 E1 预消化结论

增量条数:6 主线 + 2 旁证

结论:inference 主题 7-31 22:00 → 8-1 22:00 约 24h 窗口为中密度,主因是 Jay 多棒战场(1335/1505/1735/1950)饱和覆盖了 inference-systems 新论文 + MCP 2.0 agent 架构更新。本场最重要的信号是 paper_cards 主分类 inference-systems 连续第 2 个零新增日(7-31 和 8-1 均无新卡)——但 inbox 工程论文密度完全补偿了卡片密度的不足。本场 6 条主线的核心动作:将 GoodServe(E2E-SLO goodput)/ AMPD(multi-round PD 分离)/ LAAR(NUMA-aware long-context routing)三篇新增 arXiv 论文作为 §2.2 调度层的立标级节点入位,补充 Harvest(P2P GPU cache 43.48%)+ Agent Memory(edge Q4 KV)+ Token-Operations 四层架构三篇邻接论文,并通过旁证 MCP 2.0 + Lilian Werg Harness + ByteByteGo Agent Loop 三层联动锚定 agentic inference 架构收敛方向。本场是近一个月 inference 系统论文密度最高的 E1 周期,建议今晚接力优先处理 GoodServe/AMPD/LAAR 三篇 §2 入位。

建议今晚活文档接力动作: 1. GoodServe arXiv:2605.16867 入 §2.2(E2E-SLO goodput 调度 + 与 SageServe/llm-d 互补) 2. AMPD arXiv:2602.14516v2 入 §2.2(Multi-round 自适应 PD 分离 + prefill reorder + vs Dynamo/vLLM) 3. LAAR arXiv:2604.15732v1 入 §2.2(NUMA-aware long-context routing + GH200 + Envoy EPP/llm-d) 4. Token-Operations 四层架构 arXiv:2606.20295v1 入 §2.5 或新增 §2.11(推理优化全景图框架 + 140T tokens/day 中国数据) 5. Harvest arXiv:2602.00328v1 入 §2.3(P2P GPU cache + 43.48% GPU 利用率实证) 6. Agent Memory arXiv:2603.04428v1 入 §2.3(Edge Q4 KV Cache + 78.5s dead time + warm-start) 7. MCP 2.0 + Lilian Weng Harness + ByteByteGo OpenAI Agent Loop 入 §7(Agentic 推理三层架构收敛) 8. SuperInfer + KernelSight-LM 入 §2.10(GH200 offloading + 容量规划工具) 9. C117/C118 共识候选 + O173-O180 试金石 写入对应候选池