inference · E1 预消化简报(2026-08-01)
执行人: Tom · E1 日间预消化轮(inference 主题) 覆盖时段: 2026-07-31 22:00 → 2026-08-01 22:00(约 24 小时) 基线:
organized/knowledge/inference.md(2026-08-01 更新 · Lossy Verification + ACL SpecVerif + TGI EOL 校正 + vLLM Conf 2026-08-25 · 十节 · 引用→123) 基线快照(昨日 E1 收官状态): inference.md §1 已收五大框架(TGI 2026-03-21 EOL/Colibri/LMDeploy)+vLLM Conf 2026-08-25+vLLM AI Blog 1,918 commits/月+1,300万CI minutes;§2.1 已收 PagedAttention 2.0 + vLLM MRV2 + SGLang v0.6(DSpark/DFlash+SpecV2/ReplaySSM 6.4×/GLM-5.2 DSA/PD Disagg);§2.2 调度已收 OmniServe + Blink + Disagg 5 节点;§2.3 KV cache 已收 KVServe/SpectrumKV + LMCache;§3 投机解码已收 EAGLE3/DFlash+SpecV2/QuantSpec/VeriCache + arXiv:2607.26627 Lossy Verification;§8 共识/争议已收 TGI EOL 校正+vLLM 1,918 commits 工程规模 检查来源: work-queue.md + inbox/jay/(2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026 22.2KB GoodServe+AMPD+LLM-MathOpt+AIConfigurator+Workload-Router-Pool+Fluid-Guided 6件套 · 2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb 21.7KB DUAL-BLADE+Shadow-in-Cache+MCP2+ByteByteGo+LilianWeng+LLaMA-Stack+MirrorCode · 2026-08-01T1735-jay-inference-engines-open-llms-2026 21.1KB vLLM/SGLang/TGI/TensorRT-LLM H100 benchmark+2026模型格局+Kimi-K3/DeepSeek-V4 · 2026-08-01T1950-jay-kvcache-vecdb-rag-2026 19.6KB KV-Cache-TransformCoding+Harvest+Agent-Memory+Token-Operations四层+Particula-SGLang-29% · 2026-08-01-engineering-filter-arxiv-inference-harness 10.6KB AMPD+LAAR+SuperInfer+KernelSight+FlashKDA+ECC+superpowers+jcode · 2026-08-01T2105-jay-evening-five-category-briefing 5件 · 2026-08-01-csdn-substack-weekly · 2026-08-01T1220-jay-csdn-rag-agent-moe-2026 · 2026-08-01T1620-jay-csdn-rag-agent-tensorrt-deploy) + inbox/tom/(2026-08-01-0900-hf-daily-2026-08-01 · 2026-08-01-1003-rss-yt-yannic-kilcher · 2026-08-01-1004-rss-yt-lex-fridman · 2026-08-01-evaluation-e1prep · 2026-08-01-rag-e1prep · 2026-08-01-agent-rag-longcontext-radar · 2026-08-01T1440-agent-rag-longcontext-radar-v2 · 2026-08-01T2040-agent-rag-longcontext-radar) + inbox/spark/(2026-08-01-llm-infra-e1prep · 2026-08-01-agent-e1prep · 2026-08-01-1001-rss-gradient-flow · 2026-08-01-1002-rss-chip-huyen · 2026-08-01-1004-rss-yt-3blue1brown) + inbox/flyp/(2026-08-01-multimodal-e1prep · 2026-08-01-risk-e1prep · 2026-08-01-1550-ShadowDancer-See2Think · 2026-08-01-1030-sat-adversarial-review-rag · 2026-08-01-1000-rss-cameron-wolfe · 2026-08-01-1001-rss-interconnects · 2026-08-01-1003-rss-yt-two-minute-papers · 2026-08-01-1004-rss-yt-ai-explained · 2026-08-01-0950-shadowdancer-comem-vla-and-depth-memory) + paper_cards/(682-688 共7张新卡;主分类 inference-systems 0张;主分类 llm-infra 0张;其余677 RAG/684 evaluation/686 agent 均为其他主题) 性质: 预消化简报 · 不重写活文档 · 供今晚活文档接力参考
0. 综述判断
本场 inference 主题 24h 窗口增量性质:中密度(6 主线 + 2 旁证 + 1 警示)。
本场新增 paper_cards 0 张(主分类 inference-systems 连续第 2 个零新增日),但 inbox 层面 inference 相关工程和系统论文涌入量大、质量高,是近 5 个 E1 周期中工程密度最高之一。本场核心增量集中在三个维度:① Jay 多棒战场(1335/1505/1735/1950)产出 6 件套 arXiv inference-systems 新论文——GoodServe(E2E-SLO goodput)、AMPD(multi-round PD 分 离)、LAAR(NUMA-aware long-context routing)、Token-Operations 四层架构、Harvest(P2P GPU cache)、Agent Memory(edge Q4 KV)——其中 GoodServe/AMPD/LAAR 为 inference.md 未收录的全新节点;② MCP 2.0(2026-07-28 正式发布)无状态协议对 agentic inference 架构的影响(Lilian Weng Harness Engineering + ByteByteGo OpenAI Agent Loop 为证);③ 工程筛选保留的 GitHub Trending 高价值 inference/agent-harness 项目(FlashKDA + ECC + superpowers + jcode)。本场是近一个月来 inference 系统论文密度最高的一个 E1 周期,建议今晚接力优先处理 GoodServe/AMPD/LAAR 三篇的 §2 入位。
1. 核心增量(6 主线,按建议归位节排序)
增量 1【调度 §2.2 / Agent生产推理 §7】GoodServe arXiv:2605.16867:Agentic LLM 推理的 E2E-SLO Goodput 调度(★★ 建议补)
来源: inbox/jay/2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026.md A1 + inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md ✅保留条目
arXiv:2605.16867 核心展开:
- 核心问题:Agentic LLM 推理有明确的端到端延迟 SLO 要求(E2E-SLO),系统需最大化 goodput(满足 SLO 的请求比例)。现有 batched serving 模式下 request-rr 在 GPU 上的实际执行效率受 token 形状(LinL 和 LoutL)和竞争请求共同影响,难以精确计算
- 关键技术贡献: 1. 问题建模:在 GPU 异构资源上调度 agentic LLM 推理,将 GPU 组合作为输入条件而非优化目标(与 SageServe、llm-d 互补) 2. Goodput 定义:满足 SLO 的请求比例(区别于 pure throughput) 3. 在线调度框架:异构 GPU 资源下最大化 goodput 的算法
- 与 llm-d/CNCF 的互补关系:llm-d 是 K8s 协调层解决跨实例调度;GoodServe 是单节点 GPU 组合优化;两者互补
- arXiv: https://arxiv.org/abs/2605.16867v1
与活文档关系:inference.md §2.2 调度已收 OmniServe(CPU-GPU 异构)+ Blink(CPU-Free)+ Disagg 5 节点 + 9 学派;§7 Agent 生产推理已收 Memory for LLMs 综述;但 GoodServe arXiv:2605.16867(E2E-SLO goodput 调度 + agentic inference 专属)与 llm-d/SageServe 互补关系未入位
建议归入:§2.2 调度(新增「GoodServe arXiv:2605.16867:Agentic LLM 推理 E2E-SLO Goodput 调度 · GPU 异构资源 goodput 最大化 + GPU 组合作为输入条件 · 与 SageServe/llm-d 互补」小节)+ §7 Agent 生产推理(邻接,agentic 推理 SLO 保障的调度层支撑);新增 C117 共识候选:"Agentic 推理 SLO 保障 = GoodServe goodput 调度(单节点)+ llm-d(K8s 协调层)+ vLLM MRV2 streaming parser(模型执行层)三层协同";新增 O173 试金石:"GoodServe goodput 最大化 vs vLLM continuous batching 在真实 agentic 工作负载(SWE-bench/BFCL)下的 SLO 达标率对照"
增量 2【调度 §2.2 / 选型决策树 §2.13】AMPD arXiv:2602.14516v2:Multi-round Disaggregated LLM Serving(ReAct Agent 场景专项)(★★ 建议补)
来源: inbox/jay/2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026.md A2 + inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md ✅保留条目
arXiv:2602.14516v2 核心展开:
- 核心问题:多轮 LLM 推理(ReAct 风格 agent)中,prefill 和 decode 工作负载交替出现——传统 co-location 或固定 PD 分离策略均无法高效适应这种交错模式
- AMPD 方案: 1. 自适应路由机制(Adaptive Routing):根据运行时 prefill/decode 负载动态分配资源 2. Prefill 重新排序策略(Prefill Reordering Policy):平衡 prefill 和 decode 负载 3. 与 Dynamo(NVIDIA 固定 PD 分离)的对比:Dynamo 是静态分离,AMPD 是动态分 离
- 对比基线:vLLM(PD co-location)、NVIDIA Dynamo(固定 PD 分离)
- 目标基准:SWE-Bench、BFCL 等 agent 基准
- arXiv: https://arxiv.org/abs/2602.14516v2
与活文档关系:inference.md §2.2 调度已收 Disagg 5 节点(O1/Continuum/Mooncake/Aegis/Tita);但 AMPD arXiv:2602.14516v2(Multi-round 自适应 PD 分离 + prefill reorder 策略 + ReAct agent 场景专项)未入位
建议归入:§2.2 调度(扩展 Disagg 节点,新增「AMPD arXiv:2602.14516v2:Multi-round 自适应 PD 分离 · Adaptive Routing + Prefill Reordering · 动态适应 prefill/decode 交替模式 · 对比 vLLM co-location / Dynamo 固定分离 · 目标 SWE-Bench/BFCL」);新增 O174 试金石:"AMPD prefill reorder 策略迁移到 vLLM/SGLang 的可行性;AMPD vs Dynamo 在真实多轮 agent 工具调用工作负载下的端到端延迟分布"
增量 3【调度 §2.2 / 系统栈 §2.10】LAAR arXiv:2604.15732v1:Long-Context-Aware NUMA-Aware 分布式 LLM 路由(GH200 实测)(★ 建议补)
来源: inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md ✅保留条目 + inbox/jay/2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026.md A2 相关
arXiv:2604.15732v1 核心展开:
- 核心问题:Long-context 场景下 GPU-CPU 之间的 NUMA 内存访问成为分布式 LLM serving 的瓶颈(GH200 NVL2 配置:144GB HBM + 480GB DRAM)
- 关键工程实现:
1. NUMA亲和性配置:
numactl控制 NUMA memory affinity(GH200 真实环境) 2. Envoy EPP Filter 实现:作为 External Processing Filter 策略实现,接入 llm-d MaxScorePicker 3. 路由逻辑:提取 request feature → 评估 Q(m,x) 成功率和 L(m,x) 延迟 → 选最低 cost 端点 - 硬件平台:NVIDIA GH200 NVL2(144GB HBM + 480GB DRAM)
- 工程信号:long-context 场景下 cache locality + load-aware routing 的生产级实现路径
- arXiv: https://arxiv.org/abs/2604.15732v1
与活文档关系:inference.md §2.2 调度已收 Disagg 5 节点;§2.10 系统栈(硬件/网络/存储)已收;但 LAAR arXiv:2604.15732v1(NUMA-aware routing + GH200 实测 + Envoy EPP 接入 llm-d)未入位
建议归入:§2.2 调度(新增「LAAR arXiv:2604.15732v1:Long-Context NUMA-Aware 分布式路由 · numactl NUMA 亲和性 + Envoy EPP filter 接入 llm-d MaxScorePicker · GH200 NVL2 实测 · 适合 long-context RAG/多文档推理场景」小节)+ §2.10 系统栈(邻接,NUMA 内存架构层);新增 O175 试金石:"LAAR 在 1M context 实测 GH200 vs A100/H100 的路由收益差异;numactl 配置在非 GH200 平台的通用性"
增量 4【推理优化 §2.5 / 系统栈 §2.10】Token-Operations Oriented Inference Optimization 四层架构 arXiv:2606.20295v1(★ 建议补)
来源: inbox/jay/2026-08-01T1950-jay-kvcache-vecdb-rag-2026.md E4
arXiv:2606.20295v1 核心展开:
- 四层架构框架:
- Layer 1 Multi-model Fusion:模型能力量化、智能路由、级联、集成
- Layer 2 Model Optimization:Attention 改进、MoE、CoT、KV Cache 压缩、投机解码、量化、蒸馏
- Layer 3 Compute-Model Fusion:算子融合、内存访问优化、基础算子加速、引擎参数调优
- Layer 4 Compute-Network-Model Fusion:多节点并行、KV Cache 集群调度、粘性会话路由、语义缓存复用、动态批处理
- 重要背景数据:中国国家数据局 2026 年 3 月数据——中国日均 token 处理量已超 140 万亿(年化约 5 京),说明为什么 token 成本优化在中国是工程优先问题
- 新技术点名(2026 ICLR/SOSP): | 技术 | 出处 | 说明 | |------|------|------| | P-EAGLE | 2026(替代 EAGLE)| 并行预测多个 draft token,集成到 vLLM | | SPEED-Bench | 2026 | 多语义域投机解码评估框架 | | MeanCache | ICLR 2026(中国联通)| Jacobian-Vector Product 区间平均速度 + 轨迹稳定性调度 | | Cortex | Wang et al. 2026 | 超大规模分布式语义感知映射 + 边缘智能预取 |
- arXiv: https://arxiv.org/abs/2606.20295v1
与活文档关系:inference.md §2.5 稀疏注意力/系统协同优化已收;但 Token-Operations 四层架构全景图(含 P-EAGLE/MeanCache/Cortex/140T tokens/day 中国数据)未作为独立全景节点入位
建议归入:§2.5(或新增 §2.11 推理优化全景图节):新增「Token-Operations Oriented Inference arXiv:2606.20295v1 四层架构:Multi-model Fusion → Model Optimization → Compute-Model Fusion → Compute-Network-Model Fusion · 中国日均 140T tokens(2026-03)· P-EAGLE/MeanCache/Cortex 2026 新技术 · 作为 LLM 推理优化全景图框架基础」小节;新增 O176 试金石:"Token-Operations 四层在国产算力(昇腾)环境下的适用性;MeanCache 在 vLLM 的集成可行性"
增量 5【KV Cache §2.3】Harvest P2P GPU Cache 共享 arXiv:2602.00328v1:生产集群 GPU 利用率 43.48% 实证(★ 建议补)
来源: inbox/jay/2026-08-01T1950-jay-kvcache-vecdb-rag-2026.md E3 + inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md ✅保留条目(与 SuperInfer/KernelSight 并列)
arXiv:2602.00328v1 核心展开:
- 核心问题:GPU 显存利用率低(生产集群平均 43.48%,中位数 28.78%),大量 GPU 内存在等待时闲置。传统 vLLM 单机 KV Cache 无法跨节点复用
- Harvest 方案: 1. 机会主义 P2P GPU Cache 共享:利用其他 GPU 的空闲显存存储 KV Cache 2. 跨节点 KV Cache 传输:测了 DeepSeekV3、Mistral-Large-3-675B、Kimi-K2 三种模型的 KV Cache 传输时间 3. 与 vanilla vLLM CPU swap 对比:显著降低延迟
- 关键数据(FlexPipe 两大云厂商两周实测):
- 平均 GPU 显存利用率:43.48%
- 中位数:28.78%
- 38.44% 的采样落在 10-30% 利用率区间
- 这组数据是截至 2026-08 最新、最系统的生产集群 GPU 利用率实证
- arXiv: https://arxiv.org/abs/2602.00328v1
与活文档关系:inference.md §2.3 KV cache 14 件套已收 LMCache/Mooncake/HyMCache;但 Harvest arXiv:2602.00328v1(P2P GPU cache 共享 + 生产集群 43.48% GPU 利用率实证 + DeepSeekV3/Mistral-Large-3/Kimi-K2 传输时间)未入位
建议归入:§2.3 KV cache(新增「Harvest arXiv:2602.00328v1:P2P GPU Cache 共享 · 生产集群平均 GPU 利用率 43.48%/中位数 28.78% 实证 · 38.44% 落在 10-30% 利用率区间 · 机会主义跨节点 KV Cache 复用 · 对比 vanilla vLLM CPU swap · 适合多租户/多用户 GPU 资源共享场景」小节);新增 C118 共识候选:"生产 LLM 推理 GPU 平均利用率约 43% = 大量 GPU 在空转;Harvest P2P 共享适合多租户/跨用户场景;单机 vLLM KV Cache 节点内前缀复用适合单用户多轮";新增 O177 试金石:"Harvest 在 DeepSeek V4/Mistral-Large-3-675B/Kimi-K2 上的 KV Cache 传输时间实测;P2P 共享在多租户环境的安全隔离边界"
增量 6【KV Cache §2.3 / Agent生产推理 §7】Agent Memory 持久化 Q4 KV Cache arXiv:2603.04428v1:Edge 设备多轮推理冷启动优化(★ 建议补)
来源: inbox/jay/2026-08-01T1950-jay-kvcache-vecdb-rag-2026.md E2 + inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md ✅保留条目
arXiv:2603.04428v1 核心展开:
- 核心问题:Edge 设备(手机/笔记本)上的多轮 Agent 推理,每次重启后 KV Cache 全部丢失,冷启动 TTFT 代价极高——论文实测 15.7s = 78.5s dead time(总计)
- 方案: 1. 跨会话持久化 KV Cache 到 disk(safetensors 格式) 2. 支持 cache eviction 和 device sleep/wake 循环后的 warm-start 3. Q4(INT4)压缩减少存储开销
- 关键数据(论文实测):
- vllm-mlx 在 Apple Silicon 上比 llama.cpp 吞吐高 21-87%(MLX 框架优势)
- 本系统与 vllm-mlx 正交,解决的是跨会话持久化而非 prefix caching
- 与 OpenClaw 本地节点场景关联:Anan 的 OpenClaw 支持 node 部署,Agent Memory Q4 KV Cache 方案有直接参考价值
- arXiv: https://arxiv.org/abs/2603.04428v1
与活文档关系:inference.md §2.3 KV cache 已收 LMCache/HyMCache/Mooncake;§7 Agent 生产推理已收 Memory for LLMs;但 Agent Memory arXiv:2603.04428v1(Edge Q4 KV Cache 持久化 + 78.5s dead time 实测 + warm-start)未入位
建议归入:§2.3 KV cache(新增「Agent Memory arXiv:2603.04428v1:Edge 设备 Q4 KV Cache 持久化 · 冷启动 15.7s/78.5s dead time 实测 · safetensors 格式跨会话持久化 + sleep/wake warm-start + INT4 压缩 · vllm-mlx 21-87% vs llama.cpp on Apple Silicon · 适合 OpenClaw node 本地部署场景」小节)+ §7 Agent 生产推理(邻接,edge agent 冷启动优化);新增 O178 试金石:"Agent Memory 在 OpenClaw node 上的实测 warm-start TTFT 改善;vllm-mlx 跨设备 KV Cache 格式兼容性"
2. 旁证(2 条)
旁证 1【Agent生产推理 §7 / 推理协议 §4】MCP 2.0(2026-07-28)+ Lilian Weng Harness Engineering + ByteByteGo OpenAI Agent Loop——Agentic 推理架构三层栈(★★)
来源: inbox/jay/2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb.md B1/B3/B4(⭐⭐⭐⭐⭐)+ inbox/jay/2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026.md S3/S4
三条来源综合展开:
MCP 2.0 无状态协议(2026-07-28 官方发布):
- 废除 initialize/initialized 握手和 Mcp-Session-Id header
- 每个请求独立携带协议版本、客户端身份、客户端能力(放在 _meta 中)
- 任何请求可路由到任何服务器实例,支持原生 round-robin 负载均衡
- MRTR(Multi Round-Trip Requests):替代 server-initiated 双向流
- 攻击面新增:Handle Hijacking(模型可见字符串可被 echo 和传递)
- 工程行动项:网关升级传递 Mcp-Method/Mcp-Name header;审查基于 session 的状态管理是否需迁移到 handle 模式
Lilian Weng Harness Engineering(2026-07-04): - Harness 定义:Harness = LLM + Memory + Tools + Planning + Action + Workflow Design + Eval + Permission Controls + Persistent State - 三大设计模式:Workflow Automation(Goal-oriented loop)、File System as Persistent Memory、Sub-agent and Backend Jobs - Coding Agent 工具集参考:文件系统/Shell/IO/LSP/git/MCP tools/Web/Artifacts/Backend 进程/Agent 委托
ByteByteGo OpenAI Agent Loop(2026-08-01 今日新): - Harness → API → Inference 三层架构 - Harness 层:Persistent WebSockets、Stable prompt prefixes、Deferred tool discovery、Code Mode - API 层:Tokenize only delta、Parallel safety checks(race 机制) - Inference 层:Cache-aware routing、KV cache lifecycle management、Speculative decoding、PD separation
综合信号:MCP 2.0 无状态化 + Lilian Weng Harness 定义 + ByteByteGo OpenAI 实证,共同指向 agentic inference 架构正在收敛至「Harness 编排层 + 无状态协议 + GPU 推理层」三层栈
建议归入:§7 Agent 生产推理(新增「MCP 2.0 + Lilian Weng Harness + ByteByteGo OpenAI Agent Loop = Agentic 推理三层架构收敛:Harness 编排层(无状态 MCP 2.0 协议)+ 无状态协议层(round-robin 负载均衡)+ GPU 推理层(KV cache/speculative decoding)」小节);新增 O179 试金石:"MCP 2.0 handle hijacking 在生产环境中的实际风险边界;Lilian Weng 三大 Harness 模式在 vLLM/SGLang 中的工程实现差异"
旁证 2【推理引擎 §1 / 系统栈 §2.10】SuperInfer GH200 Superchip 推理 + KernelSight-LM Kernel 级推理仿真器(★)
来源: inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md ✅保留条目
SuperInfer arXiv:2601.20309v2 核心: - 硬件 testbed:NVIDIA GH200 NVL2(144GB HBM + 480GB DRAM) - 软件基线:vLLM v0.6.6.post1(V1 engine)、TensorRT-LLM v1.1.0 - 核心问题:KV cache 耗尽时的 HOL blocking → GPU-CPU via NVLink-C2C offloading 方案 - TTFT/TBT SLO 严格目标下的性能数据 - 工程信号:Superchip 架构下 KV cache offloading 的最新生产系统设计
KernelSight-LM arXiv:2606.28565v1 核心: - 对比框架:Vidur(离散事件仿真)、AIConfigurator(算子级表插值) - Benchmark 数据:GB200 上 Tier B vs AIConfigurator 对比表 - 场景:新 GPU 型号或新模型 variant 的性能预测,不需要每次都做完整 profiling - 解决痛点:procurement 前无法实测的工程规划问题
建议归入:§2.10 系统栈(新增 SuperInfer GH200 KV offloading + KernelSight-LM 容量规划工具);新增 O180 试金石:"KernelSight-LM vs Vidur 在 procurement 场景的选型建议;GH200 NVL2 vs H100 在 KV cache offloading 上的实测收益差异"
3. 值得警惕的矛盾或待核实说法
| # | 矛盾/待核实项 | 来源 | 风险级别 | 建议行动 |
|---|---|---|---|---|
| 1 | GoodServe arXiv:2605.16867 机构/作者信息模糊(jay 1335 briefing 标注"具体机构待确认") | jay 1335 briefing | 🟡 待核实 | 核验 arXiv 原文作者/机构 |
| 2 | LAAR arXiv:2604.15732v1 Envoy EPP 实现:需确认是否已开源及与 llm-d MaxScorePicker 的具体集成方式 | jay engineering-filter | 🟡 待核实 | LAAR GitHub 仓库 + llm-d EPP 文档 |
| 3 | Harvest arXiv:2602.00328v1 生产集群 GPU 利用率 43.48%:两大云厂商是哪两家?数据是否有选择性偏差? | jay 1950 briefing | 🟡 待核实 | FlexPipe 原始报告 |
| 4 | Token-Operations arXiv:2606.20295v1 P-EAGLE/MeanCache/Cortex 2026 新技术:部分来自"2026 ICLR/SOSP"标注,具体会议归属需核实 | jay 1950 briefing | 🟡 待核实 | 各技术原始 arXiv |
| 5 | AMPD arXiv:2602.14516v2 vs NVIDIA Dynamo 2026 对比数据:jay 1335 briefing 标注"具体数据需精读原文",建议交叉验证 | jay 1335 briefing | 🟡 待核实 | AMPD 原论文 §4 实验数据 |
| 6 | KernelSight-LM arXiv:2606.28565v1 "Tier B"指 GB200 的哪个配置:Tier A/B/C 分类体系需核验 | jay engineering-filter | 🟡 待核实 | KernelSight-LM 原文 §2 |
4. 本次涉及 arXiv 号列表
| arXiv 号 | 论文/主题 | 增量归属 | 建议归位节 |
|---|---|---|---|
| 2605.16867v1 | GoodServe Agentic LLM Goodput 调度(E2E-SLO · 2026-05 · jay 1335 ★★) | 增量 1 | §2.2 调度 / §7 Agent 生产推理 |
| 2602.14516v2 | AMPD Multi-round Disaggregated LLM Serving(ReAct agent · jay 1335 ★★) | 增量 2 | §2.2 调度 / §2.13 选型决策树 |
| 2604.15732v1 | LAAR Long-Context NUMA-Aware Routing(GH200 · jay eng-filter ★) | 增量 3 | §2.2 调度 / §2.10 系统栈 |
| 2606.20295v1 | Token-Operations Oriented Inference 四层架构(jay 1950 ★) | 增量 4 | §2.5 推理优化全景图 |
| 2602.00328v1 | Harvest P2P GPU Cache 共享(43.48% GPU 利用率 · jay 1950 ★) | 增量 5 | §2.3 KV cache |
| 2603.04428v1 | Agent Memory Edge Q4 KV Cache 持久化(jay 1950 ★) | 增量 6 | §2.3 KV cache / §7 Agent 生产推理 |
| 2601.20309v2 | SuperInfer GH200 Superchip Inference(旁证 2) | 旁证 2 | §2.10 系统栈 |
| 2606.28565v1 | KernelSight-LM Kernel级推理仿真器(旁证 2) | 旁证 2 | §2.10 系统栈 |
| 2511.01815 | KV Cache Transform Coding(ICLR 2026 · 已在 jay 1950 覆盖,Jay 傍晚档已收录,inference.md §2.3 尚未确认入位) | 横向参照 | §2.3 KV cache |
| 2605.16867 | GoodServe(同上,仅重列) | — | §2.2 |
| 2604.26557 | DUAL-BLADE NVMe KV offloading(NDSS 2026 · jay 1505 B2) | 横向参照 | §2.3 KV cache |
| 2508.09442 | Shadow in the Cache KV-cache 隐私安全(NDSS 2026 · jay 1505 B2) | 横向参照 | §2.6 安全 |
| 2603.12831 | OmniServe(已在 inference.md §2.2) | — | §2.2 |
| 2606.29708 | KVServe(已在 inference.md §2.3) | — | §2.3 |
| 2606.08635 | SpectrumKV(已在 inference.md §2.3) | — | §2.3 |
| 2604.11001 | Flow-Controlled Scheduling(已在 inference.md §2.2) | — | §2.2 |
| 2604.07609 | Blink CPU-Free(已在 inference.md §2.1) | — | §2.1 |
| 2607.26627 | Lossy Verification(已在 inference.md §3/§8) | — | §3/§8 |
| 2607.19712 | RLHF C++/ONNX(已在 inference.md §5) | — | §5 |
5. 已检查来源清单
以下来源经本次扫描确认无 inference 主题新增或已在上方增量中覆盖,避免重复检索:
inbox/jay/2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026.md→ 主要来源:已提取 A1 GoodServe + A2 AMPD + A3 LLM-MathOpt(§2.13 已有选型树 v2)+ A4 AIConfigurator(已有 AIConfigurator 多框架配置)+ A5 Workload-Router-Pool(vLLM semantic routing,愿景类)+ A6 Fluid-Guided(已在 inference.md §2.3);S1 The AI Engineer(TGI 维护已在 7-31 E1 覆盖);S2 WTF In Tech(工程经济学 newsletter);余为 vecdb/模型/其他主题归档inbox/jay/2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb.md→ 主要来源:B1 MCP 2.0(归入旁证 1)+ B3 Lilian Weng Harness(归入旁证 1)+ B4 ByteByteGo OpenAI Agent Loop(归入旁证 1)+ B2 DUAL-BLADE/Shadow-in-Cache(横向参照);C1 MCP 2.0 云原生影响(归档);CS1 企业 Agent 工程化(其他主题);CS2 vLLM 投机解码源码(CSDN);R1 MirrorCode(coding benchmark);R2 X Tech Radar(robotic/encoder/PDF 解析)——无 pure inference 新增inbox/jay/2026-08-01T1735-jay-inference-engines-open-llms-2026.md→ 主要来源:D1 推理引擎 H100 benchmark(Spheron/YottaLabs/DeployBase)+ D3 2026 模型格局(Kimi K3/DeepSeek V4/GLM 5.2/Gemma 4 ——均已在 inference.md §2.1 覆盖);D4 HF State of Open Source(已在 agent 侧覆盖);D5/D6 AI Engineer 职位需求(engineering 主题);D9 向量数据库选型(database 主题归档)inbox/jay/2026-08-01T1950-jay-kvcache-vecdb-rag-2026.md→ 主要来源:E1 KV Transform Coding(横向参照,§2.3 待补)+ E2 Agent Memory(增量 6)+ E3 Harvest(增量 5)+ E4 Token-Operations 四层(增量 4)+ E9 SGLang vs vLLM 差异(已在 7-30 E1 覆盖);E6 8周生产 LLM(engineering);E7/E8 RAG 评估工具(rag 主题)inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md→ 主要来源:✅ AMPD + LAAR + SuperInfer + KernelSight-LM(已归入增量/旁证);❌ 丢弃条目均为综述/无工程数据;FlashKDA(GitHub 归档);余为 agent harness(engineering 主题)inbox/jay/2026-08-01T2105-jay-evening-five-category-briefing.md→ 五大分类简报,无 pure inference 新增inbox/jay/2026-08-01-csdn-substack-weekly.md→ CSDN 周刊,无 inference 新增inbox/jay/2026-08-01T1220-jay-csdn-rag-agent-moe-2026.md→ RAG/Agent/MoE 主题inbox/jay/2026-08-01T1620-jay-csdn-rag-agent-tensorrt-deploy.md→ RAG/Agent/TensorRT 部署主题inbox/tom/2026-08-01-0900-hf-daily-2026-08-01.md→ HF Daily 15件(Kimi-K3/DKFV4-0711/Unbounded-Attention/seed-converter 等;无 pure inference-systems 新增)inbox/tom/2026-08-01-1003-rss-yt-yannic-kilcher.md→ YouTube RSS(无 inference 新增)inbox/tom/2026-08-01-1004-rss-yt-lex-fridman.md→ YouTube RSS(无 inference 新增)inbox/tom/2026-08-01-evaluation-e1prep.md→ evaluation 主题inbox/tom/2026-08-01-rag-e1prep.md→ RAG 主题inbox/tom/2026-08-01-agent-rag-longcontext-radar.md+ v2 + v3 → Agent/RAG/Long-Context 主题inbox/spark/2026-08-01-llm-infra-e1prep.md→ llm-infra 主题专属(与 inference 有交叉,但主要增量为 llm-infra 侧,本 E1 仅提取 inference 邻接部分)inbox/spark/2026-08-01-agent-e1prep.md→ Agent 主题inbox/spark/2026-08-01-1001-rss-gradient-flow.md→ RSS(无 inference 新增)inbox/spark/2026-08-01-1002-rss-chip-huyen.md→ RSS(无 inference 新增)inbox/spark/2026-08-01-1004-rss-yt-3blue1brown.md→ RSS(无 inference 新增)inbox/flyp/2026-08-01-multimodal-e1prep.md→ multimodal 主题inbox/flyp/2026-08-01-risk-e1prep.md→ risk 主题inbox/flyp/2026-08-01-1550-ShadowDancer-See2Think.md→ multimodal/video world model 主题inbox/flyp/2026-08-01-1030-sat-adversarial-review-rag.md→ RAG adversarial 主题inbox/flyp/2026-08-01-0950-shadowdancer-comem-vla-and-depth-memory.md→ multimodal/vla 主题inbox/flyp/2026-08-01-1000-rss-cameron-wolfe.md→ RSS(无 inference 新增)inbox/flyp/2026-08-01-1001-rss-interconnects.md→ RSS(无 inference 新增)inbox/flyp/2026-08-01-1003-rss-yt-two-minute-papers.md→ RSS(无 inference 新增)inbox/flyp/2026-08-01-1004-rss-yt-ai-explained.md→ RSS(无 inference 新增)- paper_cards/682-688 共 7 张新卡 → 主分类 inference-systems 0 张(677 OptGraph RAG;684 Fairness Pruning evaluation;682 ShadowDancer multimodal;686 Filesystem-based Memory agent;685 ???;683 ???;688 ???);主分类 llm-infra 0 张;其余为其他主题
6. 本次 E1 预消化结论
增量条数:6 主线 + 2 旁证
结论:inference 主题 7-31 22:00 → 8-1 22:00 约 24h 窗口为中密度,主因是 Jay 多棒战场(1335/1505/1735/1950)饱和覆盖了 inference-systems 新论文 + MCP 2.0 agent 架构更新。本场最重要的信号是 paper_cards 主分类 inference-systems 连续第 2 个零新增日(7-31 和 8-1 均无新卡)——但 inbox 工程论文密度完全补偿了卡片密度的不足。本场 6 条主线的核心动作:将 GoodServe(E2E-SLO goodput)/ AMPD(multi-round PD 分离)/ LAAR(NUMA-aware long-context routing)三篇新增 arXiv 论文作为 §2.2 调度层的立标级节点入位,补充 Harvest(P2P GPU cache 43.48%)+ Agent Memory(edge Q4 KV)+ Token-Operations 四层架构三篇邻接论文,并通过旁证 MCP 2.0 + Lilian Werg Harness + ByteByteGo Agent Loop 三层联动锚定 agentic inference 架构收敛方向。本场是近一个月 inference 系统论文密度最高的 E1 周期,建议今晚接力优先处理 GoodServe/AMPD/LAAR 三篇 §2 入位。
建议今晚活文档接力动作: 1. GoodServe arXiv:2605.16867 入 §2.2(E2E-SLO goodput 调度 + 与 SageServe/llm-d 互补) 2. AMPD arXiv:2602.14516v2 入 §2.2(Multi-round 自适应 PD 分离 + prefill reorder + vs Dynamo/vLLM) 3. LAAR arXiv:2604.15732v1 入 §2.2(NUMA-aware long-context routing + GH200 + Envoy EPP/llm-d) 4. Token-Operations 四层架构 arXiv:2606.20295v1 入 §2.5 或新增 §2.11(推理优化全景图框架 + 140T tokens/day 中国数据) 5. Harvest arXiv:2602.00328v1 入 §2.3(P2P GPU cache + 43.48% GPU 利用率实证) 6. Agent Memory arXiv:2603.04428v1 入 §2.3(Edge Q4 KV Cache + 78.5s dead time + warm-start) 7. MCP 2.0 + Lilian Weng Harness + ByteByteGo OpenAI Agent Loop 入 §7(Agentic 推理三层架构收敛) 8. SuperInfer + KernelSight-LM 入 §2.10(GH200 offloading + 容量规划工具) 9. C117/C118 共识候选 + O173-O180 试金石 写入对应候选池