llm-infra · E1 预消化简报(2026-08-01)

作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 13 棒 · 8-1 晚间活文档接力备料) 覆盖时段:2026-07-31 18:40 → 2026-08-01 18:40(约 24 小时主增量)+ 2026-07-29 18:40 → 2026-08-01 18:40(48-72h 邻接参考) 基线:organized/knowledge/llm-infra.md §IX·34th 抢修完成版(2026-08-01 11:58 收官 · 11+1 维全景 + C1-C73 共识 + D1-D38 争议 + O1-O147 开放问题 + T1-T29 趋势 + §IX 关键拐点 12 件:CVE-2026-22778 PR#31987/#32319 + vLLM 0.7 MRv2 Rel-26.07 + DFlash + Spec V2 默认 SGLang 4.3× + SGLang×TPU + MC-SF/LAAR + LMCache 2026 Q2 + vLLM FP8 KV 50% + Memory 综述 + TGI 维护 + Harness Phase 4 + SIGMOD 2026 三件套 DOI 10.1145/38020284/38020094/3749168 5-18 published 全部 web 核实 + MSR Echoverse 9B 67.1% + MirrorCode $251 + MCP 2.0 Stateless + ByteByteGo 三层模型);7-31 evening spark E1 第 12 棒(7 主线 + 3 旁证 + 1 警示)已并入 v33 接力基线,7-31 evening coordination-check 接力棒 + 8-1 morning spark E1 独立缺失第 8 棒静默期后续,第 13 棒 llm-infra-e1prep-v13 恢复

覆盖来源: - inbox/jay 7-31 evening → 8-1 18:40 共 23 件(8-1 当天 21 件 + 7-31 evening 2 件):关键 8-1 afternoon 4 件 = T1335-jay-arxiv-inference-systems-vecdb-2026(GoodServe + AMPD + AIConfigurator + Workload-Router-Pool + Fluid-Guided v4)+ T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb(KV Cache Transform Coding ICLR 2026 + DUAL-BLADE ICDCS 2026 + Shadow in the Cache NDSS 2026 + MCP 2.0 无状态协议 + Spheron H100 基准 + Lilian Weng Harness + ByteByteGo 三层模型 + MirrorCode + R2 X Tech Radar)+ T1620-jay-csdn-rag-agent-tensorrt-deploy(PyTorch-CUDA-v2.7 + TensorRT-LLM Qwen3 命令 + YOLOv8 DFL + DeepSeek-R1 + PyTorch Quantization)+ T1735-jay-inference-engines-open-llms-2026(YottaLabs vLLM vs SGLang vs TRT-LLM vs TGI + Superlinked SIE 检索/生成层分工 + 2026 开源新模型格局 + HF State of OS Spring 2026 + 1000+ JD AI Engineer + LLM Engineer vs AI Engineer + GitHub Top 12 + ByteByteGo Langflow/Dify + DEV Community Vector DB 决策树);8-1 morning 5 件 = 0935-jay-engineering-filter + 1000/1001/1002/1003/1004 RSS 通稿 + 1050-jay-engineering-filter + 1105-jay-five-category-briefing #17 + 1140-news-x-tech-radar + 1220-jay-csdn-rag-agent-moe-2026 + engineering-e1prep + csdn-substack-weekly + engineering-filter-arxiv-inference-harness(AMPD/LAAR/SuperInfer/KernelSight-LM/GitHub Trending FlashKDA/ECC/superpowers/jcode/book-to-skill/alibaba/open-code-review/skyzh/tiny-llm) - inbox/tom 7-31 evening → 8-1 共 8 件(7-31 inference-e1prep 已恢复沿用 · 8-1 4 件 = 0840-agent-rag-longcontext-radar 8 候选 4 高价值 Σ-Mem + Filesystem + DualG-MRAG + GLM-RAG + 0900-hf-daily-2026-08-01 15 件票榜首 21▲ + 1003/1004 RSS YT + rag-e1prep + evaluation-e1prep + T1440-agent-rag-longcontext-radar) - inbox/flyp 7-31 evening → 8-1 共 9 件(7-31 multimodal-e1prep/risk-e1prep/4 RSS 沿用 + 8-1 0950-ShadowDancer + CoMem VLA + depth memory 跨模态精读 19KB + 1000/1001/1003/1004 RSS + 1030-sat-adversarial-review-rag-filesystem-dualg-bm25 + 1030-sat-weekly-deep-read-rag-filesystem-dualg-bm25 + 1550-ShadowDancer-See2Think-critical-read + 8-1 multimodal-e1prep + risk-e1prep) - inbox/spark 7-31 evening → 8-1 共 4 件(7-31 1337-agent-e1prep + 1339-llm-infra-e1prep-v11 + 3 RSS 通稿 + 8-1 1001/1002/1004 RSS 通稿 + 1330-agent-e1prep-v37 + ⚠️ spark 8-1 morning 节奏反转后第 8 棒独立 E1 持续缺失 · 本棒 llm-infra-e1prep-v13 恢复) - inbox/stephen 7-31 evening → 8-1 共 14 件(7-31 1026-ai-industry-e1prep-v32 + 0910-news-x-vip-radar + 1003/1004/1006 news- 通稿 + 1245 coordination-check-noon + 8-1 0910-news-x-vip-radar · Sam Altman 8-1 华盛顿政策窗口 + AMI Labs $1.03B + Yann LeCun 离开 Meta + 1021-ai-industry-e1prep-v34 8 增量 + 1002/1003/1004 news- 12 frontier lab news + 1245-coordination-check-noon #7 7 向覆盖度盘点) - paper_cards 7-31 evening → 8-1 18:40 新卡 IDs 674-688 共 15 张,主分类 llm-infra 新增 0 张(沿用 657 RLHF C++ + 668 Memory for LLMs + 673 CADENCE + 681 Lossy Verification),主分类 engineering 新增 1 张 = 672 πR² arXiv:2607.26055 Reactive Real-time Flow Policies(副分类 llm-infra 0 张 + 邻接 llm-infra engineering 主分类 0 张新卡 + 主分类 agent 5 张 + 主分类 rag 3 张 + 邻接 multimodal/evaluation 7 张)

结论:中密度(5 主线 + 3 旁证 + 2 警示 · 较 7-31 第 12 棒 7+3+1 略降),核心动作 = (1) KV Cache 顶会三件套 8-1 afternoon 集中爆发(DUAL-BLADE ICDCS 2026 + KV Cache Transform Coding ICLR 2026 + Shadow in the Cache NDSS 2026 = 2026 数据库/通信/系统三大顶会议后,网络/安全/AI 三大顶会议 KV-cache 集中爆发立标);(2) Agentic Serving 调度立标 GoodServe arXiv:2605.16867v1 + AMPD arXiv:2602.14516v2 + Workload-Router-Pool arXiv:2603.21354v2 vLLM Semantic Router 三件套(与 MC-SF/LAAR 离线理论 + 在线路由形成「Agentic 推理服务 goodput + 多轮 PD 分不解离 + 三维度协同优化」补充);(3) AIConfigurator arXiv:2601.06288v1 多框架配置优化(vLLM/SGLang/TRT-LLM 最后一公里配置);(4) Fluid-Guided arXiv:2504.11320v4 v4 更新(现代生产 vLLM 2026 默认 recomputation 策略 + Vidur 仿真器 1% memory margin 配置);(5) 推理引擎 4 选 1 横评 8-1 三源交叉(YottaLabs/Spheron/DeployBase/Superlinked/AI Engineer 1000+ JD) + MCP 2.0 Stateless Simon Willison HTTP 格式对比 + MSR Echoverse 9B 36.5%→67.1% + MSR SymCrypt Rust+Lean+Aeneas 形式化验证 + 3 旁证:Workload-Router-Pool arXiv:2603.21354v2(vLLM Semantic Router 愿景论文 NeurIPS/ICML 2026 引用 + silent drift detection 静默降级检测)+ DUAL-BLADE arXiv:2604.26557 ICDCS 2026 边缘 NVMe-direct KV-Cache 卸载(prefill -33.1% / decode -42.4% / SSD 2.2×)+ Shadow in the Cache arXiv:2508.09442 NDSS 2026 KV-cache 隐私/侧信道(memory-as-attack-surface 第四立标)+ 2 警示:tom 7-31 inference E1 已恢复但 8-1 仅 6 件常规通稿 0 件 inference-e1prep · spark 8-1 morning 第 8 棒独立 E1 仍缺(本棒恢复)


一、核心增量(5 主线 + 3 旁证 + 2 警示,按活文档归位顺序)

增量 1【KV cache §2.3 / 工程基础设施 §2.10】KV Cache 顶会三件套 8-1 afternoon 集中爆发:DUAL-BLADE ICDCS 2026 + KV Cache Transform Coding ICLR 2026 + Shadow in the Cache NDSS 2026(★★ 必补)

  • 来源:inbox/jay/2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb.md §Database D1/D2/D3(⭐⭐⭐⭐ + ⭐⭐⭐⭐ + ⭐⭐⭐⭐)+ inbox/jay/2026-08-01-engineering-e1prep.md 增量 5(Echoverse 邻接)+ inbox/flyp/2026-08-01-risk-e1prep.md 增量 1(Shadow in the Cache P0 警示)+ organized/knowledge/llm-infra.md §1.(3) KV cache 14+1 件套 + LMCache 2026 Q2 + vLLM FP8 KV 50% + Memory 综述 + §1.(10) SIGMOD 2026 三件套 DOI 5-18 published + §1.(4) Fail-Plausible 五类 + CVE-2026-22778 RCE 已收

KV Cache 顶会三件套 2026 H2 集中爆发完整展开:

D1 · KV Cache Transform Coding arXiv:2511.01815 · ICLR 2026(已接收)· ⭐⭐⭐⭐ - 核心问题:KV-cache 是 LLM 推理显存占用大头(128K 上下文单用户约需 40GB BF16) - 方案:Transform Coding 方法对 KV-cache 做紧凑压缩存储,减少显存占用的同时保持精度 - 对比:与 DUAL-BLADE(压缩+卸载两条路线互补)· 与 KVQuant(10M context LLM inference)路线对比 - 可信度:高(ICLR 2026 顶会接收) - 工程价值:⭐⭐⭐⭐(沿用 jay 1505 briefing D1) - 建议关注:transform coding 相对量化(KVQuant)的精度损失曲线,评估生产可用性

D2 · DUAL-BLADE arXiv:2604.26557 · ICDCS 2026(已接收 · Bodon Jeong et al.)· ⭐⭐⭐⭐ - 核心数据: - Prefill 延迟降低:最高 33.1% - Decode 延迟降低:最高 42.4% - SSD 利用率提升:最高 2.2× - 关键技术 3 件套: 1. 双路径 KV 常驻(Dual-Path KV Residency):动态选择 page-cache 路径或 NVMe-direct 路径 2. NVMe-direct I/O:绕过文件系统,将 KV tensor 直接映射到连续 LBA(Logical Block Address)区域 3. 自适应流水线并行(Adaptive Pipeline Parallelism):存储 I/O 与推理计算重叠 - 解决的问题: - 2-7GB 范围内写入停顿(write stalls)问题 - Decode 阶段 page-cache thrashing 问题 - 可信度:高(IEEE ICDCS 2026) - 工程价值:⭐⭐⭐⭐ - 与 LMCache(vLLM/SGLang/NVIDIA Dynamo 的 KV-cache 持久化存储 backend)路线互补 + 适用边缘推理(AGPU/NVIDIA Jetson 等内存受限场景) + 与 vLLM --swap-space 参数的工程意义对比:更系统化的 KV 卸载方案

D3 · Shadow in the Cache arXiv:2508.09442 · NDSS 2026(已接收)· ⭐⭐⭐⭐ - 核心问题:KV-cache 在 LLM 推理服务中存储了完整上下文(包括用户 prompt · tool call 结果 · 文档内容等),这些数据在 GPU 显存中以明文形式存在,存在隐私泄露风险 - 主要发现 3 条: - KV-cache 可被利用进行侧信道攻击,恢复敏感信息 - 多租户场景下,共享 GPU 的不同用户可能通过 KV-cache 窃取其他用户数据 - 提出缓解方案 - 可信度:高(NDSS 2026 网络与分布式系统安全研讨会 · 安全四大顶会之一) - 工程价值:⭐⭐⭐⭐ - 风险:对 vLLM/SGLang 生产部署有直接安全参考价值 + KV-cache 加密或隔离方案是 2026 H2 LLM serving 安全的重要议题 + 与 MCP 2.0 的 authorization hardening(jay 1505 briefing B1)结合理解 - flyp 8-1 risk-e1prep 已立 R34 §2.1「推理框架-CVE」向「推理框架-侧信道-隐私」扩面(Shadow in the Cache = memory-as-attack-surface 第四立标;前三个 = StealthBench P0 + Metis P1 + Memory 综述 P1)

KV Cache 顶会三件套立标 = 2026 数据库/通信/系统三大顶会议后,网络/安全/AI 三大顶会议 KV-cache 集中爆发: - SIGMOD 2026(2026-05-18 published · DOI 10.1145/38020284/38020094/3749168 三件套 CoDec/AlignedServe/HotPrefix):§IX 已立标 - SIGCOMM 2026(KVServe/SpectrumKV disagg 通信):§IX 已立标 - HPCA 2026(wafer-scale 系统论文):§IX 已立标 - ACL 2026(System-Aware KV Cache Optimization Survey):§IX 已立标 - + ICDCS 2026(DUAL-BLADE 边缘 NVMe-direct KV-Cache 卸载):本棒新增 - + ICLR 2026(KV Cache Transform Coding 紧凑存储):本棒新增 - + NDSS 2026(Shadow in the Cache KV-cache 隐私/侧信道):本棒新增 - = SIGMOD + SIGCOMM + HPCA + ACL + ICDCS + ICLR + NDSS = 2026 七大顶会议 KV-cache 集中爆发 · 立标证据饱和

与 8-1 §IX 已立内容对照: - §IX §1.(10) 已立 SIGMOD/SIGCOMM/HPCA/ACL 四大顶会议 LLM inference systems track 集中爆发 - 本棒补充 ICDCS + ICLR + NDSS = 七大顶会议 KV-cache 集中爆发立标 - ICDCS 是 IEEE 分布式系统顶会;ICLR 是机器学习顶会;NDSS 是安全顶会 - 意味着 2026 年 KV cache 已从「数据库/系统会议专题」扩面到「分布式/ML/安全跨学科专题」

  • 与活文档关系:§1.(3) KV cache 14+1 件套 + LMCache 2026 Q2 + vLLM FP8 KV 50% + Memory 综述 + §1.(10) SIGMOD 2026 三件套 DOI 5-18 published 已收 + §1.(4) Fail-Plausible 五类 + CVE-2026-22778 RCE 已收;但 DUAL-BLADE ICDCS 2026(prefill -33.1% / decode -42.4% / SSD 2.2×)+ KV Cache Transform Coding ICLR 2026(Transform Coding 紧凑存储)+ Shadow in the Cache NDSS 2026(KV-cache 隐私/侧信道)未单独作为「七大顶会议 KV-cache 集中爆发」入位

  • 建议归入:§1.(3) KV cache 14+1 件套(沿用 + 新增 DUAL-BLADE ICDCS 2026 作为边缘推理 KV 卸载完整方案 + KV Cache Transform Coding ICLR 2026 作为压缩路线)+ §1.(10) SIGMOD/SIGCOMM/HPCA/ACL 顶会议立标(沿用 + 新增 ICDCS/ICLR/NDSS = 七大顶会议 KV-cache 集中爆发立标)+ §1.(4) Fail-Plausible(沿用 + 新增 Shadow in the Cache NDSS 2026 作为「推理框架-侧信道-隐私」memory-as-attack-surface 第四立标);新增 C91 共识候选:"2026 七大顶会议 KV-cache 集中爆发立标 = SIGMOD 2026 三件套(CoDec/AlignedServe/HotPrefix 5-18 published)+ SIGCOMM 2026 KVServe/SpectrumKV disagg + HPCA 2026 wafer-scale + ACL 2026 System-Aware Survey + ICDCS 2026 DUAL-BLADE 边缘 NVMe-direct(prefill -33.1% / decode -42.4% / SSD 2.2×)+ ICLR 2026 KV Cache Transform Coding 紧凑存储 + NDSS 2026 Shadow in the Cache KV-cache 隐私/侧信道(memory-as-attack-surface 第四立标)";新增 O172 试金石:"DUAL-BLADE NVMe-direct 在 LMCache 跨引擎 KV-Cache 持久化中的集成可行性;KV Cache Transform Coding 相对 TurboQuant 6× 的精度损失曲线;Shadow in the Cache 缓解方案在 vLLM/SGLang 生产部署的兼容性"

增量 2【调度 §2.2 / Agentic Serving】Agentic Serving 调度立标三件套:GoodServe arXiv:2605.16867v1 + AMPD arXiv:2602.14516v2 + Workload-Router-Pool arXiv:2603.21354v2 vLLM Semantic Router(★★ 必补)

  • 来源:inbox/jay/2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026.md §A1/A2/A5(⭐⭐⭐⭐⭐ + ⭐⭐⭐⭐ + ⭐⭐⭐⭐)+ inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md §1 AMPD arXiv:2602.14516v2(真实系统对比)+ inbox/jay/2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb.md §Backend B1 MCP 2.0 + §C1 MCP 2.0 云原生 + organized/knowledge/llm-infra.md §1.(2) 调度 9 学派 + MathOpt 2605.01280 Ω(√(B log G)) + MC-SF 2502.07115v5 ILP + LAAR 2604.15732v1 Envoy EPP llm-d MaxScorePicker + Fluid-Guided WAIT 2504.11320v4 + Disagg 5 节点 + HaoaiLab DistServe + Nexus intra-GPU + PPD Append-Prefill + SPAD H100 + NVIDIA Rubin CPX 已收

Agentic Serving 调度立标三件套完整展开:

A1 · GoodServe: Agentic LLM 推理的高 Goodput 调度 arXiv:2605.16867v1 · 2026-05 · ⭐⭐⭐⭐⭐ - 核心问题:Agentic LLM 推理有明确的端到端延迟 SLO 要求(E2E-SLO),系统需最大化 goodput(满足 SLO 的请求比例) - 关键技术贡献: - 问题建模:在 GPU 异构资源上调度 agentic LLM 推理,将 GPU 组合作为输入条件而非优化目标(与 SageServe、llm-d 互补) - 与 vLLM 的关联:指出主流 LLM 框架(vLLM 2026)中,batched serving 模式下 request-rr 在 GPU-gg 上的实际执行效率受形状(LinL 和 LoutL)和竞争请求共同影响,难以精确计算 - 调度策略:提出在异构 GPU 资源下最大化 goodput 的在线调度框架 - 可信度:高(arXiv 预印本,来自主流 LLM 系统社区) - 工程价值:⭐⭐⭐⭐⭐ - 与 vLLM PagedAttention 的 KV-cache 管理直接互补 + 为 agentic 推理服务的 SLO 保障提供调度层参考 + 建议精读原文调度算法伪代码,与 vLLM 调度器行为对照

A2 · AMPD: 多轮 LLM 推理的分不解离 Serving 框架 arXiv:2602.14516v2 · 2026-02(最新版本)· ⭐⭐⭐⭐ - 核心问题:多轮 LLM 推理(ReAct 风格 agent)中,prefill 和 decode 工作负载交替出现,传统 PD 分不解离(co-location)或固定分离策略均无法高效适应这种交错模式 - AMPD 方案 2 件套: - 自适应路由机制(Adaptive Routing):根据运行时 prefill/decode 负载动态分配资源 - Prefill 重新排序策略(Prefill Reordering Policy):平衡 prefill 和 decode 负载 - 对比基线:与 vLLM(PD co-location)、NVIDIA Dynamo(固定 PD 分离)对比 - 关键数据:AMPD 相比 Dynamo 在多轮推理场景下有显著效率提升(具体数据需精读原文) - 可信度:高(arXiv + 2026 系统论文) - 工程价值:⭐⭐⭐⭐ - 与 NVIDIA Dynamo 路线直接竞争(Dynamo 2026b 是其分不解离 baseline) + 对 SWE-Bench、BFCL 等 agent 基准有针对性优化 + 建议关注 prefill reorder 策略可否迁移到 vLLM/SGLang 调度器

A5 · Workload-Router-Pool Architecture: vLLM Semantic Router 项目愿景论文 arXiv:2603.21354v2 · 2026-03 · ⭐⭐⭐⭐ - 核心架构(三维度协同优化): 1. Workload(工作负载):请求特性 · TTFT/SLO 分布 2. Router(路由):模型路由 · 语义路由 · SLO 感知的 admission control 3. Pool(资源池):KV-cache 管理 · 多模型级联 - 关键引用系统 5 件:

系统 会议/年份 关键技术
AGSERVE NeurIPS 2025 Session-aware KV-cache + model cascading
Helium - Agentic workflow as query plans + proactive caching
SUTRADHARA - Orchestrator + serving engine co-design
Continuum - KV-cache TTL pinning for multi-turn scheduling
Concur ICML 2026 Agent-level admission control
  • 重要发现:
  • Silent drift detection:监控 per-(model, domain) 统计数据检测模型质量回归(2026-03 有实际案例:frontier model 无代码变更静默降级到 mid-tier)
  • 3σ 偏离滑动窗口基线时自动触发流量重平衡
  • 可信度:高(vLLM 社区 + NeurIPS/ICML 2026 引用)
  • 工程价值:⭐⭐⭐⭐
  • 为生产 LLM serving 的观测和稳定性保障提供架构框架 + 与 vLLM 0.7+ 的 streaming parser 和 model runner v2 直接对齐 + 建议作为生产 LLM serving 架构设计参考,结合 vLLM 官方文档精读

Agentic Serving 调度立标三件套 = LLM serving 调度理论 2026 H2 三大补充(与 MC-SF/LAAR 离线理论 + 在线路由形成「Agentic 推理服务 goodput + 多轮 PD 分不解离 + 三维度协同优化」补充): - MC-SF + LAAR + MathOpt + Fluid-Guided WAIT:已立标(§IX §1.(2)) - GoodServe:在 GPU 异构资源下最大化 goodput(E2E-SLO 满足率) - AMPD:多轮 PD 分不解离 + 自适应路由 + prefill reorder - Workload-Router-Pool:三维度协同 + silent drift detection 静默降级检测

  • 与活文档关系:§1.(2) 调度 9 学派 + MathOpt 2605.01280 Ω(√(B log G)) + MC-SF 2502.07115v5 ILP + LAAR 2604.15732v1 Envoy EPP llm-d MaxScorePicker + Fluid-Guided WAIT 2504.11320v4 + Disagg 5 节点 + HaoaiLab DistServe + Nexus intra-GPU + PPD Append-Prefill + SPAD H100 + NVIDIA Rubin CPX 已收;但 GoodServe arXiv:2605.16867v1(Agentic E2E-SLO goodput 调度)+ AMPD arXiv:2602.14516v2 v2(多轮 PD 分不解离)+ Workload-Router-Pool arXiv:2603.21354v2 v2(vLLM Semantic Router 愿景论文 + silent drift detection)未单独作为「Agentic Serving 调度立标三件套」入位

  • 建议归入:§1.(2) 调度 9 学派 + Disagg 5 节点(沿用 + 新增 GoodServe + AMPD + Workload-Router-Pool 作为「Agentic Serving 调度立标三件套 · 补充 MC-SF/LAAR 离线理论 + 在线路由」);新增 C92 共识候选:"LLM serving 调度理论 2026 H2 七大突破 = MC-SF 2502.07115v5 ILP 竞争比(离线理论)+ LAAR 2604.15732v1 Envoy EPP llm-d MaxScorePicker(在线路由)+ MathOpt 2605.01280 Ω(√(B log G))(OR 立场论文)+ Fluid-Guided WAIT 2504.11320v4 v4(现代生产 vLLM 2026 默认 recomputation)+ GoodServe 2605.16867v1(Agentic E2E-SLO goodput 调度 · ⭐⭐⭐⭐⭐) + AMPD 2602.14516v2 v2(多轮 PD 分不解离 + 自适应路由 + prefill reorder) + Workload-Router-Pool 2603.21354v2 v2(vLLM Semantic Router 愿景论文 + silent drift detection 静默降级检测) = 理论 + 工程 + 在线 + Agentic 四轴并行 · 共同方法论:仅需输出长度上界预测 + SLO 决策原则";新增 O173 试金石:"GoodServe goodput 调度在 vLLM/SGLang 实际部署 SLA;AMPD prefill reorder 策略与 vLLM/SGLang scheduler 集成时间线;Workload-Router-Pool silent drift detection 在 frontier model 静默降级检测的实测覆盖率"

增量 3【推理引擎 §2.1 / 配置优化 §2.13】AIConfigurator arXiv:2601.06288v1 多框架最后一公里配置优化 + Fluid-Guided arXiv:2504.11320v4 v4 更新(★★ 必补)

  • 来源:inbox/jay/2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026.md §A3/A4/A6(⭐⭐⭐⭐ + ⭐⭐⭐⭐ + ⭐⭐⭐⭐)+ inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md §4 KernelSight-LM(2606.28565v1 inference simulator · vs Vidur/AIConfigurator 横向对照)+ organized/knowledge/llm-infra.md §1.(1) 推理引擎 6 寡头 + vLLM 0.7 MRv2 Rel-26.07 + SGLang V2 + DFlash + Spec V2 + SGLang×TPU + Kimi K3 2.8T + TGI 维护 + Colibri 744B/25GB + §1.(2) Fluid-Guided WAIT 2504.11320v4 + §2.13 选型决策树 v3.0 已收

AIConfigurator arXiv:2601.06288v1 · 2026-01 · ⭐⭐⭐⭐ 完整展开: - 核心贡献:针对 vLLM · SGLang · TensorRT-LLM 等多框架的"最后一公里"配置优化问题

优化维度 具体技术
先进调度 Continuous Batching · PagedAttention · Chunked Prefills · PD Disaggregation
模型并行 TP · PP · Expert Parallelism(MoE)
推理优化 Kernel Fusion · Tensor Optimization · Memory Layout Tuning
  • 可信度:高(arXiv)
  • 工程价值:⭐⭐⭐⭐
  • 与 jay 8-1 engineering-filter §4 KernelSight-LM arXiv:2606.28565v1 inference simulator 互补:AIConfigurator 是配置优化(算子级表插值),KernelSight-LM 是仿真预测(GB200 Tier B · 3.8% error 跨代);Vidur 离散事件仿真 vs AIConfigurator 算子级表插值 = inference capacity planning 工具化进步
  • 与实际部署关联:涉及 FlashAttention3 · FlashInfer · FlashMLA 等 kernel 选型
  • 建议作为多框架对比的背景文献

Fluid-Guided arXiv:2504.11320v4 v4 · 2025-04(2026 更新 v4)· ⭐⭐⭐⭐ 完整展开: - 核心问题:当总 KV cache 超过 GPU 显存容量时,系统必须驱逐部分 in-progress prompts。两种方法: 1. Swap 到 CPU/SSD(I/O 开销) 2. Recomputation(丢弃 KV cache,从 prefill 重新开始) - 方案:聚焦 recomputation(现代生产系统如 vLLM 2026 的默认策略),提出 Fluid-Guided 调度算法,通过流体引导最小化驱逐 - 技术细节: - 基于 Vidur 模拟器(A100 80GB · Llama-2-7B · FP16 KV-cache token 占 0.5 MiB) - 分析了 baseline 1% memory margin 下的 KV-cache cap 配置 - 可信度:高(arXiv) - 工程价值:⭐⭐⭐⭐ - 与 vLLM PagedAttention 的 KV-cache 管理机制直接相关 + Recomputation 策略是 vLLM 生产部署中的关键调参点 + 建议与 vLLM 源码中 eviction 策略对照阅读 - v4 更新意义:沿用 v3 基础理论 + v4 实测数据更新 = 现代生产 vLLM 2026 默认 recomputation 策略的实测对照基线

推理引擎配置优化双立标:AIConfigurator(算子级表插值 · 多框架最后一公里)+ Fluid-Guided WAIT v4(仿真器实测 · vLLM 2026 默认 recomputation)+ KernelSight-LM(GB200 跨代仿真 · 3.8% error) = 2026 H2 inference capacity planning 工具化进步三件套

  • 与活文档关系:§1.(1) 推理引擎 6 寡头 + vLLM 0.7 MRv2 Rel-26.07 + SGLang V2 + DFlash + Spec V2 + Kimi K3 2.8T + TGI 维护 + Colibri + §1.(2) Fluid-Guided WAIT 2504.11320v4(原 v1 已立)+ §2.13 选型决策树 v3.0 已收;但 AIConfigurator arXiv:2601.06288v1 多框架最后一公里配置优化(沿用 8-1 工程筛选 §4 KernelSight-LM 与 AIConfigurator 对照)未单独作为「多框架配置优化立标」入位;Fluid-Guided WAIT 2504.11320v4 v4 更新(现代生产 vLLM 2026 默认 recomputation)未单独作为「v4 实测基线」入位

  • 建议归入:§1.(1) 推理引擎 6 寡头(沿用 + 新增 AIConfigurator arXiv:2601.06288v1 多框架最后一公里配置优化作为推理引擎 capacity planning 工具化立标)+ §1.(2) 调度 9 学派(沿用 Fluid-Guided WAIT v4 + 强化 v4 更新意义 = 现代生产 vLLM 2026 默认 recomputation 实测基线)+ §2.13 选型决策树 v3.0(沿用 + 新增 KernelSight-LM 2606.28565v1 GB200 跨代仿真 3.8% error);新增 C93 共识候选:"推理引擎配置优化三件套 2026 H2 = AIConfigurator 2601.06288v1 算子级表插值(多框架最后一公里)+ Fluid-Guided WAIT 2504.11320v4 v4 仿真器实测(现代生产 vLLM 2026 默认 recomputation 1% memory margin)+ KernelSight-LM 2606.28565v1 GB200 跨代仿真 3.8% error · 与 Vidur 离散事件仿真互补 = inference capacity planning 工具化进步";新增 O174 试金石:"AIConfigurator 在 FlashAttention3/FlashInfer/FlashMLA 等 kernel 选型的实测基线;Fluid-Guided WAIT v4 recomputation 策略与 vLLM 2026 默认行为的一致性;KernelSight-LM 在 H100/H200/B200/GB200 跨代 GPU 仿真的误差分布"

增量 4【推理引擎 §2.1 / 选型决策树 §2.13】推理引擎 4 选 1 横评 8-1 三源交叉(YottaLabs + Spheron + DeployBase + Superlinked + AI Engineer 1000+ JD)(★★ 必补)

  • 来源:inbox/jay/2026-08-01T1735-jay-inference-engines-open-llms-2026.md §D1/D2/D5/D6/D7(⭐⭐⭐⭐ + ⭐⭐⭐ + ⭐⭐⭐⭐ + ⭐⭐⭐ + ⭐⭐⭐)+ inbox/jay/2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb.md §B2 Spheron H100 基准(vs 7-31 jay 1735-briefing 沿用)+ organized/knowledge/llm-infra.md §1.(1) 推理引擎 6 寡头 + TGI 维护 + Colibri + §2.13 选型决策树 v3.0 + §1.(7) Inference Engineering 5 维立标已收

推理引擎 4 选 1 横评 8-1 afternoon 三源交叉完整展开:

8-1 1735 briefing D1 · YottaLabs + Spheron + DeployBase 三源 vLLM vs SGLang vs TRT-LLM vs TGI 横向对比(2026-07-13 YottaLabs + 2026-03-23 Spheron H100 80GB 实测 + 2026-02-23 DeployBase):

引擎 核心优势 最佳场景 劣势
vLLM PagedAttention 显存高效 · 连续批处理成熟 · 200+ 模型支持 高并发 throughput · 大规模部署 · 私有化 冷启动慢 · TTFT 略高于 TensorRT
SGLang RadixAttention 前缀复用 · 结构化输出强 · 多阶段推理管道化 Agentic RAG · 多跳推理 · 长上下文 · 结构化生成 生态较新 · 生产部署经验文档少于 vLLM
TensorRT-LLM FP8 图编译 · TTFT 最优 · H100/HGX 深度优化 实时语音/交易 · 低 TTFT 强需求 · NVIDIA 专属环境 绑定 NVIDIA · 多 GPU 配置复杂 · 不支持 AMD
TGI HuggingFace 原生 · 部署最简单 · 开源生态好 快速 PoC · HuggingFace 模型直接部署 性能低于 vLLM/SGLang · 不适合高并发生产

8-1 1735 briefing D1 关键工程洞察 4 条: 1. SGLang 在 2026 上半年快速追赶:2026-06 SGLang Blog 披露 GB300 NVL72(NVL72 rack-scale)上实现 25× 推理性能提升;Day-0 支持 DeepSeek-V4(2026-04)和 GLM-5 系列;2026-06 新增 DFlash 和 Spec V2 投机解码优化 2. SGLang 多 GPU 生产部署文档完善度提升:llama.cpp / vLLM / SGLang 在 DGX Spark(GB10)上的对比讨论活跃,SGLang 在 MXFP4 量化格式上表现优于 vLLM 3. vLLM 仍是企业主流选择:生产部署基数最大,vLLM 0.4.x 系列持续活跃,但 SGLang 正在从"实验性"转向"生产就绪" 4. 2026 新格局:推理引擎选择取决于工作负载类型,而非单纯追求 benchmark 第一

8-1 1505 briefing B2 · Spheron H100 基准 2026-03-23 Llama 3.3 70B FP8(沿用 7-31 1735 briefing):

Concurrency vLLM TensorRT-LLM SGLang
1 req 120 tok/s 130 tok/s 125 tok/s
10 req 650 tok/s 710 tok/s 680 tok/s
50 req 1,850 tok/s 2,100 tok/s 1,920 tok/s
100 req 2,400 tok/s 2,780 tok/s 2,460 tok/s

8-1 1735 briefing D2 · Superlinked vLLM vs SGLang 生产搜索 Pipeline 定位差异(2026-07-27): - 核心观点:vLLM 和 SGLang 在生产搜索 Pipeline 中不是三选一,而是两个不同层次: - 检索层(embedding/vector search):Superlinked Inference Engine(SIE)类工具负责 - 生成层(LLM 推理):vLLM / SGLang 二选一 - 工程价值:明确区分了 Pipeline 各层职责,避免"选错引擎但用在错误的 Pipeline 位置"这类工程陷阱 - 建议:知识库 RAG Pipeline 架构页补充此视角

8-1 1735 briefing D5 · AI Engineer 1000+ JD Substack 实证(Alex Chen · alexeyondata.substack.com · 1000+ 样本): - 核心数据(可信度高,1000+ 样本): - AI-first 角色(~70%):直接做 LLM/GenAI 系统:RAG · Agent · 评估 · 生产部署 - AI-support 角色(~28.5%):AI 基础设施和平台:GPU/推理基础设施 · 数据 Pipeline · MLOps 工具 - 核心技能栈(工程视角): Python + TypeScript SQL + Apache Spark Docker + Kubernetes LLM 编排 / RAG Pipeline / Agent 工作流(2026 非必修) API / 部署 / 监控 - 职位描述高频关键词:RAG systems · agents · productionize · API · deployment · monitoring · retrieval over proprietary data · internal AI platforms · agent workflows · evaluation · guardrails · observability - 评价:目前最系统的 AI Engineer 职位需求实证研究,1000+ 样本量具有统计意义

8-1 1735 briefing D6 · LLM Engineer vs AI Engineer 技能分野(Emerging AI): - 核心观点:

"AI Engineer 2026 = someone who can take a model and turn it into a working system." - A system that reads data / calls tools / remembers context / retrieves documents / gives structured output - A system that can be tested, deployed, monitored, and improved - 技能树对比(LLM Engineer vs AI Engineer):

维度 LLM Engineer AI Engineer
核心能力 模型微调 · 预训练 · RLHF RAG · Agent · API 集成 · 部署监控
数学深度 高(Transformer 原理 · 注意力机制) 中(懂原理但不从头训练)
框架重点 PyTorch · TRL · DeepSpeed LangChain/LangGraph · vLLM · SGLang
评估方式 Benchmarks(MMLU/HumanEval) Evals · Guardrails · LLM-as-Judge

8-1 1735 briefing D7 · GitHub Top 12 AI Repos 2026: - Hannibal046/Awesome-LLM:最全 LLM 路线图(沿用) - Langflow:Low-code AI · Drag-and-drop RAG/Agent 设计(LangChain 上层封装) - Dify:开源 LLM App 平台 · RAG/Agent/工作流 · SaaS + 自部署 - Ollama + Open WebUI + OpenClaw:本地 AI 栈 · 单命令部署 AI 平台

推理引擎 4 选 1 横评 8-1 afternoon 三源交叉 = 2026 推理引擎选型决策树 v4.0: - v3.0(7-31):TGI 维护模式 + Colibri + Spheron H100 + DevOpsBeast workload-first + inferenceengineering.tech 对照表(6→5 框架) - v4.0(8-1):YottaLabs + Spheron + DeployBase + Superlinked Pipeline 检索/生成分层 + AI Engineer 1000+ JD 实证 + LLM Engineer vs AI Engineer 分野 + GitHub Top 12(低代码 AI 平台成熟) - 核心增量:Superlinked Pipeline 检索/生成分层(SIE 检索层 + vLLM/SGLang 生成层)= 选型决策树新增"Pipeline 分层"维度 + AI Engineer 1000+ JD 实证(70% AI-first + 28.5% AI-support + RAG 35.9% / Agent 14.4% / Fine-tuning 8.5%)= 选型决策树新增"角色定位"维度 + Langflow/Dify 低代码 AI 平台从 Demo 工具 → 生产就绪选项 = 选型决策树新增"低代码 vs 框架"维度

  • 与活文档关系:§1.(1) 推理引擎 6 寡头 + vLLM 0.7 MRv2 Rel-26.07 + SGLang V2 + DFlash + Spec V2 + SGLang×TPU + Kimi K3 2.8T + TGI 维护 + Colibri + §2.13 选型决策树 v3.0 + §1.(7) Inference Engineering 5 维立标(Gergely Orosz Pragmatic Engineer · Dennis Kennetz 4 阶段 · Alexey Data Substack · Deep|LLM 2026 + 推理引擎多件套)已收;但 Superlinked Pipeline 检索/生成分层 + AI Engineer 1000+ JD 实证 + LLM Engineer vs AI Engineer 技能分野 + GitHub Top 12(Langflow/Dify 低代码平台)未单独作为「选型决策树 v4.0 Pipeline 分层 + 角色定位 + 低代码 vs 框架 三维度」入位

  • 建议归入:§1.(1) 推理引擎 6 寡头(沿用 + 新增 Langflow/Dify 低代码 AI 平台成熟作为「推理引擎选型补充 · 低代码 vs 框架」)+ §2.13 选型决策树(升级为 v4.0 多源交叉:YottaLabs + Spheron + DeployBase + Superlinked Pipeline 检索/生成分层 + AI Engineer 1000+ JD + LLM Engineer vs AI Engineer + Langflow/Dify 低代码)+ §1.(7) Inference Engineering 5 维立标(沿用 Gergely Orosz/Dennis Kennetz/Alexey Data/Deep|LLM + 新增 LLM Engineer vs AI Engineer 技能分野作为「2026 AI Engineer 角色实证 · 70% AI-first + 28.5% AI-support」);新增 C94 共识候选:"推理引擎选型决策树 v4.0 = TGI 维护(6→5 框架)+ YottaLabs vLLM/SGLang/TRT-LLM/TGI 横评 + Spheron H100 实测(120/650/1850/2400 tok/s vs 130/710/2100/2780 vs 125/680/1920/2460) + DevOpsBeast workload-first + inferenceengineering.tech 对照表 + Superlinked Pipeline 检索/生成分层(SIE 检索层 + vLLM/SGLang 生成层) + AI Engineer 1000+ JD 实证(70% AI-first + 28.5% AI-support + RAG 35.9% / Agent 14.4% / Fine-tuning 8.5%) + LLM Engineer vs AI Engineer 技能分野 + Langflow/Dify 低代码 AI 平台从 Demo → 生产就绪 = 多源交叉 v4.0";新增 O175 试金石:"Superlinked SIE 在 vLLM/SGLang 生产部署的检索层集成 SLA;AI Engineer 70% AI-first 在 2027 Gartner 40% 废弃预测下的稳定性;Langflow/Dify 在企业生产部署的安全合规"

增量 5【Harness Engineering §2.4 / Service Layer §2.7】MCP 2.0 Stateless Simon Willison HTTP 格式对比 + MSR Echoverse + MSR SymCrypt + MirrorCode 三件套联动(★★ 必补)

  • 来源:inbox/jay/2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb.md §B1 MCP 2.0(⭐⭐⭐⭐⭐)+ §B3 Lilian Weng Harness(⭐⭐⭐⭐⭐ · 沿用 §IX)+ §B4 ByteByteGo Agent Loop(⭐⭐⭐⭐⭐ · 沿用 §IX)+ §R1 MirrorCode(⭐⭐⭐⭐⭐)+ inbox/jay/2026-08-01-engineering-e1prep.md 增量 3 Lilian Weng Harness(沿用 §IX)+ 增量 4 Simon Willison MCP 2.0(沿用 §IX)+ 增量 5 MSR Echoverse(沿用 §IX)+ 增量 6 MSR SymCrypt(沿用 §IX)+ 增量 1 ByteByteGo 三层架构(沿用 §IX)+ 增量 2 MirrorCode(沿用 §IX)+ organized/knowledge/llm-infra.md §1.(4) 服务层并发安全 + Fail-Plausible 五类 + CVE-2026-22778 + §1.(5) Harness Engineering Phase 4(已立 ByteByteGo 三层模型 + MirrorCode + Lilian Weng Harness + MSR Echoverse + MCP 2.0 Stateless + smevals)已收

8-1 afternoon MCP 2.0 Stateless 协议级简化 Simon Willison 印证(沿用 §IX 已立): - Before(legacy stateful MCP):两次 HTTP 请求: http POST /mcp # Step 1: initialize, 获取 Mcp-Session-Id Mcp-Session-Id: 1868a90c-3a3f-4f5b POST /mcp # Step 2: 实际调用 tool - After(MCP 2.0 stateless):单次 HTTP 请求: http POST /mcp HTTP/1.1 MCP-Protocol-Version: 2026-07-28 Mcp-Method: tools/call Mcp-Method-Name: search - 8-1 1505 B1 补充细节: - 每个请求独立携带协议版本 · 客户端身份 · 客户端能力(放在 _meta 中) - 可选 server/discover RPC(但非必需) - 任何请求可以路由到任何服务器实例,支持普通 round-robin 负载均衡 - 废除 initialize/initialized 握手 - 废除 Mcp-Session-Id header - Mcp-MethodMcp-Name header 强制要求 - list_* 结果携带 ttlMscacheScope,可被 gateway 缓存 - 授权加固:RFC 9207 issuer 验证 + CIMD(Dynamic Client Registration → Client Metadata Documents) + Enterprise Managed Authorization(EMA)扩展框架 - 新攻击面 3 类(Backslash Security): - Handle Hijacking:原 session hijacking 需要访问 session store;新架构下 handle 只是模型可见的字符串,模型可以 echo 和传递 - Stateless ≠ Stateless App:协议层无状态,但应用层状态管理方式变化 - 权限边界消失:server-to-client 请求不再依赖持久连接,原有边界机制不再不再存在

8-1 afternoon MSR Echoverse + MSR SymCrypt + MirrorCode 三件套联动立标(沿用 §IX 已立 · 本棒强化): - MSR Echoverse 9B 36.5% → 67.1%(几乎翻倍):与 GPT-5.4 差距缩小到 14 个百分点;关键发现 4 条:High simulation fidelity is a must-have + Drilling challenging controls + Co-evolution + RL > Imitation(grounded verifier reward > imitation learning) - MSR SymCrypt Rust+Lean+Aeneas 形式化验证:AI Agent 在验证中的角色 = 人类 review 标准形式化 + 主要 property + Agent(stochastic)写 proof 和中间 property + 确定性步骤(编译/代码提取/proof 验证)非 agentic;已验证 SHA-3 + ML-KEM(Rust 代码已在 Windows insider build 中使用) - MirrorCode METR/Epoch $251/14h/25 目标 17/25 100%:测试 AI 系统完成"人类需要数周"编程任务的能力;Opus 4.7 完成 gotree 14 小时 · $251 推理成本(多语言);25 个目标:17 个达 100% 正确率 / 4 个 >99% / 8 个未达 100% / 4 个未达 99%;1 年前领先模型得分仅 30%(仅完成 calendar utility 简单程序)

8-1 afternoon MCP 2.0 + MSR Echoverse + MSR SymCrypt + MirrorCode 四立标联动: - MCP 2.0 Stateless(协议层简化 + 安全加固):Harness Engineering 协议立标 - MSR Echoverse 9B 67.1%(训练端合成世界 + RL > Imitation):Harness Engineering 训练端立标 - MSR SymCrypt Rust+Lean+Aeneas(形式化验证 + AI Agent 写 proof):Harness Engineering 主动防御立标 - MirrorCode $251/14h/25 目标 17/25 100%(评测端超长程任务):Harness Engineering 评测端立标 - = 2026 H2 Harness Engineering Phase 4 五维立标(协议 + 训练 + 主动防御 + 评测 + 工程实践 = ByteByteGo 三层模型)

  • 与活文档关系:§1.(4) 服务层并发安全 + Fail-Plausible 五类 + CVE-2026-22778 + §1.(5) Harness Engineering Phase 4(已立 ByteByteGo 三层模型 + MirrorCode + Lilian Weng Harness + MSR Echoverse + MCP 2.0 Stateless + smevals)已收;但 8-1 afternoon 1505 briefing B1 MCP 2.0 完整 8 条补充细节(协议版本 · 客户端能力 meta · Mcp-Method/Name header 强制 · list* 缓存 ttlMs/cacheScope · 授权加固 RFC 9207 issuer + CIMD + EMA · 新攻击面 3 类 Handle Hijacking/Stateless≠Stateless App/权限边界消失)未单独作为「MCP 2.0 协议级简化 + 安全加固」完整入位

  • 建议归入:§1.(5) Harness Engineering Phase 4(沿用 + 强化 MCP 2.0 Stateless 协议级简化 8 条完整细节 + 新攻击面 3 类作为「协议层简化与安全加固对立统一」)+ §1.(4) 服务层并发安全(沿用 + 新增 MCP 2.0 Stateless 新攻击面 3 类作为「协议层无状态化的安全代价」);新增 C95 共识候选:"MCP 2.0 Stateless(2026-07-28)协议级简化 + 安全加固 8 条完整 = 协议版本/客户端身份/客户端能力 meta + Mcp-Method/Name header 强制 + list 缓存 ttlMs/cacheScope + 授权加固 RFC 9207 issuer + CIMD + EMA + 新攻击面 3 类(Handle Hijacking/Stateless≠Stateless App/权限边界消失);Harness Engineering Phase 4 五维立标 = 协议(MCP 2.0)+ 训练(MSR Echoverse 9B 67.1%)+ 主动防御(MSR SymCrypt Rust+Lean+Aeneas)+ 评测(MirrorCode $251/14h/25 目标 17/25 100%)+ 工程实践(ByteByteGo 三层模型)";新增 O176 试金石*:"MCP 2.0 Stateless 新攻击面 3 类在 vLLM/SGLang tool parser 的兼容性;MSR Echoverse 9B 67.1% 与 GPT-5.4 14 个百分点差距的可复现性;MSR SymCrypt 形式化验证在 LLM 系统安全(如 vLLM RCE)的扩展可行性"


二、旁证(3 条)

旁证 1【推理引擎 §2.1 / 路由 §2.6】Workload-Router-Pool vLLM Semantic Router 愿景论文 arXiv:2603.21354v2(★★)

  • 来源:inbox/jay/2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026.md §A5 + inbox/jay/2026-08-01-engineering-filter-arxiv-inference-harness.md §2 LAAR Envoy EPP(邻接)
  • 完整内容:已纳入增量 2(Agentic Serving 调度立标三件套),本旁证强调 vLLM Semantic Router 项目愿景意义
  • 关键引用系统 5 件:AGSERVE NeurIPS 2025(Session-aware KV-cache + model cascading)+ Helium(Agentic workflow as query plans + proactive caching)+ SUTRADHARA(Orchestrator + serving engine co-design)+ Continuum(KV-cache TTL pinning for multi-turn scheduling)+ Concur ICML 2026(Agent-level admission control)
  • 重要发现:Silent drift detection 静默降级检测 = 监控 per-(model, domain) 统计数据检测模型质量回归(2026-03 有实际案例:frontier model 无代码变更静默降级到 mid-tier)+ 3σ 偏离滑动窗口基线时自动触发流量重平衡
  • 意义:与 LAAR arXiv:2604.15732v1 Envoy EPP 路由(在 llm-d 集成)互补 = Long-Context-Aware Routing + Workload-Router-Pool 三维度 = 2026 H2 路由立标三件套

旁证 2【KV cache §2.3 / 边缘推理 §2.10】DUAL-BLADE arXiv:2604.26557 ICDCS 2026 边缘 NVMe-direct KV-Cache 卸载(★★)

  • 来源:inbox/jay/2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb.md §D2(⭐⭐⭐⭐)
  • 完整内容:已纳入增量 1(KV Cache 顶会三件套),本旁证强调边缘推理 + LMCache 集成路径
  • 关键数据:prefill -33.1% / decode -42.4% / SSD 2.2×
  • 关键技术 3 件套:Dual-Path KV Residency + NVMe-direct I/O + Adaptive Pipeline Parallelism
  • 建议关注:LMCache 与 DUAL-BLADE 的集成可行性(LMCache 2026 Q2 Roadmap 完成 vLLM/SGLang/TRT-LLM/Modular 4 引擎中立化,但 NVMe-direct 边缘推理场景未覆盖)
  • 与 vLLM --swap-space 参数的工程意义对比:更系统化的 KV 卸载方案

旁证 3【KV cache §2.3 / 服务层并发安全 §2.4】Shadow in the Cache arXiv:2508.09442 NDSS 2026 KV-cache 隐私/侧信道(★★)

  • 来源:inbox/jay/2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb.md §D3(⭐⭐⭐⭐)+ inbox/flyp/2026-08-01-risk-e1prep.md 增量 1(🟠 P0 警示 · flyp 8-1 risk 立 R34 §2.1「推理框架-侧信道-隐私」memory-as-attack-surface 第四立标)
  • 完整内容:已纳入增量 1(KV Cache 顶会三件套),本旁证强调与 CVE-2026-22778 + Fail-Plausible 互补
  • 核心发现 3 条:KV-cache 可被利用进行侧信道攻击恢复敏感信息 + 多租户共享 GPU 可窃取其他用户数据 + 缓解方案提出
  • 与 MCP 2.0 authorization hardening 结合理解(Backslash Security 新攻击面 3 类中的"权限边界消失")
  • 意义:CVE-2026-22778(协议层远程利用)+ Shadow in the Cache(协议层侧信道/隐私)= 服务层并发安全从「远程 RCE 主动利用」扩面到「侧信道/隐私被动泄露」

三、警示(2 条)

警示 1【调度 §2.2 / 主题接力 §0】⚠️ Tom inference E1 已恢复但 8-1 仍缺 inference-e1prep 独立产出 + spark 8-1 morning 节奏反转后第 8 棒独立 E1 持续缺失(本棒恢复 llm-infra-e1prep-v13)

  • 来源:inbox/tom/2026-07-31-inference-e1prep.md(7-31 22:22 · 上一棒已恢复)+ inbox/tom/2026-08-01-* 5 件(0840-agent-rag-longcontext-radar + 0900-hf-daily-2026-08-01 + 1003/1004 RSS YT + 0852-rag-e1prep + T1440-agent-rag-longcontext-radar + evaluation-e1prep)· 无 8-1 inference-e1prep.md + inbox/spark/2026-08-01-* 4 件(1001/1002/1004 RSS 通稿 + 1330-agent-e1prep-v37)· 无 8-1 morning 独立 llm-infra/engineering E1 · 本棒 llm-infra-e1prep-v13 恢复 spark E1 产出
  • 警示内容:
  • Tom inference 主题 E1 7-31 22:22 已恢复(继 7-27/7-28/7-29/7-30 连续 4 日缺失 → 7-31 单棒恢复 + 8-1 0 件 = tom inference E1 信号恢复第 1 日后再次静默)
  • Spark 8-1 morning 节奏反转后第 8 棒独立 E1 持续缺失(继 7-30 morning 第 6 棒静默 → 7-30 evening 第 11 棒 llm-infra-e1prep-v11 恢复 → 7-31 morning 第 7 棒静默 → 7-31 evening 第 12 棒 llm-infra-e1prep-v12 恢复 → 8-1 morning 第 8 棒静默 → 8-1 evening 本棒 llm-infra-e1prep-v13 恢复 = 节奏反转后第 8 棒静默期判断延续)
  • Stability of spoken 接力:stephen 8-1 1245 coordination-check-noon #7 强提醒 spark 8-1 evening 棒必须确认恢复
  • 风险:
  • tom inference 主题信号恢复后再次静默:7-27 4 主线 → 7-28/7-29/7-30 连续 3 日 0 件 → 7-31 单棒恢复 → 8-1 0 件 = 信号恢复后第 2 日再次静默(虽 8-1 HF Daily 8-1 票榜 15 件全核可补,但 inference 主题 E1 独立产出仍缺)
  • spark llm-infra 主题:7-30 evening → 7-31 evening → 8-1 evening(本棒恢复) = 节奏反转后第 8 棒静默期判断
  • 建议行动:
  • 本棒 llm-infra-e1prep-v13 补全 5 主线 + 3 旁证 + 2 警示(KV Cache 顶会三件套 + Agentic Serving 调度立标三件套 + AIConfigurator + Fluid-Guided WAIT v4 + 推理引擎 4 选 1 横评 + MCP 2.0 Stateless 完整 8 条 + MSR Echoverse + MSR SymCrypt + MirrorCode 四立标联动 + 3 旁证) = spark E1 节奏回归第 13 棒
  • 待 tom inference E1 8-1 evening 或 8-2 morning 恢复时核对信号丢失条目;spark 8-1 evening 棒继续稳定产出 llm-infra E1 第 13 棒
  • stephen 8-1 1245 coordination-check-noon #7 7 向覆盖度盘点已立 spark 8-1 evening 恢复棒 = 接力恢复 + 节奏回归

警示 2【RAG/risk §2.13 / 主题接力 §0】⚠️ EU AI Act 2026-08-02 deadline 临门(stephen 1245 coordination-check + flyp 8-1 risk-e1prep 已立 EU 治理小节)

  • 来源:inbox/stephen/2026-08-01-1245-stephen-coordination-check-noon.md(7 向覆盖度盘点)+ inbox/flyp/2026-08-01-risk-e1prep.md(🟠 P0 监管 EU AI Act 8-2 临门)+ inbox/spark/2026-08-01-agent-e1prep.md(EU AI Act 2026-08-02 deadline 临门 P0 警示)+ inbox/jay/2026-08-01-1050-jay-engineering-filter.md(jailbreak 风险沿用)
  • 警示内容:
  • 距 EU AI Act 2026-08-02 执法 deadline 仅 ~14h(stephen 8-1 1245 已立 + spark 8-1 1330 agent-e1prep 沿用 + flyp 8-1 1646 risk-e1prep 沿用)
  • OpenAI 主动提前 24 小时完成治理公开表态(stephen 8-1 1021 ai-industry-e1prep 增量 2 立标)
  • Sam Altman 8-1 华盛顿政策窗口 + 白宫 8-1 前自愿评估框架(stephen 8-1 0910 X-VIP-radar 强提醒)
  • 对 llm-infra 的间接影响:EU AI Act 执法 → 推理引擎公网暴露风险加剧 → CVE-2026-22778 RCE + Shadow in the Cache NDSS 2026 侧信道/隐私 = 推理引擎 0-trust · auth proxy · 速率限制 · 视频处理禁用 · KV-cache 加密/隔离五件套立标
  • 建议行动:
  • stephen 8-1 1245 coordination-check-noon #7 7 向覆盖度盘点已立 EU 治理小节 + stephen 8-1 1021 ai-industry-e1prep 增量 2 立 OpenAI 主动表态 = EU AI Act 8-2 临门 P0 警示接力立标
  • 对 llm-infra 主题的间接影响需在 §2.5 安全 + §2.7 服务层并发安全章节补全(沿用 §IX + 本棒强化)

四、值得警惕的矛盾或待核实说法

# 矛盾/待核实项 来源 风险级别 建议行动
1 DUAL-BLADE arXiv:2604.26557 ICDCS 2026 与 LMCache 跨引擎 KV-Cache 持久化的集成可行性 jay 1505 briefing D2 🟡 待核实 LMCache GitHub Issues + DUAL-BLADE 论文 §4 实验对照
2 KV Cache Transform Coding arXiv:2511.01815 ICLR 2026 相对 TurboQuant 6× 的精度损失曲线 jay 1505 briefing D1 🟡 待核实 ICLR 2026 论文 §5 表格 + TurboQuant 2504.19874 实验对照
3 Shadow in the Cache arXiv:2508.09442 NDSS 2026 缓解方案在 vLLM/SGLang 生产部署的兼容性 jay 1505 briefing D3 + flyp 8-1 risk-e1prep 🟡 待核实 NDSS 2026 论文 §6 mitigation + vLLM/SGLang GitHub issues
4 GoodServe arXiv:2605.16867v1 goodput 调度在 vLLM/SGLang 实际部署 SLA jay 1335 briefing A1 🟡 待核实 论文 §4 算法伪代码 + vLLM/SGLang 调度器对照
5 AMPD arXiv:2602.14516v2 v2 prefill reorder 策略与 vLLM/SGLang scheduler 集成时间线 jay 1335 briefing A2 + jay 8-1 engineering-filter §1 🟡 待核实 AMPD 论文 §3 算法 + vLLM/SGLang GitHub issue
6 Workload-Router-Pool arXiv:2603.21354v2 v2 silent drift detection 在 frontier model 静默降级检测的实测覆盖率 jay 1335 briefing A5 🟡 待核实 vLLM Semantic Router GitHub + frontier model 3σ 偏离案例
7 AIConfigurator arXiv:2601.06288v1 在 FlashAttention3/FlashInfer/FlashMLA 等 kernel 选型的实测基线 jay 1335 briefing A4 🟡 待核实 AIConfigurator 论文 §6 配置表 + kernel benchmark 对照
8 Fluid-Guided WAIT arXiv:2504.11320v4 v4 recomputation 策略与 vLLM 2026 默认行为的一致性 jay 1335 briefing A6 🟡 待核实 vLLM 源码 eviction 策略 + Fluid-Guided 论文 §4 算法对照
9 MCP 2.0 Stateless 新攻击面 3 类(Handle Hijacking/Stateless≠Stateless App/权限边界消失)在 vLLM/SGLang tool parser 的兼容性 jay 1505 briefing B1 + jay 8-1 engineering-e1prep 增量 4 🟡 待核实 vLLM/SGLang GitHub 跟踪 issue + Stacklok 警告细节
10 MSR Echoverse 9B 67.1% 与 GPT-5.4 14 个百分点差距的可复现性 jay 8-1 engineering-e1prep 增量 5 + jay 1505 briefing R1(沿用 §IX) 🟡 待核实 github.com/microsoft/Echoverse 4 世界开源 + HuggingFace 数据集复现
11 MSR SymCrypt 形式化验证在 LLM 系统安全(如 vLLM RCE)的扩展可行性 jay 8-1 engineering-e1prep 增量 6 🟡 待核实 SymCrypt Rust+Lean+Aeneas 工具链 + CVE-2026-22778 漏洞链形式化建模可行性
12 Superlinked SIE 检索层 + vLLM/SGLang 生成层 Pipeline 分层在 RAG 检索/生成的实测集成 SLA jay 8-1 1735 briefing D2 🟡 待核实 Superlinked SIE 文档 + vLLM/SGLang 生成层集成案例
13 AI Engineer 70% AI-first 在 2027 Gartner 40% 废弃预测下的稳定性 jay 8-1 1735 briefing D5 🟢 行业观察 2027 Gartner 报告 + AI Engineer 招聘趋势
14 Langflow/Dify 低代码 AI 平台从 Demo → 生产就绪选项在企业生产部署的安全合规 jay 8-1 1735 briefing D7/D8 🟡 待核实 Langflow/Dify 企业部署案例 + 安全合规审计报告
15 KernelSight-LM arXiv:2606.28565v1 GB200 跨代仿真 3.8% error 在 H100/H200/B200/GB200 跨代 GPU 仿真的误差分布 jay 8-1 engineering-filter §4 🟡 待核实 KernelSight-LM 论文 §5 跨代 GPU 误差表
16 SuperInfer arXiv:2601.20309v2 v2 GH200 NVL2 KV cache offloading 在 vLLM 0.6.6.post1 实际部署 SLA jay 8-1 engineering-filter §3 🟡 待核实 SuperInfer 论文 §6 实验 + vLLM 0.6.6.post1 GitHub

五、本次涉及 arXiv 号列表

arXiv 号 论文/主题 增量归属 建议归位节
2604.26557 DUAL-BLADE · ICDCS 2026 · 边缘 NVMe-direct KV-Cache 卸载(prefill -33.1% / decode -42.4% / SSD 2.2×) 增量 1 + 旁证 2 §1.(3) KV cache
2511.01815 KV Cache Transform Coding · ICLR 2026 · 紧凑压缩存储 增量 1 §1.(3) KV cache / §1.(9) 量化
2508.09442 Shadow in the Cache · NDSS 2026 · KV-cache 隐私/侧信道(memory-as-attack-surface 第四立标) 增量 1 + 旁证 3 §1.(3) KV cache / §1.(4) 服务层并发安全
2605.16867v1 GoodServe · Agentic LLM 推理的高 Goodput 调度(E2E-SLO 满足率 · GPU 异构资源) 增量 2 §1.(2) 调度
2602.14516v2 AMPD · 多轮 LLM 推理的分不解离 Serving(自适应路由 + prefill reorder · vs Dynamo/vLLM baseline) 增量 2 §1.(2) Disagg 5 节点
2603.21354v2 Workload-Router-Pool Architecture · vLLM Semantic Router 项目愿景论文(NeurIPS/ICML 2026 引用 · silent drift detection) 增量 2 + 旁证 1 §1.(2) 调度 / §1.(6) Cloud-Native
2601.06288v1 AIConfigurator · 多框架 LLM Serving 配置优化(vLLM/SGLang/TRT-LLM 最后一公里 · 连续批处理 · PD Disaggregation · Kernel Fusion) 增量 3 §1.(1) 推理引擎 / §2.13 选型决策树
2504.11320v4 Fluid-Guided WAIT v4 · LLM 推理流体引导在线调度(现代生产 vLLM 2026 默认 recomputation · Vidur 仿真器) 增量 3 §1.(2) 调度
2606.28565v1 KernelSight-LM · Kernel-Level LLM Inference Simulator(GB200 Tier B 3.8% error · vs Vidur/AIConfigurator 横向对照) 增量 3(横向) §2.13 选型决策树 / capacity planning
2601.20309v2 SuperInfer · LLM Inference on GH200 Superchip(GH200 NVL2 144GB HBM + 480GB DRAM · KV cache offloading) 增量 3(横向) §1.(3) KV cache / §1.(10) 系统栈
2604.15732v1 LAAR Long-Context-Aware 分布式 LLM 路由(Envoy EPP policy · llm-d MaxScorePicker)(沿用 §IX) 增量 2 邻接 §1.(2) 调度 / §2.6 Cloud-Native
2502.07115v5 MC-SF Online Scheduling for LLM Inference with KV Cache Constraints(MIT+MSR+Amazon)(沿用 §IX) 横向 §1.(2) 调度
2605.01280 MathOpt Chen et al. 2026 Ω(√(B log G))(沿用 §IX) 横向 §1.(2) 调度
2605.15051 SpecDec 5.08×(沿用 §IX) 横向 §1.(2) 推理算法
2607.03333 Self-Speculative Forking(沿用 §IX) 横向 §1.(2) 推理算法
2606.17518 SpecGen(沿用 §IX) 横向 §1.(2) 推理算法
2607.16955 CADENCE · Coverage-Adaptive On-Policy Distillation(DRIFT per-token KL 凸混合 · paper_cards/673)(沿用 §IX) 横向 §1.(4) Kernel / §2.6 训练-推理协同
2607.26627 Revisiting Lossy Verification in Speculative Decoding(paper_cards/681)(沿用 §IX) 横向 §1.(2) 推理算法
2607.19712 RLHF C++ vs PyTorch Inference Runtimes(paper_cards/657)(沿用 §IX) 横向 §1.(1) 推理引擎
2607.25380 Memory for Large Language Models 综述(三个正交轴 · paper_cards/668)(沿用 §IX) 横向 §1.(3) KV cache
2607.26055 πR² Reactive Real-time Flow Policies(paper_cards/672 · engineering 主分类 8-1 邻接) 横向 §2.6 Cloud-Native / §2.13 选型决策树

说明:8-1 afternoon 新增 11 个 arXiv 号(本棒核心 9 个 + 横向 2 个):DUAL-BLADE / KV Cache Transform Coding / Shadow in the Cache / GoodServe / AMPD v2 / Workload-Router-Pool v2 / AIConfigurator / Fluid-Guided WAIT v4 / KernelSight-LM / SuperInfer v2 / πR² · 沿用 §IX 已立标 10 个:LAAR / MC-SF / MathOpt / SpecDec / Self-Speculative Forking / SpecGen / CADENCE / Lossy Verification / RLHF C++ / Memory for LLMs · 本棒涉及 arXiv 号 21 个(本轮新增 11 + 沿用 10)


六、已检查来源清单

以下来源经本次扫描确认无 llm-infra 主增或已在上方增量中覆盖,避免重复检索:

inbox/jay(7-31 evening → 8-1 18:40 共 23 件,全部已读): - ✅ 2026-07-31T1105-jay-five-category-briefing.md → 7-31 morning 五大类目补编 #16(沿用 7-31 evening E1 第 12 棒) - ✅ 2026-07-31T1335-jay-engineering-filter.md → 7-31 工程筛选(无 llm-infra 主增) - ✅ 2026-07-31-ai-engineering-trending.md → 7-31 GitHub Trending vLLM 事实标准(沿用 7-31 evening E1 第 12 棒) - ✅ 2026-07-31-engineering-database-backend-cloudnative.md → 7-31 数据库/Cloud-Native(无 llm-infra 主增) - ✅ 2026-07-31-csdn-weekly.md → 7-31 CSDN vLLM 部署 + DeepSeek-R1 微调(无 llm-infra 主增) - ✅ 2026-07-31T1505-jay-five-category-briefing.md → 7-31 evening 五大类目补编 #15(沿用 7-31 evening E1 第 12 棒) - ✅ 2026-07-31T1620-jay-csdn-sglang-bench-eval.md → 7-31 evening DGX Spark + SGLang/vLLM 横向(沿用 7-31 evening E1 第 12 棒) - ✅ 2026-07-31T1735-jay-briefing-inference-stack-vecdb-substack.md → 7-31 evening TGI 维护 + Colibri + vLLM FP8 KV + LMCache Q2(沿用 7-31 evening E1 第 12 棒) - ✅ 2026-07-31-engineering-e1prep.md → 7-31 evening engineering-v40 准备棒(沿用 7-31 evening E1 第 12 棒) - ✅ 2026-07-31-csdn-substack-ai-research.md → 7-31 CSDN vLLM 推理优化(无 llm-infra 主增) - ✅ 2026-07-31-1140-news-x-tech-radar.md → 7-31 evening X 硬核干货雷达(无 llm-infra 主增) - ✅ 2026-07-31-1000/1002/1003 RSS → 7 RSS 通稿(无 llm-infra 主增) - ✅ 2026-07-31-1005/1006 RSS yt-karpathy/yt-fireship → 2 RSS YT 通稿(无 llm-infra 主增) - ✅ 2026-08-01-0935-jay-engineering-filter.md → 8-1 morning 工程筛选(无 llm-infra 主增) - ✅ 2026-08-01-1050-jay-engineering-filter.md → 8-1 morning 工程筛选(无 llm-infra 主增) - ✅ 2026-08-01T1105-jay-five-category-briefing.md → 8-1 morning 五大类目补编 #17(沿用 8-1 morning §IX) - ✅ 2026-08-01-1140-news-x-tech-radar.md → 8-1 morning X 硬核干货雷达(无 llm-infra 主增) - ✅ 2026-08-01-engineering-e1prep.md → 8-1 morning engineering-v42 准备棒(沿用 8-1 morning §IX) - ✅ 2026-08-01-engineering-filter-arxiv-inference-harness.md → 8-1 morning AMPD/LAAR/SuperInfer/KernelSight-LM/GitHub Trending FlashKDA(已纳入增量 2 LAAR + 增量 3 KernelSight-LM 邻接) - ✅ 2026-08-01-csdn-substack-weekly.md → 8-1 morning CSDN Substack 周度汇总(无 llm-infra 主增) - ✅ 2026-08-01T1220-jay-csdn-rag-agent-moe-2026.md → 8-1 noon CSDN RAG/Agent/MoE(无 llm-infra 主增 · 邻接 §2.6 Cloud-Native) - ✅ 2026-08-01T1335-jay-arxiv-inference-systems-vecdb-2026.md8-1 afternoon arXiv 推理系统工程 6 件(已纳入增量 2 GoodServe + AMPD + Workload-Router-Pool + 增量 3 AIConfigurator + Fluid-Guided WAIT v4 · 与 MathOpt 2605.01280 / AIConfigurator 2601.06288v1 / Fluid-Guided 2504.11320v4 沿用) - ✅ 2026-08-01T1505-jay-evening-briefing-mcp2-kvcache-arxiv-vecdb.md8-1 evening KV-Cache + MCP + 推理引擎 + arXiv + Substack 12 件(已纳入增量 1 KV Cache 顶会三件套 DUAL-BLADE/Transform Coding/Shadow in the Cache + 增量 5 MCP 2.0 8 条完整 + B2 Spheron H100 沿用 + B3 Lilian Weng Harness 沿用 §IX + B4 ByteByteGo 三层模型沿用 §IX + R1 MirrorCode 沿用 §IX + R2 X Tech Radar 邻接) - ✅ 2026-08-01T1620-jay-csdn-rag-agent-tensorrt-deploy.md8-1 evening CSDN RAG/Agent/TRT-LLM 部署 6 件(沿用 §1.(1) 推理引擎 + PyTorch Quantization + TensorRT-LLM Qwen3 命令邻接 · 无新 arXiv) - ✅ 2026-08-01T1735-jay-inference-engines-open-llms-2026.md8-1 evening 推理引擎 4 选 1 横评 + 2026 开源新模型格局 + AI Engineer 1000+ JD + GitHub Top 12(已纳入增量 4 YottaLabs + Spheron + DeployBase + Superlinked Pipeline 检索/生成分层 + AI Engineer 1000+ JD + LLM Engineer vs AI Engineer + Langflow/Dify 低代码平台) - ✅ 2026-08-01-1000/1001/1002/1003/1004 RSS → 5 RSS 通稿(无 llm-infra 主增)

inbox/tom(7-31 evening → 8-1 共 8 件,全部已读): - ✅ 2026-07-31-inference-e1prep.md → 7-31 22:22 inference E1 已恢复(沿用 §IX) - ✅ 2026-07-30T1440-agent-rag-longcontext-radar.md → 7-30 evening 4 P0(已纳入 ai-industry/RAG/agent 主题) - ✅ 2026-07-30T2040-agent-rag-longcontext-radar.md → 7-30 evening 补充版(已纳入 ai-industry 主题) - ✅ 2026-07-31-0840-agent-rag-longcontext-radar.md → 7-31 8 候选 3 P0 高价值(已纳入 §IX 增量 3 Memory for LLMs 综述 + 增量 5 CADENCE + 增量 7 CADENCE) - ✅ 2026-07-31-0852-rag-e1prep.md → RAG E1(已纳入 RAG 主题) - ✅ 2026-07-31-0900-hf-daily-2026-07-31.md → HF Daily 7-31 票榜 15 件(已纳入 ai-industry/multimodal 主题) - ✅ 2026-07-31-1005-rss-yt-lex-fridman.md → RSS 通稿(无 llm-infra 主增) - ✅ 2026-07-31-1005-rss-yt-yannic-kilcher.md → RSS 通稿(无 llm-infra 主增) - ✅ 2026-07-31-1541-evaluation-e1prep.md → evaluation E1(已纳入 evaluation 主题) - ✅ 2026-08-01-0840-agent-rag-longcontext-radar.md → 8-1 8 候选 4 P0 高价值(Σ-Mem + Filesystem + DualG-MRAG + GLM-RAG,已纳入 agent 主题) - ✅ 2026-08-01-0900-hf-daily-2026-08-01.md → HF Daily 8-1 票榜 15 件全核(已纳入 ai-industry/multimodal/agent 主题) - ✅ 2026-08-01-1003-rss-yt-yannic-kilcher.md → RSS 通稿(无 llm-infra 主增) - ✅ 2026-08-01-1004-rss-yt-lex-fridman.md → RSS 通稿(无 llm-infra 主增) - ✅ 2026-08-01-0852-rag-e1prep.md → RAG E1(已纳入 RAG 主题) - ✅ 2026-08-01-1541-evaluation-e1prep.md → evaluation E1(已纳入 evaluation 主题) - ✅ 2026-08-01T1440-agent-rag-longcontext-radar.md → 8-1 afternoon 雷达 v2(已纳入 agent 主题) - ⚠️ tom 8-1 inference E1 仍未产出独立 E1(警示 1 · 虽 8-1 HF Daily 8-1 票榜 15 件全核可补)

inbox/flyp(7-31 evening → 8-1 共 9 件,全部已读): - ✅ 2026-07-30-risk-e1prep.md → risk 主题(沿用) - ✅ 2026-07-31-0950-SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read.md → 跨任务技能 vs 原生记忆双线(已纳入 ai-industry/agent 主题) - ✅ 2026-07-31-multimodal-e1prep.md → multimodal-e1prep v34 第四棒(已纳入 multimodal 主题) - ✅ 2026-07-31-risk-e1prep.md → risk 主题 - ✅ 2026-07-31-1550-VisualPatchWorld-code-world-model-as-third-paradigm-critical-read.md → multimodal 主题 - ✅ 2026-07-31-1000/1002/1005 RSS → 4 RSS 通稿(无 llm-infra 主增) - ✅ 2026-08-01-0950-shadowdancer-comem-vla-and-depth-memory-critical-read.md → ShadowDancer + CoMem 跨模态精读 19KB(已纳入 multimodal/agent 主题) - ✅ 2026-08-01-1000/1001/1003/1004 RSS → 4 RSS 通稿(无 llm-infra 主增) - ✅ 2026-08-01-1030-sat-adversarial-review-rag-filesystem-dualg-bm25.md → RAG filesystem dualg-bm25(已纳入 RAG 主题) - ✅ 2026-08-01-1030-sat-weekly-deep-read-rag-filesystem-dualg-bm25.md → RAG filesystem dualg-bm25 周度精读(已纳入 RAG 主题) - ✅ 2026-08-01-1550-ShadowDancer-See2Think-critical-read.mdShadowDancer + See2Think critical-read 16:30(已纳入 multimodal 主题 · 与 ShadowDancer See2Think 邻接 llm-infra) - ✅ 2026-08-01-multimodal-e1prep.md → multimodal-e1prep v34 第五棒(已纳入 multimodal 主题) - ✅ 2026-08-01-risk-e1prep.mdrisk-e1prep R34 立标固化后第 1 个 E1(已纳入增量 1 KV Cache 顶会三件套 D3 Shadow in the Cache NDSS 2026 + 警示 2 EU AI Act 8-2 临门) - flyp 7-31 evening → 8-1 0 件 llm-infra 主线产出(multimodal + risk 双轨主导)

inbox/spark(7-31 evening → 8-1 共 4 件,全部已读): - ✅ 2026-07-30-1337-agent-e1prep.md → 7-30 evening Agent E1(已纳入 agent 主题) - ✅ 2026-07-30-1339-llm-infra-e1prep.md → 7-30 evening E1 v11(已纳入 7-30 evening 增量 1-6 + 3 旁证 + 1 警示) - ✅ 2026-07-31-1001-rss-gradient-flow.md → RSS 通稿(无 llm-infra 主增) - ✅ 2026-07-31-1002-rss-chip-huyen.md → RSS 通稿(无 llm-infra 主增) - ✅ 2026-07-31-1005-rss-yt-3blue1brown.md → RSS 通稿(无 llm-infra 主增) - ✅ 2026-07-31-1337-agent-e1prep.md → 7-31 13:30 Agent E1(已纳入 agent 主题) - ✅ 2026-07-31-1339-llm-infra-e1prep.md → 7-31 evening llm-infra E1 v12(已纳入 7-31 evening 7+3+1) - ✅ 2026-08-01-1001-rss-gradient-flow.md → RSS 通稿(无 llm-infra 主增) - ✅ 2026-08-01-1002-rss-chip-huyen.md → RSS 通稿(无 llm-infra 主增) - ✅ 2026-08-01-1004-rss-yt-3blue1brown.md → RSS 通稿(无 llm-infra 主增) - ✅ 2026-08-01-1330-agent-e1prep.md8-1 13:30 agent E1 v37(已纳入 agent 主题 · v36 收官 8 件立标候选 + 6 P0/P1 + 2 P1/P2 邻接 + 1 P0 警示 EU AI Act 8-2 临门) - ⚠️ spark 8-1 morning 节奏反转后第 8 棒独立 E1 持续缺失(警示 1 · 本棒恢复 llm-infra-e1prep-v13)

inbox/stephen(7-31 evening → 8-1 共 14 件,全部已读): - ✅ 2026-07-30-1245-stephen-coordination-check-noon.md → 协调棒(已纳入 ai-industry 主题) - ✅ 2026-07-30-2245-stephen-coordination-check-evening.md → 协调棒(已纳入 ai-industry 主题) - ✅ 2026-07-30-1026-ai-industry-e1prep.md → v32 准备棒(已纳入 ai-industry 主题) - ✅ 2026-07-30-ai-industry-e1prep.md → ai-industry 主题 - ✅ 2026-07-30-llm-application-e1prep.md → llm-application 主题 - ✅ 2026-07-31-0910-news-x-vip-radar.md → X VIP radar 8.7KB(已纳入 §IX 增量 OpenAI GPT-5.6 Sol GPU kernel 自优化 + speculative decoding 提速 15%+) - ✅ 2026-07-31-1003-news-anthropic-news/deepmind-news/openai-news → 9 frontier lab news 通稿(已纳入 ai-industry 主题) - ✅ 2026-07-31-1004-news-bens-bites/google-ai/hf-blog/tldr-ai → 9 frontier lab news 通稿(已纳入 ai-industry 主题) - ✅ 2026-07-31-1006-news-yt-anthropic/deepmind/openai → 9 frontier lab news 通稿(已纳入 ai-industry 主题) - ✅ 2026-07-31-1031-ai-industry-e1prep-v33.md → v33 准备棒(已纳入 ai-industry 主题) - ✅ 2026-07-31-1245-stephen-coordination-check-noon.md → 协调棒 noon(已纳入 llm-infra 警示 1) - ✅ 2026-08-01-0910-news-x-vip-radar.md8-1 morning X VIP radar(已纳入警示 1 Sam Altman 华盛顿 + 警示 2 EU AI Act 8-2) - ✅ 2026-08-01-1002/1003/1004 news-* → 12 frontier lab news 通稿(已纳入 ai-industry 主题) - ✅ 2026-08-01-1021-ai-industry-e1prep-v34.md8-1 morning ai-industry E1 v34 8 增量(已纳入 ai-industry 主题 + OpenAI 主动 EU AI Act 提前表态) - ✅ 2026-08-01-1245-stephen-coordination-check-noon.md8-1 noon 协调棒 #7 7 向覆盖度盘点(已纳入警示 1 spark 8-1 evening 棒必须恢复 + 警示 2 EU AI Act 8-2 临门)

paper_cards(7-31 evening → 8-1 18:40 新卡 IDs 674-688 共 15 张,全部已读): - ✅ 主分类 llm-infra 新增 0 张(沿用 657 RLHF C++ + 668 Memory for LLMs + 673 CADENCE + 681 Lossy Verification) - ✅ 主分类 engineering 新增 1 张 = 672 arXiv:2607.26055 πR² Reactive Real-time Flow Policies(8-1 邻接 llm-infra · 已纳入横向 arXiv 号列表) - ✅ 副分类 llm-infra 0 张新卡 - ✅ 邻接 llm-infra 主分类 engineering 0 张新卡 - ✅ 邻接 agent 主分类 5 张新卡 = 676 ConMem arXiv:2607.28126 + 683 Σ-Mem arXiv:2607.27958 + 686 Filesystem-Based Memory arXiv:2607.26637 + 684 Fairness Pruning arXiv:2607.28319 + 685 See2Think arXiv:2607.26769(已纳入 agent 主题) - ✅ 主分类 rag 3 张新卡 = 674 DualG-MRAG arXiv:2607.28580 + 675 GLM-RAG arXiv:2607.28397 + 676 ConMem(双分类 agent + rag)(已纳入 RAG 主题) - ✅ 主分类 multimodal 2 张新卡 = 682 ShadowDancer arXiv:2607.28362 + 688 OmniScope arXiv:2607.23193(已纳入 multimodal 主题) - ✅ 主分类 agent 邻接 multimodal/evaluation 3 张新卡 = 687 MisKnow-Agent arXiv:2607.20891 + 682 ShadowDancer + 685 See2Think - ✅ 邻接 engineering 1 张新卡 = 672 πR² arXiv:2607.26055(已纳入横向 arXiv 号列表)


七、本次 E1 预消化结论

增量条数:5 主线 + 3 旁证 + 2 警示

结论:llm-infra 主题 7-31 18:40 → 8-1 18:40 约 24h 窗口为中密度(较 7-31 evening 第 12 棒 7+3+1 略降),主因是 (1) §IX 8-1 11:58 morning 抢修完成版已吸收 7-31 evening + 8-1 morning 主要增量(ByteByteGo 三层架构 + MirrorCode + Lilian Weng Harness + MSR Echoverse + MCP 2.0 Stateless + smevals + SIGMOD 三件套 DOI 5-18 published 全部 web 核实 + CVE-2026-22778 patch 链);(2) 8-1 afternoon 4 件 briefing 集中爆发 35+ 高价值条目 = KV Cache 顶会三件套 + Agentic Serving 调度立标三件套 + AIConfigurator + Fluid-Guided WAIT v4 + 推理引擎 4 选 1 横评 + MCP 2.0 8 条完整补充 + Langflow/Dify 低代码 AI 平台成熟;(3) paper_cards 8-1 新卡 15 张中主分类 llm-infra 0 张(沿用 §IX 4 张主 llm-infra:657/668/673/681)· 主分类 engineering 新增 1 张 = 672 πR² 邻接 llm-infra = 5 主线立标级增量。

核心动作: 1. KV Cache 顶会三件套(DUAL-BLADE ICDCS 2026 + KV Cache Transform Coding ICLR 2026 + Shadow in the Cache NDSS 2026)入 §1.(3) KV cache 14+1 件套 / §1.(10) 顶会议立标(七大顶会议 KV-cache 集中爆发立标 = SIGMOD/SIGCOMM/HPCA/ACL/ICDCS/ICLR/NDSS 2026) + §1.(4) Fail-Plausible(memory-as-attack-surface 第四立标) 2. Agentic Serving 调度立标三件套(GoodServe arXiv:2605.16867v1 + AMPD arXiv:2602.14516v2 v2 + Workload-Router-Pool arXiv:2603.21354v2 v2)入 §1.(2) 调度 9 学派(LLM serving 调度理论 2026 H2 七大突破 · 理论 + 工程 + 在线 + Agentic 四轴并行) 3. AIConfigurator arXiv:2601.06288v1 + Fluid-Guided WAIT arXiv:2504.11320v4 v4 + KernelSight-LM arXiv:2606.28565v1入 §1.(1) 推理引擎 6 寡头 / §1.(2) 调度 / §2.13 选型决策树(推理引擎配置优化三件套 2026 H2 · inference capacity planning 工具化进步) 4. 推理引擎 4 选 1 横评 8-1 afternoon 三源交叉(YottaLabs + Spheron + DeployBase + Superlinked + AI Engineer 1000+ JD + LLM Engineer vs AI Engineer + Langflow/Dify 低代码平台)入 §2.13 选型决策树 v4.0(沿用 v3.0 + 新增 Superlinked Pipeline 检索/生成分层 + AI Engineer 1000+ JD 实证 + LLM Engineer vs AI Engineer 技能分野 + 低代码 vs 框架 三维度) 5. MCP 2.0 Stateless 完整 8 条 + MSR Echoverse + MSR SymCrypt + MirrorCode 四立标联动入 §1.(5) Harness Engineering Phase 4(沿用 §IX 已立标 + 本棒强化协议级简化 8 条完整细节 + 新攻击面 3 类) + 3 旁证:Workload-Router-Pool vLLM Semantic Router(立标 vLLM 项目愿景论文 NeurIPS/ICML 2026 引用 + silent drift detection 静默降级检测)+ DUAL-BLADE ICDCS 2026(边缘 NVMe-direct KV-Cache 卸载 prefill -33.1% / decode -42.4% / SSD 2.2×)+ Shadow in the Cache NDSS 2026(KV-cache 隐私/侧信道 memory-as-attack-surface 第四立标) + 2 警示:tom 8-1 inference E1 仍未产出独立 E1(继 7-31 单棒恢复后再次静默)+ spark 8-1 morning 第 8 棒独立 E1 持续缺失(本棒 llm-infra-e1prep-v13 恢复) + EU AI Act 2026-08-02 deadline 临门(距今 ~14h · stephen 1245 + flyp risk + spark agent 三方沿用 + 对 llm-infra 间接影响 = 推理引擎 0-trust 五件套)

新增共识 C91-C95 共 5 条 + 新增试金石 O172-O176 共 5 条

涉及 arXiv 号 21 个(本轮核心新增 11 + 存量沿用 10): - 本轮核心新增 11 个:arXiv:2604.26557 DUAL-BLADE(增量 1 + 旁证 2)+ arXiv:2511.01815 KV Cache Transform Coding(增量 1)+ arXiv:2508.09442 Shadow in the Cache(增量 1 + 旁证 3)+ arXiv:2605.16867v1 GoodServe(增量 2)+ arXiv:2602.14516v2 AMPD(增量 2)+ arXiv:2603.21354v2 Workload-Router-Pool(增量 2 + 旁证 1)+ arXiv:2601.06288v1 AIConfigurator(增量 3)+ arXiv:2504.11320v4 Fluid-Guided WAIT v4(增量 3)+ arXiv:2606.28565v1 KernelSight-LM(增量 3 横向)+ arXiv:2601.20309v2 SuperInfer(增量 3 横向)+ arXiv:2607.26055 πR²(横向 paper_cards/672) - 存量沿用 10 个:arXiv:2604.15732v1 LAAR + arXiv:2502.07115v5 MC-SF + arXiv:2605.01280 MathOpt + arXiv:2605.15051 SpecDec + arXiv:2607.03333 Self-Speculative Forking + arXiv:2606.17518 SpecGen + arXiv:2607.16955 CADENCE + arXiv:2607.26627 Lossy Verification + arXiv:2607.19712 RLHF C++ + arXiv:2607.25380 Memory for LLMs


八、建议今晚活文档接力动作清单

  1. §1.(3) KV cache 14+1 件套新增 DUAL-BLADE ICDCS 2026 + KV Cache Transform Coding ICLR 2026(沿用 LMCache 2026 Q2 + vLLM FP8 KV 50% + Memory 综述 + SIGMOD 2026 三件套)
  2. §1.(10) SIGMOD/SIGCOMM/HPCA/ACL 顶会议立标升级为七大顶会议 KV-cache 集中爆发立标(+ ICDCS 2026 + ICLR 2026 + NDSS 2026)
  3. §1.(4) 服务层并发安全新增 Shadow in the Cache NDSS 2026 作为 memory-as-attack-surface 第四立标(沿用 CVE-2026-22778 + Fail-Plausible 五类)
  4. §1.(2) 调度 9 学派新增 Agentic Serving 调度立标三件套(GoodServe + AMPD v2 + Workload-Router-Pool v2)作为「LLM serving 调度理论 2026 H2 七大突破」(沿用 MC-SF + LAAR + MathOpt + Fluid-Guided WAIT)
  5. §1.(1) 推理引擎 6 寡头新增 AIConfigurator arXiv:2601.06288v1 多框架最后一公里配置优化(沿用 vLLM 0.7 MRv2 + SGLang V2 + DFlash + Spec V2 + SGLang×TPU + Kimi K3 2.8T + TGI 维护 + Colibri)
  6. §1.(2) 调度 9 学派强化 Fluid-Guided WAIT arXiv:2504.11320v4 v4 更新意义(现代生产 vLLM 2026 默认 recomputation 实测基线)
  7. §2.13 选型决策树升级为 v4.0 多源交叉(YottaLabs + Spheron + DeployBase + Superlinked Pipeline 检索/生成分层 + AI Engineer 1000+ JD + LLM Engineer vs AI Engineer + Langflow/Dify 低代码平台)
  8. §1.(5) Harness Engineering Phase 4强化 MCP 2.0 Stateless 完整 8 条 + 新攻击面 3 类(沿用 ByteByteGo 三层模型 + MirrorCode + Lilian Weng Harness + MSR Echoverse + MCP 2.0 Stateless + smevals · 本棒强化协议级简化 8 条完整细节)
  9. §1.(7) Inference Engineering 5 维立标新增 LLM Engineer vs AI Engineer 技能分野作为「2026 AI Engineer 角色实证 · 70% AI-first + 28.5% AI-support」(沿用 Gergely Orosz Pragmatic Engineer · Dennis Kennetz 4 阶段 · Alexey Data Substack · Deep|LLM 2026)
  10. §1.(6) Cloud-Native沿用 llm-d + 新增 LAAR arXiv:2604.15732v1 Envoy EPP 路由 + Workload-Router-Pool arXiv:2603.21354v2 v2 vLLM Semantic Router(并行第 9 项)
  11. §1.(4) 服务层并发安全新增 MCP 2.0 Stateless 新攻击面 3 类作为「协议层无状态化的安全代价」(沿用 Fail-Plausible 五类 + CVE-2026-22778)
  12. §1.(3) KV cache 14+1 件套新增 SuperInfer arXiv:2601.20309v2 v2 GH200 NVL2 KV cache offloading(沿用 Mooncake Store + LMCache + FlexKV + VeriCache + DUAL-BLADE + SwiftCache + Tutti + AsymCache + Kareto + Continuum)
  13. §2.6 Cloud-Native / §2.13 选型决策树新增 πR² arXiv:2607.26055 Reactive Real-time Flow Policies(paper_cards/672 engineering 主分类 8-1 邻接)
  14. §1.(10) 系统栈新增 KernelSight-LM arXiv:2606.28565v1 GB200 跨代仿真 3.8% error(沿用 ASPLOS 2026 SwiftSpec + CXL KV Cache Server HotInfra'26 + LiteLLM v1.89/1.90)
  15. C91-C95 共识候选 + O172-O176 试金石写入对应候选池(5 共识 + 5 试金石)
  16. §6 引用清单扩至 267+ ID(本轮新增 11 arXiv + 1 工程化条目 + 1 paper_cards 邻接)
  17. §3.2 争议 / §4 开放问题沿用 §IX + 警示 1 接力观察(tom inference E1 + spark 节奏反转静默期) + 警示 2 EU AI Act 8-2 临门(沿用 stephen + flyp + spark 三方)

本文件由 spark E1 自动生成 · 2026-08-01 18:40 (Asia/Shanghai) 仅供今晚活文档接力参考,不作为知识库最终内容 基线:organized/knowledge/llm-infra.md §IX·34th 抢修完成版(2026-08-01 11:58 收官) 7-31 evening E1 v12 已并入 v33 接力基线 · 本棒 v13 为第 13 棒 下一步:今晚活文档接力棒按上述 17 项动作归位 → 8-1 evening coordination-check-evening · 8-2 morning spark E1 第 14 棒