llm-infra · E1 预消化简报(2026-08-15)

作者:spark
主题:LLM Infrastructure · 类型:E1 日间预消化(第 15 棒 · 8-15 evening 活文档接力备料 · 周六)
窗口:2026-08-14 18:40 → 2026-08-15 18:40(约 24h 主增量)
基线活文档organized/knowledge/llm-infra.md §IX·47th(2026-08-14 22:30 收官;🔴 vLLM 原生 transformers 后端 + C2KV KDD 2026 第 13 路线 + Memory-Centric 数字 + vLLM 0.19 P-EAGLE + 阿里云压测版本号 + vLLM crash rate + TIS 2.0 + AI Agents Stack 2026 + HF Daily 8-14 OpenART 184▲ + arXiv:2608.12149 混合线性注意力 + LLMRouter = 43 子轴)
承接棒(spark 自产)inbox/spark/2026-08-14-llm-infra-e1prep.md(8-14 evening 接力棒 = 11 件候选 + 1 件严格 net-new = arXiv:2608.12149 + 6 件工程细节)
stephen 协调棒inbox/stephen/2026-08-15-1245-stephen-coordination-check-noon.md(36KB · 主轴交叉 + AI 产业主消化)+ inbox/stephen/2026-08-15-ai-industry-e1prep.md(86KB · v45→v46 备料 · 推理引擎立基础延展 v45 §2.208 +1 件 → v46 §2.208 +3 件候选已列)
paper_cards 8-14 → 8-15 净增 30 张(940-960 编号段) = 3 件新立主分类 llm-infra(952 RMM arXiv:2608.13426 + 956 Hybrid-Policy Self-Editing arXiv:2608.11660 + 958 Thought-Level Beam Search arXiv:2608.08020)+ 4 件新立 evaluation/rag/multimodal/risk 邻接(947 LLMRouter arXiv:2608.06867 + 949 Search-R1 stopping arXiv:2608.13237 + 953 AVA-Encoder arXiv:2608.12313 + 959 LALMs ILL arXiv:2608.09158) —— llm-infra 主分类 paper_cards 8-15 当日净增 = 3 件 = 8-14 净增 4 张的 0.75×(8-13 主分类 1 张立档饱和后回落到立标基础 3 件候选级别)
tom inference-e1prep 8-15 主棒 沿用 8-14 22:22 兑现位(无新棒产出 · 8-15 rag-e1prep / radar 4 件为邻接备料未触发 inference 副棒)


0. 综述判断

本场 24h 窗口对 llm-infra 主轴而言属于 中高密度主轴升级棒:8-14 evening spark 4 件 net-new(PLDR-LLM/Bole/AcceptMoE/AOSpec)+ 8-14 evening 7 件邻接(vLLM 原生 transformers 后端 / C2KV KDD 2026 / Memory-Centric 详细数字 / vLLM 0.19 / 阿里云压测 / vLLM crash rate / AI Agents Stack 2026 / OpenART 立标信号 / arXiv:2608.12149 / LLMRouter)已被 §IX 47 完整吸纳,8-15 严格意义上的 net-new 候选 = 12 件(主轴级 5 件 + 邻接级 7 件),比 8-14 的「1 件 net-new + 10 件细节补丁」显著升级。

最关键结构性信号: 1. 🔴 paper_cards 8-15 当日净增 3 件主分类 llm-infra:952 RMM arXiv:2608.13426 + 956 Hybrid-Policy Self-Editing arXiv:2608.11660 + 958 Thought-Level Beam Search arXiv:2608.08020 = §IX 48 立标基础延展 3 件候选级别(与 §IX 47 推理引擎立基础延展性质不同,本棒 = 算法/方法级立基础延展)。 2. 🔴 ai-industry v45 §2.208 推理引擎立基础延展 v46 +3 件候选:jay 1000 Raschka KV Sharing / mHC / Compressed Attention 架构(混合线性注意力新延展)+ stephen noon 协调棒 GPT-5.6 Sol Ultrafast Cerebras 750 tok/s 14×(OpenAI × Cerebras 推理芯片合作)= v46 §2.208 推理引擎立基础延展 v45 +1 → v46 +3 件。 3. 🔴 Salesforce Compound AI Systems arXiv:2604.25724(jay 1105 five-cat §二.BACKEND 1.1)= 8000 企业用户 + 日均 72 万次推理 + 峰值 140 万请求/天 + 2026-03 处理 1360 亿 Token + serverless + 动态 autoscaling 降低 P95 尾延迟 50% + 吞吐量 3.9× + 成本 -30-40% —— 这是迄今最完整的 Compound AI 生产级工程数据,§IX 48 §1.(1) + §1.(12) 立基础延展第 1 件候选。 4. 🔴 MCP 2026-07-28 规范更新(jay 1505 afternoon briefing §三 + jay 1735 GitHub HF Agent §4 + The AI Engineer AI Agents Stack 2026)= MRTR + Required issuer authorization metadata + 完全远程化无状态 = 28% Fortune 500 已部署 MCP 服务器 / 月 SDK 下载 9700 万次 / Gartner 2026 底 75% API 网关厂商将具备 MCP 功能 —— 这是 §IX 48 §1.(5) Agent 框架 立基础延展第 1 件候选。 5. 🔴 Nexus arXiv:2507.06608 单 GPU 主动 PD disaggregation 2.2× 吞吐 20× TTFT + Not All Prefills Are Equal arXiv:2603.13358 多轮 Agent 失效(jay 0820 §三 + jay 1335 §三.2)= §IX 48 §1.(2) 推理调度 9 学派立基础延展第 1 件候选 + PD Disaggregation 工程陷阱首次系统化。 6. 🔴 NVIDIA Dynamo 1.0 + vLLM V1 重构 + Qwen3.8-2.4T-A95B Day 0 + KServe v0.17 + llm-d CNCF v0.7(jay 1335 §三.1 + jay 0820 + jay 1105 + jay 1735)= §IX 48 §1.(1) 推理引擎立基础延展第 2 件候选 = 推理引擎编排层结构变化第 1 例。

本场净增量:12 件候选(5 主轴级 + 7 邻接级),其中可独立承接的「主轴级」候选 = 5 件(RMM / Hybrid-Policy Self-Editing / Salesforce Compound AI / GPT-5.6 Sol Cerebras + KV Sharing/mHC/Compressed Attention / MCP 2026-07-28 规范更新),其余 7 件均为邻接 / 细节。比 8-14 的「1 主轴级 + 10 邻接」结构升级 5×


1. 核心增量(5 主轴级 + 7 邻接级 = 12 条)

增量 1【算法/方法 · §1.(11) + §1.(13)】🔴 RMM (Reduced Matrix Multiplication) arXiv:2608.13426 —— §IX 48 立基础延展第 1 件 ★★★★

来源organized/paper_cards/952-2608-13426.md(paper_card P1 已建 · 主分类 llm-infra · 形态 method)+ inbox/jay/2026-08-15T1335-jay-ai-backend-db-deployment-research.md 邻接(InferenceEngineering.tech 来源,但 paper_card 主文件未在该棒出现)

arXiv2608.13426(Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference,2026-08-15 当日新提交 cs.LG)

要点: - 核心创新:training-free, input-adaptive 推理方法,通过选择矩阵乘积收缩维度上的信息切片降低 Transformer 矩阵乘计算量,不修改模型权重。 - 机制:在简单保留率(retention-ratio)控制下提供平滑可预测的精度-效率权衡。 - 跨模型验证:在 1B ~ 70B 参数的语言模型上验证(论文覆盖 LLaMA / Qwen / DeepSeek 等系列),reduction tolerance 取决于模型规模。 - 工程意义:与 AWQ INT4 / GPTQ-2D 等量化方法正交(量化改变精度位数,RMM 改变计算结构),可叠加;与 PagedAttention / PD Disaggregation 等运行时方法正交。

与活文档 §IX 47 现有脉络的关系: - 写入 §1.(11) Kernel/AI 自动化/Harness:现有脉络 = Fable 18.71× + Atrex-Bench + KernelSight-LM + TELLER ASE 2026 + Harness for Kernel + μCUTLASS DSL + TritonForge + Ombra LLM-Doctor + CAIN 2026 MLOps + BentoML + TensorCast + vLLM 原生 transformers 后端 8-14 HF Blog。 - 本增量 = §IX 48 §1.(11) 立基础延展第 1 件:从「kernel 层自动化」(Fable / Atrex-Bench / KernelSight-LM)扩展到「矩阵乘 input-adaptive 压缩」(RMM 训练无关 + 模型权重不变 + 保留率可控),是 §1.(11) 算法工具箱的横向细化而非范式突破。 - 与 §1.(13) 边界扩展 42 → 43 → 44 子轴邻接新增候选。

建议归入节§1.(11) Kernel/AI 自动化/Harness 立基础延展第 1 件(matrix-product reduction 训练无关方法);§1.(13) 边界扩展邻接新增候选;paper_card P1 已建(952 号)· 无需再立卡


增量 2【算法/方法 · §1.(13) + §1.(4)】🟡 Hybrid-Policy Self-Editing arXiv:2608.11660 —— §IX 48 立基础延展第 2 件 ★★★

来源organized/paper_cards/956-2608-11660.md(paper_card P1 已建 · 主分类 llm-infra · 形态 method)+ inbox/tom/2026-08-15T0840-agent-rag-longcontext-radar.md §3 + inbox/tom/2026-08-15T1440-agent-rag-longcontext-radar.md 条目 6

arXiv2608.11660(Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing,2026-08-11 提交 cs.CL)

要点: - 问题域:大模型静态训练语料知识快速过时,knowledge editing(KE)需求增加;从结构化三元组编辑向非结构化段落编辑(UKE)演进。 - 核心问题:现有编辑器注入段落,编辑后模型能回忆段落但无法回答原子问题(recall 但 fact-level QA 失效)。 - 方法:提出 混合策略自编辑(Hybrid-Policy Self-Editing),同时解决 recall 与 fact-level QA 问题。 - 工程价值:可组合(composable)非结构化知识编辑支持,多事实并发注入而互不干扰。

警示(flyp 8-15 multimodal-e1prep §0 沿用 + spark 8-15 agent-e1prep §一.32c 沿用):Hybrid-Policy Self-Editing 与 KE 综述家族(ROME / MEMIT / MEND)的对比基准尚未在 tom 8-15 radar 完整披露;论文是否在 Llama-3.1 / Qwen-3 / DeepSeek-V4 多模型对照尚未核验。

与活文档 §IX 47 现有脉络的关系: - 写入 §1.(13) 边界扩展 42 → 43 → 44 子轴:现有脉络 = TIS 2.0 RAG 位置偏差消除 +12.5% + AI Agents Stack 2026 + 立标信号双向锚 6 向并存 + vLLM 原生 transformers 后端 + KVpop arXiv:2607.05061 + WRP 组件归并。 - 本增量 = §IX 48 §1.(13) 立基础延展第 1 件:从「运行时编辑」(TIS 2.0 RAG 位置偏差消除)扩展到「离线 KE 自编辑」(Hybrid-Policy),两者共享「知识更新」邻接族但 TIS 是运行时、Hybrid-Policy 是训练后。 - 与 §1.(4) 服务层并发安全 13+1 类风险候选邻接:UKE 自编辑失败可能引入幻觉扩散到生产服务,需在 13+1 类风险候选中新增「KE-induced hallucination diffusion」子项。

建议归入节§1.(13) 边界扩展立基础延展第 1 件(UKE Hybrid-Policy 自编辑方法);§1.(4) 服务层并发安全 13+1 类风险候选邻接;paper_card P1 已建(956 号)· 无需再立卡


增量 3【推理工程学 · §1.(1) + §1.(12)】🔴 Salesforce Compound AI Systems arXiv:2604.25724 —— §IX 48 §1.(1) + §1.(12) 立基础延展第 1 件候选 ★★★★

来源inbox/jay/2026-08-15-1105-jay-five-category-briefing.md §二 · BACKEND 1.1(标注精读推荐)+ inbox/jay/2026-08-15T1735-jay-github-hf-agent-memory-trending-stack2026.md §11 (Compound AI 综述 arXiv:2506.04565v2 邻接)

arXiv2604.25724(Scalable Inference Architectures for Compound AI Systems — Salesforce 生产部署研究,2026-04 提交 cs.DC)

要点: - 生产规模8000 企业用户 + 日均 72 万次推理 + 峰值 140 万请求/天 + 2026-03 处理 1360 亿 Token(Salesforce Agentforce + ApexGuru 已生产落地)。 - 核心工程数据: - serverless 执行 + 动态 autoscaling:降低 P95 尾延迟 50%、吞吐量 3.9×、成本 -30~40% - MLOps pipeline(Falcon):新模型版本注册后秒级触发自动部署,模型生命周期管理从 ~1 小时压缩到秒级 - 行业定位目前最完整的 Compound AI 生产级工程数据,涵盖调度、autoscaling、MLOps pipeline 全链路。

警示(jay 8-15 1105 §二.BACKEND 1.1 评价沿用):Salesforce 是 CRM 厂商自报数据,可能选择性呈现最佳实践;建议与 arXiv:2506.04565v2 Compound AI 综述对照(220 篇文献 2020-2026Q1 四轴分类:RAG / LLM Agents / MLLMs / Orchestration),关注 Agent-based RAG 计算开销与本案例的差异。

与活文档 §IX 47 现有脉络的关系: - 写入 §1.(1) 推理引擎 6 寡头+2+1+1:现有脉络 = vLLM / SGLang 双栖 + TGI 维护 + MAX + TensorRT-LLM + Qwen3.8-27B day-0 + Muse + LFM2.5 + Apple ANE Orion + vLLM-mlx + vLLM 原生 transformers 后端 8-14 HF Blog。 - 本增量 = §IX 48 §1.(1) 推理引擎立基础延展第 1 件候选:Salesforce 真实生产数据(8000 企业用户 / 72 万次推理 / 1360 亿 Token)首次系统披露 Compound AI 推理架构数据;与 jay 8-14 five-cat 1130 BACKEND 沿用「vLLM/SGLang 框架性」不同,本棒 = 「生产部署规模化」切入。 - 与 §1.(12) End-to-End Pipeline 7 件邻接:salesforce Falcon MLOps pipeline(秒级模型版本部署)直接对应 §1.(12) E2E Pipeline 中第 (v) Harness Reliability 子项;serverless + 动态 autoscaling 50% P95 -3.9× 吞吐 -30-40% 成本 对应 §1.(12) 第 (iii) Sched + (iv) Service Concurrency Safety 子项。

建议归入节§1.(1) 推理引擎立基础延展第 1 件候选(Salesforce Compound AI 生产部署 8000 用户 1360 亿 Token);§1.(12) E2E Pipeline 7 件立基础延展 1 件候选;§1.(7) 推理经济学 33 → 34 件套扩面(1360 亿 Token / 月)。


增量 4【推理引擎 · ai-industry §2.208 立基础延展】🔴 GPT-5.6 Sol Ultrafast Cerebras + KV Sharing / mHC / Compressed Attention 架构 —— ai-industry v46 §2.208 +3 件候选 ★★★★

来源inbox/jay/2026-08-15-1000-rss-raschka.md(KV Sharing / mHC / Compressed Attention 架构最新进展 = Gemma 4 + DeepSeek V4 降低长上下文成本)+ inbox/stephen/2026-08-15-ai-industry-e1prep.md §2 + §4(GPT-5.6 Sol Ultrafast 模式预览 = OpenAI 全新 API 服务层级 + Cerebras 驱动 + 750 token/s + 速度最高提升 14 倍)+ inbox/stephen/2026-08-15-1245-stephen-coordination-check-noon.md §4(§2.208 推理引擎立基础延展 +2 件候选已列)

arXiv:无(OpenAI 官方公告 + Cerebras 合作 + Raschka Substack 综述)

要点: - GPT-5.6 Sol Ultrafast(OpenAI × Cerebras): - OpenAI 全新 API 服务层级 + Cerebras 驱动 + 750 token/s(行业领先水平) + 速度最高提升 14× - 生态意义:OpenAI 推理生态结构变化第 2 件(v45 §2.208 第 1 件 = vLLM 原生 transformers 后端;本棒 = OpenAI × Cerebras 推理芯片合作) - 与 vLLM / SGLang 等开源推理引擎的格局影响:OpenAI 接入 Cerebras 晶圆级集成芯片后,开源推理引擎的「高速推理」优势被部分稀释;但 vLLM/SGLang 的「开放性 + 多硬件支持」仍是 OpenAI API 无法替代 - KV Sharing / mHC / Compressed Attention 架构: - KV Sharing:相邻层之间共享 KV 缓存(Gemma 4 实证),降低长上下文 KV Cache 占用 - mHC(Manifold-Constrained Hyper-Connections):流形约束超连接,DeepSeek V4 实证 - Compressed Attention:训练前压缩注意力矩阵(Raschka 综述) - 三件共同方向降低长上下文推理成本 —— 与 §1.(3) KV Cache 13 路线立基础延展邻接 + 与 §1.(8) 稀疏注意力邻接

警示(jay 1000 Raschka Substack 沿用):Raschka 综述未对每种架构提供独立基准对照表(KV Sharing 在 Gemma 4 实测的具体节省率、mHC 在 DeepSeek V4 的具体 overhead、Compressed Attention 在不同模型的精度损失),需对照原始论文核验。

与活文档 §IX 47 现有脉络的关系: - 本增量跨主轴:同时归属 ai-industry v45 §2.208 推理引擎立基础延展(间接映射到 llm-infra §1.(1) 推理引擎)和 llm-infra §IX 47 §1.(8) 稀疏注意力邻接 + §1.(3) KV Cache 13 路线邻接。 - GPT-5.6 Sol Ultrafast Cerebras:与 vLLM / SGLang / TensorRT-LLM 的关系 = 闭源 API 高速推理 vs 开源本地推理 —— §1.(1) 6 寡头矩阵沿用,但 Cerebras 晶圆级集成芯片作为推理引擎生态新硬件平台是 §1.(1) 推理引擎 6+4+2 → 6+4+3 立基础延展第 1 件候选。 - KV Sharing / mHC / Compressed Attention 三件:与 §1.(3) KV Cache 13 路线现有脉络(C2KV 跨请求复用 / Memory-Centric CXL+PIM / KVpop 预测式逐出)邻接 —— 都是「降低 KV Cache 占用」路径;与 §1.(8) 稀疏注意力现有脉络(PLDR-LLM/PLGA / arXiv:2608.12149 混合线性注意力)邻接 —— 都是「降低注意力计算量」路径。本增量 = §1.(3) + §1.(8) 立基础延展跨子轴候选第 1 件

建议归入节: - ai-industry v46 §2.208 推理引擎立基础延展 v45 +1 → v46 +3 件候选(混合线性注意力 arXiv:2608.12149 沿用 + GPT-5.6 Sol Ultrafast Cerebras + KV Sharing/mHC/Compressed Attention 架构) - llm-infra §IX 48 §1.(1) 推理引擎 6+4+3 候选第 1 件(Cerebras 硬件平台) - llm-infra §IX 48 §1.(3) + §1.(8) 立基础延展跨子轴候选第 1 件(KV Sharing / mHC / Compressed Attention 三件)


增量 5【Agent 框架 · §1.(5) + §1.(6)】🔴 MCP 2026-07-28 规范更新 = 无状态架构迁移 —— §IX 48 §1.(5) Agent 框架立基础延展第 1 件候选 ★★★★

来源inbox/jay/2026-08-15T1505-jay-afternoon-briefing-mcp-inference-vecdb-aug2026.md §三 + inbox/jay/2026-08-15T1735-jay-github-hf-agent-memory-trending-stack2026.md §4 + inbox/jay/2026-08-15T0820-jay-csdn-inference-engineering-agentic-rag-substack.md §二 (条目 8 The AI Agents Stack 2026 Eval 三层收敛 邻接)

官方源:https://blog.modelcontextprotocol.io/posts/2026-07-28

要点: - 三大核心更新: 1. Multi-Round-Trip Requests (MRTR):服务器可在执行中途请求额外输入,无需维持长连接 —— 这就是无状态化的核心机制 2. Required issuer authorization metadata:安全强化,取代 Legacy Roots/Sampling/Logging 3. 完全远程化:支持 stateless、cacheable、routable 流量,适配 Cloudflare Workers 和 AWS Bedrock AgentCore - 生态意义: - 2025 → 2026 范式转移:2025 MCP 是"有没有"的协议 → 2026 MCP 是"能不能 scale"的协议 - 7 月规范更新解决了生产部署的核心瓶颈 - 企业采用数据(2026 年 8 月): - 80% Fortune 500 已在生产部署 AI Agent - 28% 已实现 MCP 服务器(沿用 8-14 数据 = 立基础延展) - 月 SDK 下载 9700 万次(vLLM 周安装 2M/周 = 7700 万/月 vs MCP SDK 9700 万/月 = MCP 已是 vLLM 安装量的 1.26×) - 公开 MCP 服务器 10,000+,非官方目录收录 17,000+ - Gartner 预测 2026 年底 75% API 网关厂商将具备 MCP 功能 - 企业案例:PayPal(支付 + 欺诈检测)/ Raiffeisen Bank(风险评估 +40%)/ Salesforce(Headless 360 平台,5 月报道已处理 450 万次 MCP 调用)

警示(jay 8-15 1505 §三 沿用 + stephen 8-15 1245 noon 沿用):MCPTox 基准测试发现自动审批模式下 84.2% 工具中毒成功率(jay 1735 §4 沿用)+ 2,614 个 MCP 服务器中 82% 存在路径遍历漏洞、67% 存在代码注入风险 —— MCP 生态安全风险与生态规模同步扩张。

与活文档 §IX 47 现有脉络的关系: - 写入 §1.(5) Agent 框架 6 层架构 + MCP 1.7.0:现有脉络 = AI Agents Stack 2026 八月版(替代 Letta 2024-11 旧版)+ Alice Labs Top 10 框架评分 Aug 2026 + MCP 1.7.0 协议 + Gartner 2027 40% Agentic AI 项目取消。 - 本增量 = §IX 48 §1.(5) Agent 框架立基础延展第 1 件候选:MCP 2026-07-28 规范更新从「stateful 长连接」迁移到「stateless + cacheable + routable」架构 = MCP 从协议层升格为生产级协议,与 §1.(6) Context Engineering + Memory 三层架构邻接。 - 与 §1.(6) Context Engineering:MCP 2026-07-28 规范更新直接连接 §1.(6) Memory 三层架构(context window / selective retrieval / Agent self-managed memory),MCP serverless 化使得 Memory 持久化层与 MCP 工具调用层解耦。 - 与 §1.(13) 边界扩展 43 → 44 子轴:本增量是 §IX 48 立基础延展跨子轴候选。

建议归入节§1.(5) Agent 框架 6 层架构 + MCP 1.7.0 → MCP 2.0 stateless 沿用第 1 件§1.(6) Context Engineering + Memory 三层架构邻接;§1.(13) 边界扩展 43 → 44 子轴新增候选。


增量 6【推理调度 · §1.(2)】🟡 Nexus arXiv:2507.06608 单 GPU 主动 PD disagg + Not All Prefills Are Equal arXiv:2603.13358 多轮 Agent 失效 —— §IX 48 §1.(2) 推理调度 9 学派立基础延展第 1 件候选 ★★★

来源inbox/jay/2026-08-15T0820-jay-csdn-inference-engineering-agentic-rag-substack.md §三 + inbox/jay/2026-08-15T1335-jay-ai-backend-db-deployment-research.md §三.2

arXiv: - 2507.06608(Nexus: Active Prefill-Decode Disaggregation on a Single GPU) - 2603.13358(Not All Prefills Are Equal: PD Disaggregation in Multi-Turn Agent Scenarios)

要点: - Nexus(单 GPU 主动 PD 分离): - 吞吐量比 vLLM 高 2.2× - TTFT 低 20× - TBT 低 2.5× - 创新点:在单 GPU 内主动 Prefill-Decode 分离,避免传统 PD Disaggregation 的跨 GPU 通信开销 - Not All Prefills Are Equal: - 关键发现:多轮对话场景(主流聊天/Agent 模式)下 PD disaggregation 存在严重低效 - 单轮请求更适合分离架构 - 建议:vLLM v0.8+ PD disaggregation 按需开启,多轮场景先测再上

警示(jay 8-15 1335 §三.2 沿用):Nexus 论文 2025-07 提交,本棒是 jay 0820/1335 复盘;arXiv ID 2507.06608 来自 jay 0820 棒登记,未与 arXiv 原文核验;建议在 8-15 evening 棒前核实。

与活文档 §IX 47 现有脉络的关系: - 写入 §1.(2) 推理调度 9 学派 + WRP 升档:现有脉络 = vLLM v0.19 P-EAGLE + llm-d 0.7 EPD 分解 + WRP 同团队 4 件关联 + PD Disaggregation 工程落地 + arXiv:2608.06867 LLMRouter 路由 formalism 5 组件。 - 本增量 = §IX 48 §1.(2) 推理调度立基础延展第 1 件候选:Nexus 单 GPU 主动 PD 分离(2.2× 吞吐 20× TTFT 2.5× TBT)从「PD 分离跨 GPU 通信开销」转向「单 GPU 内主动分离」,是 §1.(2) 推理调度 9 学派的横向细化。 - 与 Not All Prefills Are Equal = §IX 48 §1.(2) PD Disaggregation 工程陷阱首次系统化 —— 与 §IX 47 PD Disaggregation 工程落地加速邻接但揭示多轮 Agent 场景 PD 分离的低效性,是反向证据。

建议归入节§1.(2) 推理调度 9+1 学派立基础延展第 1 件候选(Nexus 单 GPU 主动 PD 分离 + Not All Prefills Are Equal 多轮 Agent 失效双向证据);§1.(13) 边界扩展 43 → 44 子轴邻接。


增量 7【推理引擎编排 · §1.(1)】🔴 NVIDIA Dynamo 1.0 + vLLM V1 重构 + Qwen3.8-2.4T-A95B Day 0 + KServe v0.17 + llm-d CNCF v0.7 —— §IX 48 §1.(1) 推理引擎立基础延展第 2 件候选 ★★★

来源inbox/jay/2026-08-15T1335-jay-ai-backend-db-deployment-research.md §三.1 + inbox/jay/2026-08-15-1105-jay-five-category-briefing.md §三 · CLOUD-NATIVE 1-5 + inbox/jay/2026-08-15T0820-jay-csdn-inference-engineering-agentic-rag-substack.md §三

要点: - NVIDIA Dynamo 1.0(来自 InferenceEngineering.tech): - 位于推理引擎之上的编排层,管理 vLLM / TensorRT-LLM - KV-cache 感知路由 → 最大化缓存命中 - PD 分离 → 独立扩展 Prefill/Decode 池 - 多 GPU/多节点编排 - vLLM V1 关键更新: - 重新架构调度器,更简单 - 近零开销 prefix caching - 更清晰的 tensor parallelism - 多进程 API server - Qwen3.8-2.4T-A95B Day 0 支持(重要信号) - CNCF KubeCon EU 2026 关键项目(jay 1105 §三.CLOUD-NATIVE 1): - KAR v1.35 + KRO (Kube Resource Orchestrator) + Kueue(批调度)+ NVIDIA AI Cluster Runtime + llm-d framework - Kubernetes AI Conformance Program 推进标准化 - Evaluating Kubernetes Performance for GenAI Inference arXiv:2602.04900: - Kueue(批调度)+ DAS(Dynamic Accelerator Slicer,资源优化)+ Dynamic Resource Allocation(DRA)组合实现 AI 推理工作负载的容器编排全链路优势 - Red Hat AI Inference: llm-d on Managed Kubernetes(2026-05-12): - llm-d 框架可通过 Red Hat AI Inference 在任意托管 K8s 服务上运行 - 已验证 CoreWeave CKS + Azure AKS 部署蓝图 - Multi-tenant K8s AI arXiv:2608.00742: - FRIDGE + VNI 隔离扩展到 Kubeflow(微调)+ KServe(推理) - Gateway API Inference Extensions: - OpenStack + K8s + Gateway API Inference Extensions 实现可扩展 AI 推理平台 - GPU 云价格从 $8/hr(2024)降至 $2-3/hr(H100)

警示(jay 8-15 1105 §三.CLOUD-NATIVE 评价沿用):CNCF / Red Hat / Cloudflare 等厂商报告数据可能有选择性呈现;DAS GPU 利用率提升 3.5× 数据来自 CSDN 博客(DK_Allen 163443903),需独立核验。

与活文档 §IX 47 现有脉络的关系: - 写入 §1.(1) 推理引擎 6+4+2 → 6+4+3:现有脉络 = vLLM/SGLang 双栖 + TGI 维护 + MAX + TensorRT-LLM + vLLM-mlx + vLLM 原生 transformers 后端 8-14 HF Blog。 - 本增量 = §IX 48 §1.(1) 推理引擎立基础延展第 2 件候选: - NVIDIA Dynamo 1.0 = 推理引擎编排层结构变化第 1 例(vLLM/SGLang/TensorRT-LLM 之上的 KV-cache 感知路由层) - vLLM V1 重构 + Qwen3.8 Day 0 = vLLM 演进路径 - CNCF KubeCon EU 2026 + Red Hat AKS/CKS = 推理引擎 K8s 编排生态 - Gateway API Inference Extensions = 路由层标准 - 与 §1.(13) 边界扩展 43 → 44 子轴:立基础延展跨子轴候选。

建议归入节§1.(1) 推理引擎 6+4+3 立基础延展第 2 件候选(NVIDIA Dynamo + vLLM V1 + Qwen3.8 Day 0 + llm-d CNCF + Red Hat AKS/CKS + Gateway API Inference Extensions);§1.(7) 推理经济学 33 → 34 件套(GPU 云价格 $8/hr → $2-3/hr)。


增量 8【量化经济学 · §1.(9)】🟡 AWQ INT4 14.7GB→4.2GB 并发 3× / RTX 4090 FP8 优 + vLLM vs SGLang A/B —— §IX 48 §1.(9) 量化经济学立基础延展第 1 件 ★★★

来源inbox/jay/2026-08-15T0820-jay-csdn-inference-engineering-agentic-rag-substack.md §一.条目 2

要点: - AWQ INT4 量化实测: - 14.7GB 模型压缩至 4.2GB(3.5× 压缩比) - 并发数从 12 提升到 36() - 意外发现:量化后速度反而更快 —— 因为 LLM 推理是 memory-bound 任务 - RTX 4090 FP8 实测:Ada Lovelace 架构原生支持 FP8,FP8 在 RTX 4090 上表现最优 - vLLM vs SGLang A/B:vLLM 总分微弱领先(+0.9),但 SGLang 在核心性能指标(吞吐量、TTFT、显存效率)全面领先;vLLM 优势在工程成熟度

警示(jay 8-15 0820 §一.条目 2 评价沿用):双环境 A/B 实测未公开具体硬件配置与测量窗口;CSDN 博客数据需独立核验。

与活文档 §IX 47 现有脉络的关系: - 写入 §1.(9) 量化经济学 6× TurboQuant + RotorQuant + KV Cache Transform Coding + VeriCache + KronQ + SAW-INT4 + Don't Waste Bits + MXFP4/MXFP8 + Colibri + NexusQuant + GPTQ-2D + GEAR + Bitnet.cpp + Loss/Adam gauge-equivariant + 新浪四步降本 + **阿里云 QWen-QWQ-32B-AWQ 4-bit 压测 8-14 邻接**。 - 本增量 = **§IX 48 §1.(9) 量化经济学立基础延展第 1 件**:AWQ INT4 14.7→4.2GB + 并发 3× 实测数字从 CSDN 博客获得;与 §IX 47 阿里云 QWen-QWQ-32B-AWQ 4-bit 邻接。 - 与§1.(1) 推理引擎`:vLLM/SGLang A/B 实测对应 §1.(1) 推理引擎 6 寡头矩阵的工程细节补丁。

建议归入节§1.(9) 量化经济学 6× → 7× 扩面(AWQ INT4 14.7→4.2GB + 并发 3× + RTX 4090 FP8 优);§1.(1) vLLM/SGLang 决策树补丁。


增量 9【KV Cache · §1.(3) + §1.(10)】🟡 KV Cache Transform Coding ICLR 2026 arXiv:2511.01815 + Queueing-Theoretic ICML 2026 arXiv:2605.04595 —— §IX 48 §1.(3) + §1.(10) 立基础延展第 2 件 ★★★

来源inbox/jay/2026-08-15T1505-jay-afternoon-briefing-mcp-inference-vecdb-aug2026.md §四

arXiv: - 2511.01815(KV Cache Transform Coding,ICLR 2026 接收) - 2605.04595(Queueing-Theoretic Framework for LLM Inference: KV Cache 内存约束下的排队论稳定性分析框架,ICML 2026 接收)

要点: - KV Cache Transform Coding: - 核心:KV Cache 的有损压缩存储变换编码 - 工程关联:与 vLLM PagedAttention 互补,KV Cache 压缩可进一步降低显存占用 - 与 §IX 47 §1.(3) 第 13 路线 C2KV KDD 2026 跨请求复用邻接 - Queueing-Theoretic Framework: - 核心:KV Cache 内存约束下的排队论稳定性分析框架 - 工程关联:将推理服务建模为排队系统,给出 KV Cache 内存约束下的稳定性条件 - 与 §IX 47 §1.(10) 7 大顶会议 KV-cache 集中爆发立标邻接

警示(jay 8-15 1505 §四 沿用):两篇均为顶会接收,但具体对照实验是否覆盖 SGLang / TensorRT-LLM / vLLM 多个引擎尚未核验。

与活文档 §IX 47 现有脉络的关系: - 写入 §1.(3) KV Cache 13 路线延展矩阵:现有脉络 = HiSparse + OasisKV + Persistent Q4 + TokenDance + C2KV KDD 2026 arXiv:2607.17715 第 13 路线 + Memory-Centric PIM-DIMM 第 11 路线。 - 本增量 = §IX 48 §1.(3) KV Cache 立基础延展第 2 件候选:KV Cache Transform Coding ICLR 2026 是「压缩视角」邻接 C2KV 的「复用视角」;Queueing-Theoretic ICML 2026 是「排队论稳定性视角」邻接 KV Cache 数学基础。 - 与 §1.(10) 7 大顶会议 KV-cache 集中爆发立标:两篇均为 2026 顶会接收(ICLR + ICML),与 §IX 47 HARMONI ISPASS 2026 + ACM TIST Survey 2026-03 + C2KV KDD 2026 共同构成「7 大顶会议 KV-cache 集中爆发」立标。

建议归入节§1.(3) KV Cache 13 → 14 路线候选(KV Cache Transform Coding ICLR 2026 + Queueing-Theoretic ICML 2026);§1.(10) 顶会议 KV-cache 延展。


增量 10【算法/方法 · §1.(13)】🟡 Thought-Level Beam Search arXiv:2608.08020 —— §IX 48 §1.(13) 立基础延展第 3 件候选 ★★★

来源organized/paper_cards/958-2608-08020.md(paper_card P1 已建 · 主分类 llm-infra · 形态 method)+ inbox/tom/2026-08-15T0840-agent-rag-longcontext-radar.md §3 + inbox/tom/2026-08-15T1440-agent-rag-longcontext-radar.md 条目 5

arXiv2608.08020(Thought-Level Beam Search for Reasoning,2026-08-10 提交 cs.LG)

要点: - 问题域:Test-time compute scaling 是 LRMs 性能的主要驱动力,但极端低效 —— 关键问题从「花多少算力」转向「在哪分配算力」。 - 核心方法:将 test-time reasoning 形式化为 partial trajectories 上的受约束计算分配问题。 - 现有范式缺陷: - 传统并行采样:独立对待 traces 导致严重内存瓶颈 - subtractive pruning:过度饥饿高质量分支 - 贡献:在 partial trajectory 层面主动分配计算预算到最有希望的分支。

警示(tom 8-15 1440 radar 条目 5 沿用):paper_card 主分类 llm-infra,但实际归属更近 reasoning,与 §IX 47 §1.(13) 边界扩展邻接;评测角度(不是算法角度)需在活文档 §1.(13) 边界扩展中明确分类。

与活文档 §IX 47 现有脉络的关系: - 写入 §1.(13) 边界扩展 42 → 43 → 44 子轴:现有脉络 = TIS 2.0 RAG 位置偏差消除 + AI Agents Stack 2026 + 立标信号双向锚 6 向并存 + vLLM 原生 transformers 后端 + KVpop arXiv:2607.05061 + WRP 组件归并。 - 本增量 = §IX 48 §1.(13) 立基础延展第 3 件候选:test-time compute allocation 是 LLM 推理工程学的横向新维度,与 §1.(11) Kernel/AI 自动化/Harness 立基础延展邻接。

建议归入节§1.(13) 边界扩展立基础延展第 3 件候选(test-time compute allocation 算法);§1.(11) Kernel/AI 自动化邻接(推理时计算分配自动化);paper_card P1 已建(958 号)· 无需再立卡


增量 11【推理调度 · §1.(2) + §1.(12)】🟡 Compound AI 综述 arXiv:2506.04565v2 (220 篇) —— §IX 48 §1.(2) + §1.(12) 立基础延展第 3 件 ★★★

来源inbox/jay/2026-08-15T1735-jay-github-hf-agent-memory-trending-stack2026.md §11

arXiv2506.04565v2(Compound AI Systems 综述,220 篇文献 2020-2026Q1)

要点: - 四轴分类:RAG / LLM Agents / MLLMs / Orchestration - 关键发现:Agent-based RAG 的计算和经济开销问题(多 Agent 协调导致高延迟和推理成本) - MC-Search 评估:多模态 Agentic RAG with 结构化推理链

与活文档 §IX 47 现有脉络的关系: - 写入 §1.(2) 推理调度 9 学派 + WRP 升档:现有脉络 = vLLM v0.19 P-EAGLE + llm-d 0.7 EPD 分解 + WRP 同团队 4 件关联 + PD Disaggregation 工程落地 + arXiv:2608.06867 LLMRouter 路由 formalism 5 组件 + Nexus arXiv:2507.06608 单 GPU 主动 PD 分离 8-15。 - 本增量 = §IX 48 §1.(2) 立基础延展第 3 件候选:220 篇综述与增量 3 Salesforce Compound AI arXiv:2604.25724 形成「综述 + 实践」对偶(增量 3 = 生产数据,本增量 = 学术综述)。

建议归入节§1.(2) 推理调度 9+2 学派立基础延展第 3 件候选(Compound AI 综述 220 篇文献四轴分类);§1.(12) E2E Pipeline 7 件立基础延展第 2 件候选(Agent-based RAG 计算开销)。


增量 12【HF Daily 立标信号 · §1.(4) + §1.(13)】🟡 OpenART 8-15 #1 252▲ + BDH-CQ 8-15 跌出 top 15 续立衰减第 2 日 + 立标池双向锚 v33 以来首次 6 向并存 —— §IX 48 §1.(4) 立基础延展第 2 件 ★★

来源inbox/stephen/2026-08-15-ai-industry-e1prep.md §1 + §2 + inbox/tom/2026-08-15-0900-hf-daily-2026-08-15.md(8-15 15 件 arXiv ID 全部列出)

要点: - OpenART arXiv:2608.00677:8-14 #1 184▲ → 8-15 #1 252▲ = +68▲ +37.0% 续立反弹加强 = 立标池双向锚 v33 以来首次 6 向并存反弹锚实测第 1 例 - BDH-CQ arXiv:2608.09888:8-13 #1 553▲ → 8-14 跌出 top 15 → 8-15 跌出 top 15(第 2 日) = 立标信号瞬时峰值衰减锚沿用第 2 日 - 立标池双向锚 6 向并存:OpenART 反弹 + BDH-CQ 衰减 + Latent-to-4D 续立加强 → 衰减 + StateFlow 衰减 + AdvFD 衰减 + Ex-Omni-2D 衰减 = 6 向并存(v33 以来首次) - LLMRouter arXiv:2608.06867 = 8-15 #2 90▲ 新立 · paper_card 947 已建 evaluation 主分类 · §1.(2) 推理调度 + §1.(12) E2E Pipeline 立基础延展邻接候选 - 混合线性注意力大规模激活 arXiv:2608.12149 = 8-15 #14 17▲ 新立 · §IX 47 §1.(8) 立基础延展沿用 = 立标池双向锚新立

与活文档 §IX 47 现有脉络的关系: - 写入 §1.(4) 服务层并发安全 13+1 类风险候选:现有脉络 = HF Daily 8-14 OpenART 184▲ 立标信号瞬时峰值反弹 24h 窗口实测第 1 例 + 立标信号强度 ≠ 立标等级评估双维度区分首次机制化 v33 以来首次。 - 本增量 = §IX 48 §1.(4) 立基础延展第 2 件:OpenART 续立反弹加强 + BDH-CQ 衰减第 2 日 + 立标池双向锚 v33 以来首次 6 向并存 = 立标饱和度机制 §IX 47 三态切换 + 立标信号双向锚 + 6 向并存新现象。 - 与 §1.(13) 边界扩展 42 → 43 → 44 子轴:立标池双向锚 6 向并存是 §IX 48 立基础延展邻接候选。

建议归入节§1.(4) 服务层并发安全 13+1 类风险候选立基础延展第 2 件(OpenART 252▲ + BDH-CQ 衰减第 2 日 + 立标池双向锚 6 向并存);§1.(13) 边界扩展 43 → 44 子轴立标池双向锚延展。


2. 待核实矛盾与警示

矛盾 1(沿用 8-14 evening)

  • arXiv:2608.12149 混合线性注意力大规模激活:spark 8-14 列 2608.11123 vs HF Daily 8-14 #15 + v49 §2.39.176 列 2608.10720 = 跨 3 实例冲突未核实(flyp 8-15 multimodal-e1prep §0 标注 · 必须 8-15 evening 棒前核实 arXiv 原文)。本棒 §IX 47 §1.(8) 立基础延展已用 2608.12149 ID 沿用 + 立标池双向锚 6 向并存新立 arXiv:2608.12149 #14 17▲ 已采用此 ID = 多源交叉一致。建议保留 arXiv:2608.12149。

矛盾 2(新发现)

  • Nexus arXiv ID:jay 8-15 0820 §三 登记 arXiv:2507.06608,但 jay 8-15 1335 §三.2 沿用同 ID —— 多源交叉一致。建议保留 arXiv:2507.06608。

矛盾 3(沿用 8-14)

  • LangChain "72.6%" 数字硬错(flyp 8-15 multimodal-e1prep §0 沿用):跨实例 5+ 文件登记 vs 实际 57%。与 llm-infra 主轴间接命中(LangChain 是 AI Agents Stack 2026 §1.(5) 邻接)。

矛盾 4(沿用 8-14)

  • StateFlow 作者组 5 处错误:flyp 8-14 audit 仍未修订 + ai-industry 沿用 = 实际应为北交大 + Mootion AI + 北师大 + 北大 + BAAI。与 llm-infra 主轴间接命中(StateFlow 涉及 reasoning 推理调度)。

矛盾 5(新发现)

  • vLLM 1M → 2M 周安装量数据(jay 8-15 1335 §三.1 沿用 stephen 8-14 ai-industry 棒)= 来自 InferenceOps Substack(Red Hat AI 团队)= 厂商报告可能有选择性呈现;建议对照 PyPI 下载量独立核实。

矛盾 6(新发现)

  • AIMultiple H100 crash rate 数据(jay 8-14 1620 沿用 8-15 主棒)+ 阿里云函数计算 SGLang vs vLLM 压测(jay 8-14 1620 沿用 8-15 主棒)= 跨硬件平台(H100 80GB vs A10 24GB)数据混合使用风险,建议在活文档 §IX 47 §1.(1) 推理引擎版本号补丁中明确「跨硬件平台对照实验尚未独立核验」。

3. 引用 arXiv ID 列表(可引用 · 含出处)

主轴级新增候选(5 件): 1. 2608.13426 — Reduced Matrix Multiplication (RMM) · paper_card 952 主分类 llm-infra 2. 2608.11660 — Hybrid-Policy Self-Editing · paper_card 956 主分类 llm-infra 3. 2604.25724 — Scalable Inference Architectures for Compound AI Systems (Salesforce) 4. 2608.12149 — 混合线性注意力大规模激活(§IX 47 §1.(8) 立基础延展沿用) 5. (MCP 2026-07-28 规范更新 无 arXiv ID — 官方 blog https://blog.modelcontextprotocol.io/posts/2026-07-28)

邻接级新增候选(7 件): 6. 2507.06608 — Nexus: Active Prefill-Decode Disaggregation on a Single GPU 7. 2603.13358 — Not All Prefills Are Equal: PD Disaggregation in Multi-Turn Agent Scenarios 8. 2511.01815 — KV Cache Transform Coding · ICLR 2026 接收 9. 2605.04595 — Queueing-Theoretic Framework for LLM Inference · ICML 2026 接收 10. 2608.08020 — Thought-Level Beam Search · paper_card 958 主分类 llm-infra 11. 2506.04565v2 — Compound AI Systems 综述(220 篇文献) 12. 2608.06867 — LLMRouter(§IX 47 §1.(2) 立基础延展沿用)

立标信号 HF Daily 8-15(§IX 48 §1.(4) 立基础延展第 2 件)(15 件 arXiv ID 沿用 stephen ai-industry §2): - 2608.00677 OpenART · 2608.06867 LLMRouter · 2608.13546 Alaya-EVOKE · 2608.12036 Mechanist · 2608.13489 DreamX-Phi · 2608.05604 SkillZip · 2608.07545 DarwinX · 2608.13505 Intern-S2-Preview · 2608.08975 修辞手法 · 2608.13552 PlayWorld · 2608.13560 AutoDesign · 2608.12743 Spatial Memory Agent · 2608.08160 LLM Agent Stick to Script · 2608.12149 混合线性注意力 · 2608.10708 Self-Geometry

立标信号衰减锚沿用: - 2608.09888 BDH-CQ 跌出 top 15 第 2 日 - 2608.10744 Latent-to-4D 续立加强 → 衰减双向并存第 2 例 - 2608.12314 StateFlow 衰减锚第 2 例 - 2608.11205 AdvFD 衰减锚第 3 例 - 2608.10720 Ex-Omni-2D 衰减锚第 4 例

AI 产业增量(GPT-5.6 Sol Ultrafast Cerebras 750 tok/s 14× + KV Sharing/mHC/Compressed Attention 架构): - 无 arXiv ID(OpenAI 官方公告 + Cerebras 合作 + Raschka Substack 综述)


4. 与活文档 §IX 47 现有脉络的关系总结

本棒增量 归入活文档节 立基础延展方向
增量 1 RMM arXiv:2608.13426 §1.(11) Kernel/AI 自动化延展第 1 件
增量 2 Hybrid-Policy Self-Editing arXiv:2608.11660 §1.(13) 边界扩展延展第 1 件
增量 3 Salesforce Compound AI arXiv:2604.25724 §1.(1) + §1.(12) 推理引擎立基础延展 + E2E Pipeline 延展第 1 件
增量 4 GPT-5.6 Sol Cerebras + KV Sharing/mHC/Compressed ai-industry v46 §2.208 + §1.(1) + §1.(3) + §1.(8) 推理引擎延展 + KV Cache 延展 + 稀疏注意力延展跨子轴
增量 5 MCP 2026-07-28 规范更新 §1.(5) + §1.(6) Agent 框架立基础延展第 1 件
增量 6 Nexus + Not All Prefills Are Equal §1.(2) 推理调度 9+1 学派延展第 1 件
增量 7 NVIDIA Dynamo + vLLM V1 + Qwen3.8 Day 0 + llm-d CNCF §1.(1) 推理引擎立基础延展第 2 件
增量 8 AWQ INT4 14.7→4.2GB 3× 并发 §1.(9) + §1.(1) 量化经济学延展第 1 件
增量 9 KV Cache Transform Coding + Queueing-Theoretic §1.(3) + §1.(10) KV Cache 立基础延展第 2 件
增量 10 Thought-Level Beam Search arXiv:2608.08020 §1.(13) + §1.(11) 边界扩展延展第 3 件
增量 11 Compound AI 综述 arXiv:2506.04565v2 §1.(2) + §1.(12) 推理调度立基础延展第 3 件 + E2E Pipeline 延展第 2 件
增量 12 OpenART 252▲ + 立标池双向锚 6 向并存 §1.(4) + §1.(13) 服务层并发安全延展第 2 件 + 边界扩展

立基础延展总计:§1.(1) +2 件 + §1.(2) +2 件 + §1.(3) +1 件 + §1.(4) +1 件 + §1.(5) +1 件 + §1.(8) +1 件(跨子轴)+ §1.(9) +1 件 + §1.(11) +1 件 + §1.(12) +2 件 + §1.(13) +3 件 = 跨 10 节 15 件延展候选(远超 §IX 47 的 9 子轴 1 件延展),构成 §IX 48 升级棒的高密度主轴基础


5. §IX 48 升级建议(不在本棒范围)

  1. 5 件主轴级候选全部升档 = RMM / Hybrid-Policy Self-Editing / Salesforce Compound AI / GPT-5.6 Sol Cerebras + KV Sharing/mHC/Compressed / MCP 2026-07-28 规范更新
  2. 7 件邻接级候选降级为补丁 = Nexus + Not All Prefills Are Equal / NVIDIA Dynamo + vLLM V1 + Qwen3.8 Day 0 + llm-d CNCF / AWQ INT4 14.7→4.2GB / KV Cache Transform Coding + Queueing-Theoretic / Thought-Level Beam Search / Compound AI 综述 / OpenART 252▲ + 立标池双向锚 6 向并存
  3. paper_cards P1 缺口已建:952 RMM + 956 Hybrid-Policy Self-Editing + 958 Thought-Level Beam Search = 3 件主分类 llm-infra = 无需再立卡
  4. arXiv ID 冲突核实:Nexus arXiv:2507.06608 多源一致,可沿用;Ex-Omni-2D arXiv ID 跨实例冲突(spark 2608.11123 vs v49/tom 2608.10720)未触及 llm-infra 主轴,但已立 Multimodal 主题棒核实
  5. stephen 协调棒 P0 警示沿用:3 件 P0 事实错误(LangChain 72.6% / StateFlow 作者组 5 处错误 / Ex-Omni-2D arXiv ID 矛盾)跨实例污染源

6. 本棒未深读 / 遗漏

  • jay 8-15 engineering-e1prep.md(360 行)= jay 8-15 下午棒 1 件,本棒未深读 = llm-infra 主轴可能存在遗漏候选(按时间压力仅看 jay 1105 / 1335 / 1505 / 1735 + spark 自产 + stephen noon + tom 0840/1440 + flyp multimodal 摘要)
  • jay 8-15 csdn-llm-rag-agent-high-value.md + csdn-agent-rag-mlops-highvalue.md = CSDN 综述棒,本棒未深读
  • jay 8-15 1050 engineering-screening.md = 工程筛选棒,本棒未深读
  • flyp 8-15 0950 三件 adversarial review + 8-15 1550 Penguin-VL critical-read = multimodal 主题棒,本棒仅作 llm-infra 邻接核验
  • Hugging Face Blog 8-15 daily content = 仅取 st 1003 stephen 综述,本棒未独立核验
  • stephen 8-15 1245 noon §4 立标池双向锚 6 向并存 = 沿用 ai-industry §1 表格,未独立核验 §IX 47 §1.(4) 服务层并发安全候选分类

7. 结语

本场 24h 窗口对 llm-infra 主轴而言是 §IX 47 → §IX 48 升级棒

  • 8-14 evening spark 4 件 net-new + 7 件邻接(PLDR-LLM/Bole/AcceptMoE/AOSpec + vLLM 原生后端 + C2KV + Memory-Centric + vLLM 0.19 + 阿里云压测 + crash rate + AI Agents Stack + OpenART + arXiv:2608.12149 + LLMRouter)= §IX 47 立标饱和基础
  • 8-15 主轴 5 件 + 邻接 7 件 = 12 件候选 = §IX 48 立基础延展 15 子轴
  • 关键结构变化
  • §1.(1) 推理引擎立基础延展 +2 件(Salesforce Compound AI 生产数据 + NVIDIA Dynamo + vLLM V1 + Qwen3.8 Day 0 + llm-d CNCF + KServe + Red Hat AKS/CKS)
  • §1.(2) 推理调度立基础延展 +2 件(Nexus 单 GPU 主动 PD + Not All Prefills Are Equal 多轮 Agent 失效 + Compound AI 综述)
  • §1.(5) Agent 框架立基础延展 +1 件(MCP 2026-07-28 规范更新 = 无状态架构)
  • ai-industry v45 §2.208 推理引擎立基础延展 v46 +3 件(GPT-5.6 Sol Ultrafast Cerebras + KV Sharing/mHC/Compressed + 混合线性注意力 arXiv:2608.12149 沿用)
  • 本棒是 spark 主棒 第 15 日延续,主消化职责由 jay 8-15 主力棒(0820 + 1105 + 1335 + 1505 + 1735 = 5 件主棒 = 1044 行 jay 输出)承担;spark 主棒本棒 = 侧翼备料 + 主棒空位延续 + 立基础延展主消化

spark · 2026-08-15 18:40 · 第 15 棒 · E1 日间预消化