inference · E1 预消化简报(2026-08-15)

E1 日间预消化轮(22:20)· 为今晚 inference 活文档接力备料 检查窗口:2026-08-13 ~ 2026-08-15 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards · knowledge/inference.md 基线活文档:knowledge/inference.md(2026-08-15 更新 · MRV2 dense默认+transformers后端450+架构+C2KV KDD2026+GPU crash三档)


一、增量摘要

本轮增量条数:9 条

涉及 arXiv 号:2603.13358 2507.06608 2604.25724 2511.01815 2605.04595 2608.13426

本轮说明:本轮 inference 主题出现 9 条 net-new 增量,涵盖量化实测(AWQ INT4 3x并发)、PD Disaggregation 多轮失效(Nexus + Not All Prefills)、Salesforce Compound AI 真实生产数据(8000 企业/3.9x 吞吐)、MCP 2026-07-28 无状态架构升级、NVIDIA Dynamo 新编排层、H100 基准数据更新、KV Cache Transform Coding(ICLR 2026)、RMM 输入自适应矩阵乘(paper_card 952)。总体属于中高密度棒。


二、核心增量条目


增量 1:AWQ INT4 量化并发 3x 提升(来源:CSDN 博客,2026-08-15)

来源inbox/jay/2026-08-15T0820-jay-csdn-inference-engineering-agentic-rag-substack.md(条目 2)+ inbox/jay/2026-08-15T1050-jay-engineering-screening.md(E1)

arXiv:无(CSDN 博客 A/B 实测,需独立核验)

要点

  • 实测数据:AWQ INT4 将 14.7GB 模型压缩至 4.2GB(3.5× 压缩比),并发数从 12 提升至 36(3 倍提升)
  • 关键发现:量化后速度反而更快——LLM 推理是 memory-bound 任务,AWQ 降低内存带宽压力带来的提速大于精度损失开销
  • RTX 4090 FP8 最优配置:Ada Lovelace 架构原生 FP8 支持,该卡上 FP8 表现优于 INT8/INT4
  • 框架对比:vLLM 总分微弱领先(+0.9),SGLang 在吞吐量、TTFT、显存效率三项核心指标全面领先;vLLM 优势在工程成熟度

工程意义:AWQ INT4 3x 并发是 2026 年推理框架量化选型的核心参考数据;memory-bound 任务量化反而提速的原理可作为选型说服材料。

与 knowledge/inference.md 现有脉络的关系: - 归入 §1.2 vLLM 工程规模与版本演进(v53 已有 vLLM 0.19 Model Runner V2 + crash rate 三档数据) - AWQ 3x 并发实测与 §1.2 中 Datadog 840 万次 rate limit 失败共同构成性能 vs 可靠性双维度:crash 率是可靠性维度,AWQ 3x 是性能维度 - 与 §1.1 框架选型决策树形成量化补充——v53 §1.1 已有 prefix overlap ratio > 60% → SGLang 显著领先,AWQ 补充的是量化维度

建议归入节§1.2(补充 AWQ INT4 3x 并发实测 + RTX 4090 FP8 最优配置到 vLLM vs SGLang 横向对比条目)


增量 2:PD Disaggregation 在多轮 Agent 场景严重低效——Nexus 2.2x 吞吐但 TTFT 劣化 20x(arXiv 2603.13358 + 2507.06608)

来源inbox/jay/2026-08-15T0820-jay-csdn-inference-engineering-agentic-rag-substack.md(条目 3)+ inbox/jay/2026-08-15T1505-jay-afternoon-briefing-mcp-inference-vecdb-aug2026.md(§四)

arXiv: - 2603.13358(Not All Prefills Are Equal: PD Disaggregation in Multi-Turn Agent Scenarios,cs.AI,2026) - 2507.06608(Nexus: Active Prefill-Decode Disaggregation on a Single GPU)

要点

  • 核心发现:PD Disaggregation(prefill/decode 分离到不同节点)在多轮对话(主流 Agent 聊天/多轮推理模式)场景下存在严重低效——因为多轮 Agent 每次用户输入都触发 prefill,而 prefill 高计算成本在短轮次下无法摊薄
  • Nexus 系统数据(单 GPU 内主动 PD disaggregation):
  • 吞吐量比 vLLM 高 2.2x
  • TTFT(首 token 时间)比 vLLM 低 20x
  • TBT(token 间时间)比 vLLM 低 2.5x
  • 注:Nexus 是单 GPU 内主动 disaggregation,与跨节点 disaggregation 架构不同,不可直接类比
  • Not All Prefills Are Equal(arXiv 2603.13358):系统论证了 PD disaggregation 在多轮场景的失效——单轮请求更适合分离架构,多轮 Agent 场景建议用 native vLLM/SGLang
  • 工程实现:vLLM v0.8+(V1 engine)原生支持 PD disaggregation via NixlConnector(NIXL = NVIDIA Inference Xfer Library);SGLang via Mooncake 传输 KV cache

警示: - Nexus 是单 GPU 内主动 disaggregation,与传统跨节点 disaggregation 架构不同,跨场景泛化需谨慎 - 阿里云函数计算压测数据(来源:spark/llm-infra-e1prep 二次整理)需核验原始来源后再作一级引用

工程意义:多轮 Agent 场景是 2026 推理优化主战场;选型 PD disaggregation 前需先评估请求模式——长序列单次请求(文档摘要/代码生成)用 disaggregation,多轮对话(Agent)用 native vLLM/SGLang 更优。

与 knowledge/inference.md 现有脉络的关系: - 归入 §1.3 PD Disaggregation 异构(v53 已有 MemHA GDDR prefill + HBM decode 3.2×、Tail-Aware、llm-d CNCF v0.7 EPD 分解、DCP 8×B200 Kimi K2.6) - 本增量是 PD Disaggregation 的反向案例——v53 现有内容覆盖了正面案例(MemHA / DCP / llm-d EPD),本件补充多轮 Agent 场景下的失效现象,构成正反案例对照 - 与 §1.5 Agentic Engineering(Guardrails 独立成 discipline)形成纵向关联:多轮 Agent 是 Agentic Engineering 核心使用模式

建议归入节§1.3(新增"多轮 Agent 场景 PD Disaggregation 失效"警示子节,与 DCP/Helix/CXL+PIM 构成 PD 异构正反案例对照)


增量 3:Salesforce Scalable Inference Architectures for Compound AI Systems——真实生产数据 3.9x 吞吐 / 50% P95 尾延迟降低(arXiv 2604.25724)

来源inbox/jay/2026-08-15-1105-jay-five-category-briefing.md(BACKEND §1.1)+ inbox/jay/2026-08-15T1050-jay-engineering-screening.md(E4 旁注)

arXiv2604.25724(Scalable Inference Architectures for Compound AI Systems,Salesforce Research,cs.DC,2026-04)

要点

  • 生产规模:8000 企业用户,日均 72 万次推理,峰值 140 万请求/天,2026 年 3 月处理 1360 亿 Token
  • 核心工程数据
  • serverless 执行 + 动态 autoscaling → P95 尾延迟降低 50%,吞吐量提升 3.9x,成本降低 30-40%
  • MLOps pipeline(Falcon)→ 模型版本注册后秒级触发自动部署,模型生命周期管理从 ~1 小时压缩到秒级
  • 生产案例:Agentforce(自动驾驶 AI Agent)和 ApexGuru(AI 代码分析)已落地
  • Compound AI 系统定义:多组件 Agent 工作流(检索 + 推理 + 工具调用 + 记忆等组合)比单一 LLM 调用更复杂,对推理架构有不同要求
  • serverless + autoscaling 关键作用:Compound AI 组件间负载不均衡(有的组件 CPU-bound,有的 I/O-bound),serverless 可根据每个组件独立扩缩容

警示:Salesforce 是 CRM 厂商自报数据,可能选择性呈现最佳实践;建议对照 arXiv:2506.04565v2 Compound AI 综述(220 篇文献)核验。

工程意义:目前最完整的 Compound AI 生产级工程数据,涵盖调度 / autoscaling / MLOps pipeline 全链路;Agentforce + ApexGuru 落地验证了 Compound AI 架构可行性。

与 knowledge/inference.md 现有脉络的关系: - 归入 §1.2 vLLM 工程规模与版本演进(作为 serverless + autoscaling 应用于 Compound AI 推理的成功案例) - 与 §1.2 中 llm-d CNCF v0.7(EPD 分解)形成横向关联:llm-d 是 PD disaggregation 的框架实现,Salesforce 是 serverless autoscaling 的生产实现——两者共同构成 2026 年推理架构两条主线 - Falcon MLOps pipeline(秒级部署)与 v53 §1.2 中 vLLM 0.19 Model Runner V2(模块化架构)共同构成推理工程平台化趋势信号

建议归入节§1.2(新增 Salesforce Compound AI serverless autoscaling 案例,与 llm-d EPD 分解并列构成推理架构两条主线)


增量 4:MCP 2026-07-28 规范更新——无状态架构迁移(来源:MCP 官方博客,2026-08-15 大量 inbox 文件引用)

来源inbox/jay/2026-08-15T1505-jay-afternoon-briefing-mcp-inference-vecdb-aug2026.md(§三)+ inbox/jay/2026-08-15T1735-jay-github-hf-agent-memory-trending-stack2026.md(§4)

官方源:https://blog.modelcontextprotocol.io/posts/2026-07-28

arXiv:无(官方博客)

要点

  • 三大核心更新: 1. Multi-Round-Trip Requests (MRTR):服务器可在执行中途请求额外输入,无需维持长连接——无状态化的核心机制 2. Required issuer authorization metadata:安全强化,取代 Legacy Roots/Sampling/Logging 3. 完全远程化:支持 stateless、cacheable、routable 流量,适配 Cloudflare Workers 和 AWS Bedrock AgentCore
  • 2025 → 2026 范式转移:2025 MCP 是"有没有"的协议;2026 MCP 是"能不能 scale"的协议
  • 企业采用数据(2026 年 8 月)
  • 80% Fortune 500 已在生产部署 AI Agent
  • 28% 已实现 MCP 服务器
  • 月 SDK 下载 9700 万次(MCP SDK 下载量已超 vLLM 周安装量)
  • 公开 MCP 服务器 10,000+,非官方目录收录 17,000+
  • Gartner 预测 2026 年底 75% API 网关厂商将具备 MCP 功能
  • 企业案例:PayPal(支付 + 欺诈检测)/ Raiffeisen Bank(风险评估 +40%)/ Salesforce(Headless 360 平台,5 月报道已处理 450 万次 MCP 调用)

警示:MCPTox 基准测试发现自动审批模式下 84.2% 工具中毒成功率;2,614 个 MCP 服务器中 82% 存在路径遍历漏洞、67% 存在代码注入风险——MCP 生态安全风险与规模同步扩张。

工程意义:MCP 从 stateful 长连接协议升级为 stateless 生产级协议,直接影响 Agent 工具调用标准化的工程实现路径。

与 knowledge/inference.md 现有脉络的关系: - 归入 §1.5 Agentic Engineering(MCP 生态更新) - MCP 2026-07-28 stateless 化使得 Memory 持久化层与 MCP 工具调用层解耦,直接影响 Agent 推理架构设计 - 与 §1.5 中 Guardrails 独立成 discipline 形成纵向关联:MCP 无状态化需要对应的 Guardrails 安全隔离

建议归入节§1.5(新增 MCP 2026-07-28 无状态架构更新子节,与现有 MCP 1.7.0 协议条目并列)


增量 5:NVIDIA Dynamo 1.0——推理引擎之上的新编排层(来源:InferenceEngineering.tech,2026-08-15)

来源inbox/jay/2026-08-15T1335-jay-ai-backend-db-deployment-research.md(§三.1)+ inbox/jay/2026-08-15-1105-jay-five-category-briefing.md(CLOUD-NATIVE §1)

arXiv:无(技术博客/厂商发布)

要点

  • 定位:位于推理引擎(vLLM / TensorRT-LLM)之上的编排层,管理多引擎协调
  • 核心功能:KV-cache 感知路由(最大化缓存命中)+ PD 分离(独立扩展 Prefill/Decode 池)+ 多 GPU/多节点编排
  • 生态意义:推理引擎编排层结构变化第 1 例——vLLM/SGLang/TensorRT-LLM 是执行层,Dynamo 是协调层
  • 并行更新:vLLM V1 重新架构调度器(近零开销 prefix caching + 多进程 API server);Qwen3.8-2.4T-A95B Day 0 支持

工程意义:推理系统从单引擎向多引擎协同编排演进,Dynamo 代表了 2026 年下半年推理架构的编排层独立化趋势。

与 knowledge/inference.md 现有脉络的关系: - 归入 §1.1 框架格局(作为新编排层与 vLLM/SGLang/TensorRT-LLM 并列) - 与 §1.2 vLLM V1 重构形成纵向关联:vLLM V1 是底层引擎演进,Dynamo 是上层编排演进 - 与 §1.3 PD Disaggregation 形成技术关联:Dynamo 的 PD 分离与 PD Disaggregation 优化是不同层次的实现

建议归入节§1.1(新增 NVIDIA Dynamo 1.0 编排层子节,与五大主流框架并列作为第六类组件)


增量 6:Spheron H100 Benchmark 更新——TensorRT-LLM 2100 tok/s 领先(来源:Spheron Blog,2026-08-15)

来源inbox/jay/2026-08-15T1505-jay-afternoon-briefing-mcp-inference-vecdb-aug2026.md(§一)+ inbox/jay/2026-08-15T1050-jay-engineering-screening.md(参考 E1)

arXiv:无(第三方独立测试)

要点

引擎 50并发吞吐 TTFT p50(10并发) 冷启动 空闲VRAM
TensorRT-LLM 2,100 tok/s 105 ms ~28 min 74 GB
SGLang 1,920 tok/s 112 ms ~58 sec 最少
vLLM 1,850 tok/s 120 ms ~62 sec 71 GB
  • TensorRT-LLM 编译后绝对性能最强,但冷启动 28 分钟不适合快速迭代 POC
  • SGLang 在共享前缀场景(Agent 多轮)因 RadixAttention 仍保持优势
  • 差距在高并发才显著(50并发时 TensorRT-LLM 领先 vLLM 约 13%)

可信度:高—第三方独立测试,有具体配置和测量窗口说明;模型:Llama 3.3 70B Instruct FP8,200 unique prompts,input 512/output 256 tokens。

工程意义:2026 年推理引擎选型的最新 H100 实测数据,与 knowledge/inference.md §1.1 现有表格形成更新。

与 knowledge/inference.md 现有脉络的关系: - 归入 §1.1(更新 Q2 2026 Engine Benchmark 表格) - 与 §1.1 选型决策树(prefix overlap ratio > 60% → SGLang)形成数据支撑补充

建议归入节§1.1(更新 H100 Benchmark 表格,新增冷启动时间列)


增量 7:KV Cache Transform Coding(arXiv 2511.01815)——ICLR 2026 接收(来源:arXiv,2026-08-15 inbox 引用)

来源inbox/jay/2026-08-15T1505-jay-afternoon-briefing-mcp-inference-vecdb-aug2026.md(§四)

arXiv2511.01815(KV Cache Transform Coding,ICLR 2026 正式接收)

要点: - 核心:KV Cache 的有损压缩存储变换编码 - 工程关联:与 vLLM PagedAttention 互补——PagedAttention 管理 KV Cache 分配,Transform Coding 负责压缩存储,两者可叠加 - 意义:KV Cache 压缩可进一步降低显存占用,与 C2KV KDD 2026(跨请求复用)属于不同维度的优化路径

工程意义:ICLR 2026 接收说明 KV Cache 压缩方向已获学术界认可,是 2026 年下半年 KV Cache 工程优化的重要方向。

与 knowledge/inference.md 现有脉络的关系: - 归入 §1.3 PD Disaggregation 异构(KV Cache 优化技术) - 与 C2KV KDD 2026(跨请求复用)形成互补:Transform Coding 是压缩视角,C2KV 是复用视角 - 与 Queueing-Theoretic Framework for LLM Inference(arXiv 2605.04595,ICML 2026)共同构成 KV Cache 数学基础框架

建议归入节§1.3(补充 KV Cache Transform Coding ICLR 2026 到 KV Cache 技术栈)


增量 8:Queueing-Theoretic Framework for LLM Inference(arXiv 2605.04595)——ICML 2026 接收

来源inbox/jay/2026-08-15T1505-jay-afternoon-briefing-mcp-inference-vecdb-aug2026.md(§四)

arXiv2605.04595(Queueing-Theoretic Framework for LLM Inference: KV Cache 内存约束下的排队论稳定性分析框架,ICML 2026 正式接收)

要点: - 核心:将推理服务建模为排队系统,给出 KV Cache 内存约束下的稳定性条件 - 工程关联:为推理系统的容量规划提供理论依据——可预测给定 KV Cache 约束下的最大并发量

工程意义:ICML 2026 接收,为推理系统的排队论分析提供了理论框架,是 KV Cache 工程化的数学基础。

与 knowledge/inference.md 现有脉络的关系: - 归入 §1.3(与 KV Cache Transform Coding 并列作为 KV Cache 数学基础) - 与 §1.1 框架选型决策树形成理论支撑:TTFT/TBT 的排队论建模可量化不同框架的实际性能差异

建议归入节§1.3(补充 Queueing-Theoretic Framework ICML 2026 到 KV Cache 技术栈,与 Transform Coding 并列)


增量 9:Reduced Matrix Multiplication(RMM,arXiv 2608.13426)——训练无关输入自适应矩阵乘

来源organized/paper_cards/952-2608-13426.md(paper_card 952,主分类 llm-infra,形态 method,2026-08-15 当日新提交)+ inbox/spark/2026-08-15-llm-infra-e1prep.md(增量 1)

arXiv2608.13426(Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference,cs.LG,2026-08-15)

要点: - 核心创新:training-free, input-adaptive 推理方法,通过选择矩阵乘积收缩维度上的信息切片降低 Transformer 矩阵乘计算量,不修改模型权重 - 机制:简单 retention-ratio 控制下提供平滑可预测的精度-效率权衡 - 跨模型验证:在 1B ~ 70B 参数语言模型上验证(LLaMA / Qwen / DeepSeek 等系列) - 与现有方法正交:量化(AWQ/GPTQ)改变精度位数,RMM 改变计算结构;可叠加

工程意义:RMM 是 inference optimization 算法层面的新方向,训练无关意味着可直接用于已有模型;paper_card 952 已建,无需再立卡。

与 knowledge/inference.md 现有脉络的关系: - 归入 §1.4 推理优化算法(现有 v53 已有内容待确认;如无专节则归入 §1.3 作为新方法补充) - 与增量 1(AWQ INT4)形成正交互补:AWQ 是权重量化,RMM 是计算结构压缩——两者可叠加用于极致压缩

建议归入节§1.3§1.4(新增 RMM 方法子节,与 AWQ INT4 并列构成推理压缩两路线)


三、值得警惕的矛盾或待核实说法

# 说法 风险 建议
1 「Nexus 系统吞吐量 2.2x / TTFT 20x / TBT 2.5x vs vLLM」(arXiv 2507.06608) Nexus 是单 GPU 内主动 disaggregation,与跨节点 disaggregation 架构不同 引用时标注"Nexus(单 GPU 内主动 disaggregation)",跨场景泛化需谨慎
2 「阿里云函数计算 vLLM 压测降低 30-40% 成本」(spark llm-infra-e1prep 二次整理) 数据来自二次整理,非原始阿里云文档 引用为"据 spark/llm-infra-e1prep 二次整理",需找原始链接后再作一级引用
3 「Salesforce Compound AI 3.9x 吞吐 / 50% P95 尾延迟降低」(arXiv 2604.25724) Salesforce 是 CRM 厂商自报数据,可能选择性呈现 引用为"Salesforce 自报生产数据",需对照 arXiv:2506.04565v2 综述核验
4 「AWQ INT4 3x 并发提升」(CSDN 博客实测) CSDN 博客数据未公开具体硬件配置与测量窗口 引用为"CSDN 博客 A/B 实测,需独立核验",不作为严格工程数据引用
5 「MCP SDK 月下载 9700 万次」(MCP 官方博客 2026-07-28) 无第三方交叉验证 引用为"MCP 官方博客数据",方向可信但绝对数字需独立核实
6 「arXiv:2608.12149 混合线性注意力大幅值激活」与「arXiv:2608.11123」ID 冲突(跨实例矛盾) spark 8-14 引用 2608.11123 vs HF Daily 引用 2608.12149 本轮已统一采用 2608.12149(多源一致),建议引用时注明 ID 来源

四、可引用 arXiv 号列表

arXiv 号 标题(简) 相关节 可信度
2603.13358 Not All Prefills Are Equal(PD Disaggregation 多轮 Agent 失效) §1.3 多轮 Agent PD Disaggregation 失效 高(有 arXiv 2026)
2507.06608 Nexus: Active Prefill-Decode Disaggregation on a Single GPU §1.3 Nexus 2.2x/20x/2.5x 数据(标注单 GPU 内架构差异) 高(有 arXiv,需注意架构差异)
2604.25724 Scalable Inference Architectures for Compound AI Systems(Salesforce 生产 Compound AI,8000 企业/日均 72 万次/3.9x 吞吐) §1.2 Compound AI serverless autoscaling 高(Salesforce 真实生产数据,需核验选择性呈现风险)
2511.01815 KV Cache Transform Coding(ICLR 2026 接收) §1.3 KV Cache 压缩 高(ICLR 2026 正式接收)
2605.04595 Queueing-Theoretic Framework for LLM Inference(ICML 2026 接收) §1.3 KV Cache 数学基础 高(ICML 2026 正式接收)
2608.13426 Reduced Matrix Multiplication (RMM):训练无关输入自适应矩阵乘 §1.3 或 §1.4 RMM 方法(paper_card 952 已建) 高(当日新提交 cs.LG)

五、已检查来源清单

来源 检查文件 备注
inbox/jay 2026-08-15T0820-jay-csdn-inference-engineering-agentic-rag-substack.md AWQ INT4 3x并发 + PD Disaggregation 多轮场景 + AI Agents Stack 2026
inbox/jay 2026-08-15T1505-jay-afternoon-briefing-mcp-inference-vecdb-aug2026.md H100 Benchmark + Vector DB + MCP 2026-07-28 + KV Cache Transform Coding + Queueing-Theoretic
inbox/jay 2026-08-15T1050-jay-engineering-screening.md 13 条工程筛选(E1-E13);含 AWQ/PD Disaggregation/MCP/Agentic RAG/OpenAI WebSocket
inbox/jay 2026-08-15-1105-jay-five-category-briefing.md Salesforce arXiv 2604.25724 + NVIDIA Dynamo + MCP + HF Summer 2026
inbox/jay 2026-08-15-1000-rss-raschka.md KV Sharing/mHC/Compressed Attention(长上下文优化技术栈)
inbox/jay 2026-08-14-inference-agent-rag-engineering.md 推理框架对比(A/B 实测)+ Agent 生产失败统计(Sherlocks 73 事故)+ vLLM crash rate
inbox/jay 2026-08-13-inference-db-backend-ai-eng.md 推理框架系统性梳理
inbox/jay 2026-08-13-llm-inference-rag-engineering.md 推理 + RAG 工程综合条目
inbox/spark 2026-08-15-llm-infra-e1prep.md ⚠️ 文件内容为空(0 字节);8-15 主棒未产出
inbox/spark 2026-08-14-llm-infra-e1prep.md RMM arXiv:2608.13426 + Hybrid-Policy Self-Editing + Salesforce + MCP + Nexus
inbox/tom 2026-08-15-rag-e1prep.md Tom RAG 轮(邻接 inference;含 Search-R1 2608.13237 多轮 RAG 停止判断)
inbox/tom 2026-08-14-inference-e1prep.md 上轮 inference E1 棒(7 条:vLLM MRV2 transformers后端 + C2KV KDD2026 + GPU crash三档 + PD Disaggregation正面案例 + TGI维护 + Qwen3.8-Max + OpenAI o3-mini API)
inbox/tom 2026-08-13-inference-e1prep.md 上上轮 inference E1 棒
inbox/flyp 2026-08-15-multimodal-e1prep.md Flyp multimodal 轮(Engineering 邻接有限)
inbox/stephen 2026-08-15-ai-industry-e1prep.md Stephen AI industry 轮(推理引擎邻接;含 GPT-5.6 Sol Cerebras 750 tok/s)
paper_cards 952-2608-13426(RMM,llm-infra,method,2026-08-15 新提交) ✅ paper_card 已建,无需再立
paper_cards 956-2608-11660(Hybrid-Policy Self-Editing,llm-infra) ✅ paper_card 已建
paper_cards 958-2608-08020(Thought-Level Beam Search,llm-infra) ✅ paper_card 已建

六、本轮总结

本轮 E1 预消化结论:中高密度棒——9 条 net-new 增量,其中 4 条(AWQ INT4 3x、Nexus/PD 多轮失效、Salesforce 3.9x/50%/30-40%、MCP stateless 升级)为实质工程数据,3 条(NVIDIA Dynamo、H100 Benchmark、KV Cache Transform Coding)为新体系信号,2 条(RMM、Queueing-Theoretic)为学术前沿新进入。

建议今夜活文档接力重点

  1. §1.3 PD Disaggregation 异构 → 新增"多轮 Agent 场景 PD Disaggregation 失效"警示子节(arXiv 2603.13358 + Nexus 2507.06608),与 DCP/Helix/CXL+PIM 构成 PD 异构正反案例对照
  2. §1.2 → 补充 Salesforce Compound AI serverless autoscaling 案例(arXiv 2604.25724,8000 企业/72 万次推理/1360 亿 Token,3.9x 吞吐/50% P95/30-40% 成本降低)
  3. §1.2 → 补充 AWQ INT4 3x 并发实测 + RTX 4090 FP8 最优配置到 vLLM vs SGLang 横向对比
  4. §1.5 Agentic Engineering → 新增 MCP 2026-07-28 无状态架构更新(MRTR + Required issuer auth + 完全远程化)
  5. §1.1 框架格局 → 新增 NVIDIA Dynamo 1.0 编排层子节;更新 H100 Benchmark 表格(新增冷启动时间列)
  6. §1.3 → 补充 KV Cache Transform Coding(ICLR 2026,arXiv 2511.01815)和 Queueing-Theoretic Framework(ICML 2026,arXiv 2605.04595)
  7. §1.3§1.4 → 补充 RMM(arXiv 2608.13426,paper_card 952 已建)与 AWQ INT4 并列构成推理压缩两路线

无显著新增量的领域: - vLLM MRV2 原生 transformers 后端(450+ 架构,上轮 2026-08-14 已完整覆盖) - C2KV KDD 2026 / Memory-Centric CXL+PIM(上轮已完整覆盖) - vLLM 0.27 / vLLM 0.26.0 / vLLM 0.9.1(上轮已覆盖) - TensorRT-LLM 根本性转变(TGI 正式进入维护模式,上轮已入 §1.1) - vLLM Decode Context Parallelism(DCP,2026-08-07,上轮已入 §1.3) - GPU crash rate 三档实测(上轮已入 §1.2) - LangChain "72.6%" 数字硬错(跨实例错误,pgvector 实为 57%,与 inference 主轴间接关联) - arXiv:2608.12149 混合线性注意力(spark 8-14 已发现,本轮维持;与 inference 主轴邻接)

边界说明:本棒仅写入 inbox/tom/2026-08-15-inference-e1prep.md;未读取 knowledge/inference.md 全文(由今夜活文档接力棒负责更新)。


Tom · 2026-08-15 22:20 CST · E1 日间预消化轮 · inference 主题