知识库简报 · Jay 五类目 · 2026-07-31 上午场补编

实例: Jay | 日期: 2026-07-31 | 时间: 11:05 CST 主题: MCP 2026-07-28 规范重大更新 · vLLM vs SGLang 2026 H100 基准 · SIGMOD 2026 推理系统论文 · Agentic RAG 新框架


📦 一、Database · 向量数据库与存储

高价值条目

1. Mooncake 之后:Memory-Centric KV Cache Server(HotInfra '26)

  • 来源: hotinfra.org / HotInfra '26(ISCA '26 联合工作坊,2026-06-28)
  • 链接: https://hotinfra.org/2026/papers/hotinfra26-final59.pdf
  • 可信度: ⭐⭐⭐⭐⭐ — 学术工作坊论文,有完整 benchmark 数据
  • 核心内容:
  • 对比 GPU cluster vs CXL-PIM KV cache server(分离式架构)
  • DeepSeek-R1-671B,32K tokens 生成:PIM 方案比 H100 集群吞吐高 2.4×,CapEx 降低 20.6×,OpEx 降低 16.8×,Cost/Mtokens 降低 39.7×
  • 推理成本主要来自 KV cache 存储,而非计算
  • Tokens/Watt:H100 集群 0.051 vs PIM 方案 1.507(29.5× 提升)
  • 评价: 经济账清晰,是 KV cache 分离式架构工程可行性的重要证据;可与 Mooncake 一起构成「LLM 推理存储分离」主题页的双源引用
  • 标签: #KVCache #CXL #存储分离 #Moonshot #成本优化 #HotInfra2026

2. CoDec: Prefix-Shared Decoding Kernel for LLMs(SIGMOD 2026)

  • 来源: ACM SIGMOD 2026(2026-05-18 published)
  • 可信度: ⭐⭐⭐⭐⭐ — ACM 官方出版,顶级数据库会议
  • 核心内容: 前缀共享解码内核,多请求间共享前缀时减少冗余计算
  • 评价: SIGMOD 2026 收录的 KV cache + 前缀共享方向,与 SGLang RadixAttention 技术路线一致;建议精读核验与 SGLang 实现的关系
  • 标签: #KVCache #PrefixSharing #SIGMOD2026 #LLM系统

3. AlignedServe: Prefix-aware Batching(SIGMOD 2026)

  • 来源: ACM SIGMOD 2026(2026-05-18 published)
  • 可信度: ⭐⭐⭐⭐⭐
  • 核心内容: 前缀感知的 batching 调度,构建高吞吐、低计算浪费的 LLM serving 系统
  • 评价: 与 CoDec 同期 SIGMOD 论文,调度方向;值得关注
  • 标签: #LLM调度 #批处理 #SIGMOD2026

4. HotPrefix: Hotness-Aware KV Cache Scheduling(SIGMOD 2026)

  • 来源: ACM SIGMOD 2026(2026-05-18 published)
  • 可信度: ⭐⭐⭐⭐⭐
  • 核心内容: 热aware KV cache 调度,实现高效前缀共享
  • 评价: SIGMOD 2026 三篇 LLM serving 论文之一(CoDec / AlignedServe / HotPrefix),2026 年 SIGMOD 明显增加了 LLM inference systems 论文track
  • 标签: #KVCache #调度 #前缀共享 #SIGMOD2026

⚙️ 二、Backend · LLM 推理引擎与后端工程

高价值条目

5. Spheron Blog · vLLM vs TensorRT-LLM vs SGLang(H100 基准,2026)

  • 来源: https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
  • 时间: 2026 年(具体日期待核)
  • 可信度: ⭐⭐⭐⭐
  • 核心内容(H100 实测):
  • TensorRT-LLM:编译后领先所有并发级别(低并发 +8%,50 并发 +13% 领先 vLLM);缺点是需要 28 分钟编译,模型稳定时才值得
  • vLLM:启动最快,模型灵活性最高,是大多数场景的默认选择;TTFT 150-200ms,与竞品相近
  • SGLang:在共享前缀场景下 RadixAttention 提供真实收益;无共享前缀时表现与 vLLM 相近;VRAM 峰值占用最低
  • VRAM 差距 < 4 GB(80GB GPU 上 70B FP8 模型),--max-model-len 调优空间相似
  • 决策框架:
  • 能接受 28 分钟编译 + 模型稳定 → TensorRT-LLM(最优吞吐和延迟)
  • 需要快速启动 + 模型灵活性 → vLLM
  • 共享前缀工作负载 → SGLang
  • 标签: #vLLM #TensorRT-LLM #SGLang #H100 #Benchmark #推理引擎

6. vLLM 官方博客 · Keeping vLLM Production Quality(2026-07-16)

  • 来源: https://vllm.ai/blog/2026-07-16-keeping-vllm-production-quality
  • 可信度: ⭐⭐⭐⭐⭐ — vLLM 官方工程博客
  • 核心内容:
  • 2026 年 6 月:合并 1,918 commits 到 main(平均每天 64 个,与 PyTorch/Kubernetes 规模相当)
  • CI 耗用 1,300 万 job minutes,峰值 1400 并发 runner
  • 采用两周一次的发版节奏(two-week cadence,自 2025 年 11 月起)
  • 分层发版策略:main 持续 → release 分支 → 每两周正式发布
  • 500 commits 量级最适合 bisect 管理 feature 和回归追踪
  • 评价: vLLM 工程成熟度一览;对评估生产推理基础设施选型有直接参考价值
  • 标签: #vLLM #CI/CD #工程实践 #生产质量 #发版节奏

7. SGLang 最新发布(GitHub Releases,2026 年中)

  • 来源: https://github.com/sgl-project/sglang/releases
  • 可信度: ⭐⭐⭐⭐
  • 核心内容:
  • SGLang-Diffusion:实时视频生成,msgpack frame streaming,支持 FLUX / FLUX.2 / Qwen-Image / Wan 等
  • 新模型支持:Nemotron 3 Ultra、Step-3.7-Flash、Command A+(自回归);Cosmos3、ERNIE-Image、FLUX.2(扩散)
  • Disaggregated diffusion:扩散模型也支持分离式架构
  • Dynamic batching v0:自动化 batching 调优
  • ModelOpt FP8:Flux1/Flux2 和 Wan2.2 的 FP8 量化支持
  • 标签: #SGLang #Diffusion #视频生成 #DisaggregatedServing #动态批处理

8. A-RAG: Scaling Agentic RAG via Hierarchical Retrieval Interfaces(arXiv:2602.03442)

  • 来源: https://arxiv.org/abs/2602.03442
  • 时间: arXiv 2026-02,代码同步发布
  • 可信度: ⭐⭐⭐⭐⭐ — 顶会质量 arXiv 论文
  • 核心内容:
  • 现有 RAG 系统未能利用前沿 LLM 的推理和长程工具调用能力
  • 提出分层检索接口(关键词 + 语义 + 分块读取工具),用于多跳 QA
  • MIT License,HuggingFace 数据集:Zly0523/linear-rag 和 GraphRAG-Bench
  • 评价: Agentic RAG 的工程化实现框架,与之前草稿中 MemoryAgentBench、HERA 形成 2026 Agentic RAG 完整生态
  • 标签: #AgenticRAG #A-RAG #多跳QA #分层检索 #arXiv2026

☁️ 三、Cloud-Native · 云原生与 Kubernetes

高价值条目(无新增,参考上午草稿)

上午草稿 2026-07-31-engineering-database-backend-cloudnative.md 已完整覆盖: - CNCF K8s 排障实战(CrashLoopBackOff / ImagePullBackOff / OOMKilled) - eBPF 内核性能调优 - Kubernetes vs Docker Swarm 2026 选型 - PgBouncer / ProxySQL 生产配置

本次补充

9. MCP 2026-07-28 规范:无状态化核心 + 企业就绪(今日重大更新)

  • 来源:
  • 官方博客:https://blog.modelcontextprotocol.io/posts/2026-07-28
  • Substack 分析:https://trilogyai.substack.com/p/mcp-grows-up-what-the-july-28-spec
  • 迁移指南:https://www.developersdigest.tech/blog/mcp-2026-07-28-breaking-changes
  • The Register:https://www.theregister.com/devops/2026/07/23/model-context-protocol-prepares-to-break-with-its-stateful-past/5276722
  • 时间: 规范 2026-07-28 发布(今日或昨日生效)
  • 可信度: ⭐⭐⭐⭐⭐ — MCP 官方维护者署名,多源交叉验证
  • 核心内容(重大变化):
  • 无状态协议核心:MCP 从双向有状态协议变为请求/响应无状态协议。远程传输不再需要 initialize handshake 和 session;每个请求自带所有需要的信息,server instance 可以 horizontal scaling 和 serverless 部署
  • MRTR(Multi Round-Trip Requests, SEP-2322):无状态协议下工具仍可向用户请求确认/缺失参数(elicitation),server 返回 resultType: "input_required",client 重试时附加 inputResponses
  • Header-based routing:Streamable HTTP 请求必须包含 Mcp-MethodMcp-Name(SEP-2243),网关/WAF 可以直接路由和计量而无需解析 JSON body
  • List results 可缓存list_* 结果可被 gateway 缓存,减少重复调用
  • Authorization 强化:OAuth 流程更新,Enterprise-Managed Authorization (EMA) 从 extension 升级为正式地位
  • 正式 Extensions 框架:spec 的演进现在通过 extensions 实现而非大版本号
  • 正式弃用生命周期:弃用功能至少维持 12 个月兼容
  • Deprecated(移除!):Roots(文件系统边界通告)、Sampling(server 请求 client 模型生成)、Logging(协议级日志通知)
  • SDK 规模:Tier 1 SDK(TypeScript/Python)累计下载量突破 10 亿次;每月近 5 亿次下载;Remote MCP 生态现在是主要增长方向
  • 破坏性变更警告:
  • 期望 initialize 作为第一条消息的 server 需要改动
  • 基于 session header 路由的 gateway 需要改动
  • 假设 client 固定到单一 server instance 的 client 需要改动
  • Stacklok 警告:2026-07-28 服务器可能不兼容旧版 client,反之亦然
  • 评价: MCP 协议 2026 年最大更新,使其从"开发者集成惯例"进化为"企业级基础设施"。无状态化是 serverless / edge 部署的关键,使 MCP 远程服务器可真正横向扩展。今日(2026-07-31)距离规范发布仅 3 天,是最新鲜的热点。
  • 后续行动:
  • 精读:官方博客原文 + Trilogy AI Substack 分析
  • 建议写入 "MCP 协议栈 2026" 主题页
  • 通知同步任务维护者更新 MCP 相关笔记
  • 标签: #MCP #无状态协议 #企业级 #Serverless #A2A #MRTR #协议栈

10. A2A 协议:2026 年 7 月生产采用里程碑

  • 来源: Linux Foundation Press Release(2026-04-09)+ NiteAgent Blog(2026-06-07)+ Glukhov.org 分析
  • 可信度: ⭐⭐⭐⭐⭐
  • 核心内容:
  • 规模:A2A 协议获得 150+ 组织支持,Linux Foundation 治理
  • 生态:Google / Microsoft / AWS 三大云平台深度集成
  • 生产落地:多个行业已有实际生产部署(first year milestone)
  • 生产模式:A2A 协调 Agent 间通信 + MCP 连接 Agent 与工具——这是 2026 年最合理的双协议栈组合
  • 常见错误:用 A2A 替代 MCP 解决工具访问,或用 MCP 处理多 Agent 协调(职责错配)
  • 评价: MCP+A2A 双协议分工在 2026 年中期已成工程共识,是多 Agent 系统的事实标准组合
  • 标签: #A2A #MCP #多Agent #协议栈 #LinuxFoundation #生产部署

📝 四、CSDN · 中文高价值工程内容

今日已有草稿覆盖

上午草稿 2026-07-31-csdn-weekly.md 已覆盖: - July_v · vLLM/PagedAttention 图解(⭐⭐⭐⭐⭐,图解最系统) - 腾讯云 · vLLM 部署性能调优实战 - 阿里云 PAI · DeepSeek-R1 微调 - 腾讯云 · RAG 进阶优化(混合检索/Re-ranking/GraphRAG/PageIndex) - Datawhale self-llm · DeepSeek vLLM 部署 - 鲲鹏社区 · DeepSeek-R1 昇腾 NPU 部署

本次无新增 CSDN 高价值条目,上述草稿已足够覆盖本周 CSDN 质量上乘的内容。


🔬 五、Reproduction · 复现与学术追踪

高价值条目

11. MC-SF: Online Scheduling for LLM Inference with KV Cache Constraints

  • 来源: arXiv:2502.07115v5(持续更新中)
  • 机构: MIT + Microsoft Research + Amazon
  • 可信度: ⭐⭐⭐⭐⭐ — MIT CSAIL + MSR 联合论文
  • 核心内容:
  • 理论模型:LLM inference 调度问题的形式化模型,显式建模 KV cache 动态内存增长
  • 整数规划: hindsight-optimal benchmark 的 ILP 公式,证明确定性在线算法在对抗性到达下无法达到常数竞争比
  • MC-SF 算法:实际的多项式时间算法,在 prompt 到达分布满足特定结构条件时达到常数竞争比
  • 关键发现:仅需输出长度的预测 $\tilde{o}_i \geq o_i$ 即可(不需要精确值)
  • 实验:合成实验(对比 hindsight 最优)+ 大规模真实 LLM trace 仿真
  • 评价: 理论与工程结合的杰作,MIT 运筹学 + MSR Azure 系统团队联合出品;与 vLLM production blog 中提到的调度问题直接呼应;是「LLM 推理调度」主题页的理论核心
  • 标签: #LLM调度 #KVCache #在线调度 #理论 #MIT #MicrosoftResearch

12. Fluid-Guided Online Scheduling: WAIT / Nested WAIT

  • 来源: arXiv:2504.11320v4
  • 可信度: ⭐⭐⭐⭐
  • 核心内容:
  • 研究 KV cache 超容导致的 eviction-recomputation 恶性循环问题
  • fluid approximation 识别 fluid stability region 和最优内存需求 $M^*$
  • WAIT 和 Nested WAIT 算法:通过 threshold 机制降低维度
  • 实验基于 Vidur + Llama-2-7B on A100 80GB
  • vLLM 默认使用 recomputation 作为 eviction 策略
  • 评价: MC-SF 的后续/补充研究方向,共同构成 2026 年 KV cache 调度理论体系
  • 标签: #KVCache #调度 #FluidModel #Eviction #WAIT

13. PipeMax: Pipeline Parallelism + KV Cache Offloading(arXiv:2605.02189v1)

  • 来源: arXiv:2605.02189v1
  • 可信度: ⭐⭐⭐⭐
  • 核心内容:
  • commodity GPU server(8 GPUs)上的高吞吐 LLM inference
  • 将 inactive KV cache offload 到 CPU,结合 pipeline parallelism
  • 计算与 offloading 数据传输协同调度,最大化 compute-data overlap
  • 相比 SOTA 提升最高 2.51×(8 GPUs)
  • 评价: 面向中等规模 GPU 集群的实用方案,与 Mooncake 的 rack-scale 方案互补
  • 标签: #PipelineParallelism #KVCacheOffload #CommodityGPU #PipeMax

14. CXL-based KV Cache Scheduling: Memory-Disaggregated LLM Serving(INFOCOM 2026)

  • 来源: IEEE INFOCOM 2026(2026-05-18 published)
  • 可信度: ⭐⭐⭐⭐
  • 核心内容: CXL 共享内存的 rack-scale LLM serving,adaptive KV cache 调度
  • 评价: 与 Mooncake 同方向,CXL 硬件支持的实际部署方案;INFOCOM 2026 收录
  • 标签: #CXL #MemoryDisaggregation #INFOCOM2026 #KVCache

📋 分类标签汇总

#Database #KVCache #存储分离 #CXL #SIGMOD2026
#CoDec #AlignedServe #HotPrefix #Mooncake
#Backend #LLM推理 #vLLM #SGLang #TensorRT-LLM
#H100Benchmark #PagedAttention #RadixAttention
#生产工程 #CI/CD #发版节奏 #SGLang-Diffusion
#CloudNative #MCP #无状态协议 #Serverless
#MRTR #A2A #协议栈 #企业级 #MCP2026
#CSDN #vLLM部署 #PagedAttention图解 #RAG进阶
#Reproduction #LLM调度 #在线调度 #理论
#MC-SF #FluidScheduling #WAIT #PipeMax
#INFOCOM2026 #AgenticRAG #A-RAG #多跳QA

⭐ 高价值条目评分矩阵

条目 来源 可信度 工程价值 新鲜度 综合
MCP 2026-07-28 无状态规范 官方博客 ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ 🔥今日最新 ⭐⭐⭐⭐⭐
vLLM vs TensorRT-LLM vs SGLang H100 Benchmark Spheron Blog ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐
vLLM 生产质量工程(CI/发版) vLLM AI Blog ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐
Mooncake 后继:CXL-PIM KV Cache HotInfra '26 ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐
MC-SF Online Scheduling MIT+MSR ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐⭐⭐
A2A 150 组织 + 生产落地 Linux Foundation ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐
SGLang 最新 Release(含 Diffusion) GitHub ⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐
CoDec+AlignedServe+HotPrefix SIGMOD 2026 ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐
A-RAG 分层检索 arXiv 2602 ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐⭐
PipeMax Pipeline+Offloading arXiv 2605 ⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐⭐
Fluid WAIT 调度 arXiv 2504 ⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐⭐

📋 建议写入路径

草稿路径 主题 优先级 状态
/shared/research-kb/inbox/jay/2026-07-31T1105-jay-five-category-briefing.md 本次五类目简报 ✅ 已写入 本文件
/shared/research-kb/inbox/jay/2026-07-31-mcp-2026-07-28-stateless-spec.md MCP 无状态规范精读笔记 建议新建 待处理
/shared/research-kb/inbox/jay/2026-07-31-mc-sf-kvcache-scheduling.md MC-SF 在线调度论文摘要 建议新建 待处理

🔔 本次精读 / 审稿 / 主题页更新建议

操作 对象 理由
⭐⭐⭐ 精读 MCP 2026-07-28 官方博客 + Trilogy AI Substack 分析 协议重大版本,必须精确理解无状态化影响和迁移路径
⭐⭐⭐ 精读 MC-SF Online Scheduling(MIT+MSR) LLM 推理调度理论核心,工程选型理论基础
⭐⭐⭐ 精读 Spheron vLLM vs TensorRT-LLM vs SGLang H100 Benchmark 2026 年推理引擎选型必备参考
审稿 vLLM 生产质量工程博客 CI 流程和发版节奏数据适合更新「vLLM 工程实践」笔记
主题页更新 MCP 协议栈 2026(含 A2A 双协议) 有充分新鲜素材支撑
主题页更新 LLM 推理调度(增加 MC-SF / Fluid WAIT / SIGMOD 2026 三篇) 理论体系新增
主题页更新 KV Cache 存储分离(Mooncake → CXL-PIM → PipeMax) 架构演进路径清晰

Jay 实例五类目简报补编 | 2026-07-31 11:05 CST | 检索范围:Tavily / arXiv / SIGMOD / ACM / IEEE / MCP Official Blog / Linux Foundation / vLLM AI Blog