知识库简报 · Jay 五类目 · 2026-07-31 上午场补编
实例: Jay | 日期: 2026-07-31 | 时间: 11:05 CST 主题: MCP 2026-07-28 规范重大更新 · vLLM vs SGLang 2026 H100 基准 · SIGMOD 2026 推理系统论文 · Agentic RAG 新框架
📦 一、Database · 向量数据库与存储
高价值条目
1. Mooncake 之后:Memory-Centric KV Cache Server(HotInfra '26)
- 来源: hotinfra.org / HotInfra '26(ISCA '26 联合工作坊,2026-06-28)
- 链接: https://hotinfra.org/2026/papers/hotinfra26-final59.pdf
- 可信度: ⭐⭐⭐⭐⭐ — 学术工作坊论文,有完整 benchmark 数据
- 核心内容:
- 对比 GPU cluster vs CXL-PIM KV cache server(分离式架构)
- DeepSeek-R1-671B,32K tokens 生成:PIM 方案比 H100 集群吞吐高 2.4×,CapEx 降低 20.6×,OpEx 降低 16.8×,Cost/Mtokens 降低 39.7×
- 推理成本主要来自 KV cache 存储,而非计算
- Tokens/Watt:H100 集群 0.051 vs PIM 方案 1.507(29.5× 提升)
- 评价: 经济账清晰,是 KV cache 分离式架构工程可行性的重要证据;可与 Mooncake 一起构成「LLM 推理存储分离」主题页的双源引用
- 标签:
#KVCache#CXL#存储分离#Moonshot#成本优化#HotInfra2026
2. CoDec: Prefix-Shared Decoding Kernel for LLMs(SIGMOD 2026)
- 来源: ACM SIGMOD 2026(2026-05-18 published)
- 可信度: ⭐⭐⭐⭐⭐ — ACM 官方出版,顶级数据库会议
- 核心内容: 前缀共享解码内核,多请求间共享前缀时减少冗余计算
- 评价: SIGMOD 2026 收录的 KV cache + 前缀共享方向,与 SGLang RadixAttention 技术路线一致;建议精读核验与 SGLang 实现的关系
- 标签:
#KVCache#PrefixSharing#SIGMOD2026#LLM系统
3. AlignedServe: Prefix-aware Batching(SIGMOD 2026)
- 来源: ACM SIGMOD 2026(2026-05-18 published)
- 可信度: ⭐⭐⭐⭐⭐
- 核心内容: 前缀感知的 batching 调度,构建高吞吐、低计算浪费的 LLM serving 系统
- 评价: 与 CoDec 同期 SIGMOD 论文,调度方向;值得关注
- 标签:
#LLM调度#批处理#SIGMOD2026
4. HotPrefix: Hotness-Aware KV Cache Scheduling(SIGMOD 2026)
- 来源: ACM SIGMOD 2026(2026-05-18 published)
- 可信度: ⭐⭐⭐⭐⭐
- 核心内容: 热aware KV cache 调度,实现高效前缀共享
- 评价: SIGMOD 2026 三篇 LLM serving 论文之一(CoDec / AlignedServe / HotPrefix),2026 年 SIGMOD 明显增加了 LLM inference systems 论文track
- 标签:
#KVCache#调度#前缀共享#SIGMOD2026
⚙️ 二、Backend · LLM 推理引擎与后端工程
高价值条目
5. Spheron Blog · vLLM vs TensorRT-LLM vs SGLang(H100 基准,2026)
- 来源: https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
- 时间: 2026 年(具体日期待核)
- 可信度: ⭐⭐⭐⭐
- 核心内容(H100 实测):
- TensorRT-LLM:编译后领先所有并发级别(低并发 +8%,50 并发 +13% 领先 vLLM);缺点是需要 28 分钟编译,模型稳定时才值得
- vLLM:启动最快,模型灵活性最高,是大多数场景的默认选择;TTFT 150-200ms,与竞品相近
- SGLang:在共享前缀场景下 RadixAttention 提供真实收益;无共享前缀时表现与 vLLM 相近;VRAM 峰值占用最低
- VRAM 差距 < 4 GB(80GB GPU 上 70B FP8 模型),
--max-model-len调优空间相似 - 决策框架:
- 能接受 28 分钟编译 + 模型稳定 → TensorRT-LLM(最优吞吐和延迟)
- 需要快速启动 + 模型灵活性 → vLLM
- 共享前缀工作负载 → SGLang
- 标签:
#vLLM#TensorRT-LLM#SGLang#H100#Benchmark#推理引擎
6. vLLM 官方博客 · Keeping vLLM Production Quality(2026-07-16)
- 来源: https://vllm.ai/blog/2026-07-16-keeping-vllm-production-quality
- 可信度: ⭐⭐⭐⭐⭐ — vLLM 官方工程博客
- 核心内容:
- 2026 年 6 月:合并 1,918 commits 到 main(平均每天 64 个,与 PyTorch/Kubernetes 规模相当)
- CI 耗用 1,300 万 job minutes,峰值 1400 并发 runner
- 采用两周一次的发版节奏(two-week cadence,自 2025 年 11 月起)
- 分层发版策略:main 持续 → release 分支 → 每两周正式发布
- 500 commits 量级最适合 bisect 管理 feature 和回归追踪
- 评价: vLLM 工程成熟度一览;对评估生产推理基础设施选型有直接参考价值
- 标签:
#vLLM#CI/CD#工程实践#生产质量#发版节奏
7. SGLang 最新发布(GitHub Releases,2026 年中)
- 来源: https://github.com/sgl-project/sglang/releases
- 可信度: ⭐⭐⭐⭐
- 核心内容:
- SGLang-Diffusion:实时视频生成,msgpack frame streaming,支持 FLUX / FLUX.2 / Qwen-Image / Wan 等
- 新模型支持:Nemotron 3 Ultra、Step-3.7-Flash、Command A+(自回归);Cosmos3、ERNIE-Image、FLUX.2(扩散)
- Disaggregated diffusion:扩散模型也支持分离式架构
- Dynamic batching v0:自动化 batching 调优
- ModelOpt FP8:Flux1/Flux2 和 Wan2.2 的 FP8 量化支持
- 标签:
#SGLang#Diffusion#视频生成#DisaggregatedServing#动态批处理
8. A-RAG: Scaling Agentic RAG via Hierarchical Retrieval Interfaces(arXiv:2602.03442)
- 来源: https://arxiv.org/abs/2602.03442
- 时间: arXiv 2026-02,代码同步发布
- 可信度: ⭐⭐⭐⭐⭐ — 顶会质量 arXiv 论文
- 核心内容:
- 现有 RAG 系统未能利用前沿 LLM 的推理和长程工具调用能力
- 提出分层检索接口(关键词 + 语义 + 分块读取工具),用于多跳 QA
- MIT License,HuggingFace 数据集:Zly0523/linear-rag 和 GraphRAG-Bench
- 评价: Agentic RAG 的工程化实现框架,与之前草稿中 MemoryAgentBench、HERA 形成 2026 Agentic RAG 完整生态
- 标签:
#AgenticRAG#A-RAG#多跳QA#分层检索#arXiv2026
☁️ 三、Cloud-Native · 云原生与 Kubernetes
高价值条目(无新增,参考上午草稿)
上午草稿
2026-07-31-engineering-database-backend-cloudnative.md已完整覆盖: - CNCF K8s 排障实战(CrashLoopBackOff / ImagePullBackOff / OOMKilled) - eBPF 内核性能调优 - Kubernetes vs Docker Swarm 2026 选型 - PgBouncer / ProxySQL 生产配置
本次补充:
9. MCP 2026-07-28 规范:无状态化核心 + 企业就绪(今日重大更新)
- 来源:
- 官方博客:https://blog.modelcontextprotocol.io/posts/2026-07-28
- Substack 分析:https://trilogyai.substack.com/p/mcp-grows-up-what-the-july-28-spec
- 迁移指南:https://www.developersdigest.tech/blog/mcp-2026-07-28-breaking-changes
- The Register:https://www.theregister.com/devops/2026/07/23/model-context-protocol-prepares-to-break-with-its-stateful-past/5276722
- 时间: 规范 2026-07-28 发布(今日或昨日生效)
- 可信度: ⭐⭐⭐⭐⭐ — MCP 官方维护者署名,多源交叉验证
- 核心内容(重大变化):
- 无状态协议核心:MCP 从双向有状态协议变为请求/响应无状态协议。远程传输不再需要
initializehandshake 和 session;每个请求自带所有需要的信息,server instance 可以 horizontal scaling 和 serverless 部署 - MRTR(Multi Round-Trip Requests, SEP-2322):无状态协议下工具仍可向用户请求确认/缺失参数(elicitation),server 返回
resultType: "input_required",client 重试时附加inputResponses - Header-based routing:Streamable HTTP 请求必须包含
Mcp-Method和Mcp-Name(SEP-2243),网关/WAF 可以直接路由和计量而无需解析 JSON body - List results 可缓存:
list_*结果可被 gateway 缓存,减少重复调用 - Authorization 强化:OAuth 流程更新,Enterprise-Managed Authorization (EMA) 从 extension 升级为正式地位
- 正式 Extensions 框架:spec 的演进现在通过 extensions 实现而非大版本号
- 正式弃用生命周期:弃用功能至少维持 12 个月兼容
- Deprecated(移除!):Roots(文件系统边界通告)、Sampling(server 请求 client 模型生成)、Logging(协议级日志通知)
- SDK 规模:Tier 1 SDK(TypeScript/Python)累计下载量突破 10 亿次;每月近 5 亿次下载;Remote MCP 生态现在是主要增长方向
- 破坏性变更警告:
- 期望
initialize作为第一条消息的 server 需要改动 - 基于 session header 路由的 gateway 需要改动
- 假设 client 固定到单一 server instance 的 client 需要改动
- Stacklok 警告:2026-07-28 服务器可能不兼容旧版 client,反之亦然
- 评价: MCP 协议 2026 年最大更新,使其从"开发者集成惯例"进化为"企业级基础设施"。无状态化是 serverless / edge 部署的关键,使 MCP 远程服务器可真正横向扩展。今日(2026-07-31)距离规范发布仅 3 天,是最新鲜的热点。
- 后续行动:
- ⭐ 精读:官方博客原文 + Trilogy AI Substack 分析
- 建议写入 "MCP 协议栈 2026" 主题页
- 通知同步任务维护者更新 MCP 相关笔记
- 标签:
#MCP#无状态协议#企业级#Serverless#A2A#MRTR#协议栈
10. A2A 协议:2026 年 7 月生产采用里程碑
- 来源: Linux Foundation Press Release(2026-04-09)+ NiteAgent Blog(2026-06-07)+ Glukhov.org 分析
- 可信度: ⭐⭐⭐⭐⭐
- 核心内容:
- 规模:A2A 协议获得 150+ 组织支持,Linux Foundation 治理
- 生态:Google / Microsoft / AWS 三大云平台深度集成
- 生产落地:多个行业已有实际生产部署(first year milestone)
- 生产模式:A2A 协调 Agent 间通信 + MCP 连接 Agent 与工具——这是 2026 年最合理的双协议栈组合
- 常见错误:用 A2A 替代 MCP 解决工具访问,或用 MCP 处理多 Agent 协调(职责错配)
- 评价: MCP+A2A 双协议分工在 2026 年中期已成工程共识,是多 Agent 系统的事实标准组合
- 标签:
#A2A#MCP#多Agent#协议栈#LinuxFoundation#生产部署
📝 四、CSDN · 中文高价值工程内容
今日已有草稿覆盖
上午草稿
2026-07-31-csdn-weekly.md已覆盖: - July_v · vLLM/PagedAttention 图解(⭐⭐⭐⭐⭐,图解最系统) - 腾讯云 · vLLM 部署性能调优实战 - 阿里云 PAI · DeepSeek-R1 微调 - 腾讯云 · RAG 进阶优化(混合检索/Re-ranking/GraphRAG/PageIndex) - Datawhale self-llm · DeepSeek vLLM 部署 - 鲲鹏社区 · DeepSeek-R1 昇腾 NPU 部署
本次无新增 CSDN 高价值条目,上述草稿已足够覆盖本周 CSDN 质量上乘的内容。
🔬 五、Reproduction · 复现与学术追踪
高价值条目
11. MC-SF: Online Scheduling for LLM Inference with KV Cache Constraints
- 来源: arXiv:2502.07115v5(持续更新中)
- 机构: MIT + Microsoft Research + Amazon
- 可信度: ⭐⭐⭐⭐⭐ — MIT CSAIL + MSR 联合论文
- 核心内容:
- 理论模型:LLM inference 调度问题的形式化模型,显式建模 KV cache 动态内存增长
- 整数规划: hindsight-optimal benchmark 的 ILP 公式,证明确定性在线算法在对抗性到达下无法达到常数竞争比
- MC-SF 算法:实际的多项式时间算法,在 prompt 到达分布满足特定结构条件时达到常数竞争比
- 关键发现:仅需输出长度的预测 $\tilde{o}_i \geq o_i$ 即可(不需要精确值)
- 实验:合成实验(对比 hindsight 最优)+ 大规模真实 LLM trace 仿真
- 评价: 理论与工程结合的杰作,MIT 运筹学 + MSR Azure 系统团队联合出品;与 vLLM production blog 中提到的调度问题直接呼应;是「LLM 推理调度」主题页的理论核心
- 标签:
#LLM调度#KVCache#在线调度#理论#MIT#MicrosoftResearch
12. Fluid-Guided Online Scheduling: WAIT / Nested WAIT
- 来源: arXiv:2504.11320v4
- 可信度: ⭐⭐⭐⭐
- 核心内容:
- 研究 KV cache 超容导致的 eviction-recomputation 恶性循环问题
- fluid approximation 识别 fluid stability region 和最优内存需求 $M^*$
- WAIT 和 Nested WAIT 算法:通过 threshold 机制降低维度
- 实验基于 Vidur + Llama-2-7B on A100 80GB
- vLLM 默认使用 recomputation 作为 eviction 策略
- 评价: MC-SF 的后续/补充研究方向,共同构成 2026 年 KV cache 调度理论体系
- 标签:
#KVCache#调度#FluidModel#Eviction#WAIT
13. PipeMax: Pipeline Parallelism + KV Cache Offloading(arXiv:2605.02189v1)
- 来源: arXiv:2605.02189v1
- 可信度: ⭐⭐⭐⭐
- 核心内容:
- commodity GPU server(8 GPUs)上的高吞吐 LLM inference
- 将 inactive KV cache offload 到 CPU,结合 pipeline parallelism
- 计算与 offloading 数据传输协同调度,最大化 compute-data overlap
- 相比 SOTA 提升最高 2.51×(8 GPUs)
- 评价: 面向中等规模 GPU 集群的实用方案,与 Mooncake 的 rack-scale 方案互补
- 标签:
#PipelineParallelism#KVCacheOffload#CommodityGPU#PipeMax
14. CXL-based KV Cache Scheduling: Memory-Disaggregated LLM Serving(INFOCOM 2026)
- 来源: IEEE INFOCOM 2026(2026-05-18 published)
- 可信度: ⭐⭐⭐⭐
- 核心内容: CXL 共享内存的 rack-scale LLM serving,adaptive KV cache 调度
- 评价: 与 Mooncake 同方向,CXL 硬件支持的实际部署方案;INFOCOM 2026 收录
- 标签:
#CXL#MemoryDisaggregation#INFOCOM2026#KVCache
📋 分类标签汇总
#Database #KVCache #存储分离 #CXL #SIGMOD2026
#CoDec #AlignedServe #HotPrefix #Mooncake
#Backend #LLM推理 #vLLM #SGLang #TensorRT-LLM
#H100Benchmark #PagedAttention #RadixAttention
#生产工程 #CI/CD #发版节奏 #SGLang-Diffusion
#CloudNative #MCP #无状态协议 #Serverless
#MRTR #A2A #协议栈 #企业级 #MCP2026
#CSDN #vLLM部署 #PagedAttention图解 #RAG进阶
#Reproduction #LLM调度 #在线调度 #理论
#MC-SF #FluidScheduling #WAIT #PipeMax
#INFOCOM2026 #AgenticRAG #A-RAG #多跳QA
⭐ 高价值条目评分矩阵
| 条目 | 来源 | 可信度 | 工程价值 | 新鲜度 | 综合 |
|---|---|---|---|---|---|
| MCP 2026-07-28 无状态规范 | 官方博客 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | 🔥今日最新 | ⭐⭐⭐⭐⭐ |
| vLLM vs TensorRT-LLM vs SGLang H100 Benchmark | Spheron Blog | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| vLLM 生产质量工程(CI/发版) | vLLM AI Blog | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| Mooncake 后继:CXL-PIM KV Cache | HotInfra '26 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| MC-SF Online Scheduling | MIT+MSR | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| A2A 150 组织 + 生产落地 | Linux Foundation | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| SGLang 最新 Release(含 Diffusion) | GitHub | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| CoDec+AlignedServe+HotPrefix | SIGMOD 2026 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| A-RAG 分层检索 | arXiv 2602 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ |
| PipeMax Pipeline+Offloading | arXiv 2605 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ |
| Fluid WAIT 调度 | arXiv 2504 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ |
📋 建议写入路径
| 草稿路径 | 主题 | 优先级 | 状态 |
|---|---|---|---|
/shared/research-kb/inbox/jay/2026-07-31T1105-jay-five-category-briefing.md |
本次五类目简报 | ✅ 已写入 | 本文件 |
/shared/research-kb/inbox/jay/2026-07-31-mcp-2026-07-28-stateless-spec.md |
MCP 无状态规范精读笔记 | 建议新建 | 待处理 |
/shared/research-kb/inbox/jay/2026-07-31-mc-sf-kvcache-scheduling.md |
MC-SF 在线调度论文摘要 | 建议新建 | 待处理 |
🔔 本次精读 / 审稿 / 主题页更新建议
| 操作 | 对象 | 理由 |
|---|---|---|
| ⭐⭐⭐ 精读 | MCP 2026-07-28 官方博客 + Trilogy AI Substack 分析 | 协议重大版本,必须精确理解无状态化影响和迁移路径 |
| ⭐⭐⭐ 精读 | MC-SF Online Scheduling(MIT+MSR) | LLM 推理调度理论核心,工程选型理论基础 |
| ⭐⭐⭐ 精读 | Spheron vLLM vs TensorRT-LLM vs SGLang H100 Benchmark | 2026 年推理引擎选型必备参考 |
| 审稿 | vLLM 生产质量工程博客 | CI 流程和发版节奏数据适合更新「vLLM 工程实践」笔记 |
| 主题页更新 | MCP 协议栈 2026(含 A2A 双协议) | 有充分新鲜素材支撑 |
| 主题页更新 | LLM 推理调度(增加 MC-SF / Fluid WAIT / SIGMOD 2026 三篇) | 理论体系新增 |
| 主题页更新 | KV Cache 存储分离(Mooncake → CXL-PIM → PipeMax) | 架构演进路径清晰 |
Jay 实例五类目简报补编 | 2026-07-31 11:05 CST | 检索范围:Tavily / arXiv / SIGMOD / ACM / IEEE / MCP Official Blog / Linux Foundation / vLLM AI Blog