Jay · 简报 · 2026-08-23 11:05 (UTC+8)
主题:推理引擎格局固化 · KV Cache 架构分层 · 向量数据库生产选型
📂 database · 向量数据库
C2KV: KDD 2026 压缩可组合 KV 缓存复用
- 来源: arXiv · Paper ID 2607.17715 · ACM SIGKDD 2026 (2026-08-09~13, 济州岛)
- 核心: C²KV 通过在 token 流中插入可学习的
C²Tokens辅助序列实现 KV 缓存压缩,支持 4:1~16:1 压缩比,无需重新计算即可在推理时复用压缩后的 KV 块。解决了自注意力顺序依赖导致的跨请求 KV 块复用难题。 - 可信度: ⭐⭐⭐⭐ 顶会 KDD 2026,有完整 arXiv ID,可核验源码
- 行动: 关注与 PagedAttention/RadixAttention 的互补性——两者不是竞争关系,可叠加
HotInfra '26: Memory-Centric KV Cache 服务架构
- 来源: HotInfra '26 (2026-06-28, Raleigh NC) · arXiv 关联论文
- 核心: 对比传统 HBM 方案 vs. PIM-DIMM CXL 内存池方案。DeepSeek-R1-671B 测试中,PIM 方案实现 2.4× 吞吐提升(679→1607 tok/s),CapEx 降低 20.6×($570K→$27K),OpEx 降低 16.8×,每 token 成本降低 39.7×($24.24→$0.61)。解码密集型推理(RAG、多轮对话)场景下 GPU 计算资源闲置而 HBM 带宽饱和,CXL 内存池可解耦计算与存储。
- 可信度: ⭐⭐⭐⭐ 有具体硬件配置和定价数据,与 Mooncake 论文同源
- 行动: 适合长上下文、多轮、生产级 RAG 场景;值得在架构评估中与现有 Mooncake/llm-d 方案对比
向量数据库 2026 格局(综合多源)
| DB | p50 延迟 | p99 延迟 | 规模 | 适合场景 |
|---|---|---|---|---|
| Qdrant | 4ms | 25ms | ~10M向量 | 高性能开源首选,Rust 实现 |
| Milvus | 6ms | 35ms | >50M 可扩展 | 工业级分布式 |
| pgvector | 18ms | 90ms | ~5M (pgvectorscale 可至 50M+) | Postgres 团队首选 |
| pgvectorscale | 极低 | 28ms (99% recall) | 50M+ | DiskANN+SBQ,Postgres 生态 |
| - 选型原则: 70% 的 AI Agent 工作负载用 pgvector 即可;超过 10M 向量且需要超低 p99 延迟时切换到 Qdrant | ||||
| - 来源: Salt Technologies AI 2026 benchmark, DigitalApplied, Kunal Ganglani, F22 Labs |
⚙️ backend · 推理引擎
SGLang vs vLLM 2026 格局固化(综合多源)
| 维度 | SGLang 优势 | vLLM 优势 |
|---|---|---|
| 吞吐(prefix-heavy) | +29% (16,200 vs 12,500 tok/s on H100) | 持平(unique prompt) |
| 延迟 TTFT | prefix 下 p50 低 37%,p99 低 41% | 略高 |
| DeepSeek 模型 | 3.1× 更快(MLA 优化) | 通用 |
| 硬件覆盖 | 主要 NVIDIA,AMD 扩展中 | NVIDIA+AMD+TPU+Trainium+Gaudi+Arm |
| 生态 | 较小,但增长快 | 最大(3× 贡献者数量) |
| 生产就绪 | 中 | 高 |
| Prefill-Decode 分离 | SGLang 已实现 | 原生支持 |
关键结论(2026-08): - SGLang 的 RadixAttention 在共享前缀场景(多轮对话、RAG、Agent 工作流)中有结构性优势 - vLLM 的 PagedAttention 仍是通用场景标准解 - DeepSeek 全家桶 → SGLang;TPU/Trainium/AMD → vLLM;H100 + 多硬件 → 按场景分治 - 来源:Atomic.chat, Particula.tech, Spheron (Aug 19 2026), LeetLLM, Deploybase.ai, Lyceum Technology
Modular: The Five Eras of KVCache
- 来源: Modular 官方博客 · 2026-08 近期更新
- 核心: 将 KVCache 技术演进划分为五个时代,系统梳理了从最早的无缓存,到 PagedAttention(vLLM),到 RadixAttention(SGLang),到跨节点 disaggregation(Mooncake/llm-d),到压缩/量化方案的演进路径。
- 可信度: ⭐⭐⭐⭐⭐ Modular 是 Mojo/MAX 团队,一线工程视角
- 行动: 可作为内部 KVCache 技术定位的权威参考框架
Agent Memory Below the Prompt (arXiv 2603.04428)
- 来源: arXiv:2603.04428 · Q4 KV Cache for Multi-Agent Edge Inference
- 核心: 持久化 Q4 压缩 KV Cache,支持边缘设备上的多 Agent LLM 推理,无需将历史上下文放入 prompt,减少 token 消耗和延迟
- 可信度: ⭐⭐⭐ 有开源实现
- 行动: 关注在端侧/移动部署场景的可行性
☸️ cloud-native · 云原生
llm-d 进入 CNCF Sandbox(2026-03-24 贡献)
- 来源: CNCF 官方 · Cloud Native Now (Aug 11 2026)
- 核心: llm-d 是 Kubernetes 原生的 prefill/decode 分离推理框架,由 IBM/Red Hat/CoreWeave/NVIDIA 联合支持。使用标准 Kubernetes CRD 和 Gateway API Inference Extension 实现 disaggregated inference。
- 四大组件: 调度器、Gateway、Prefill Workers、Decode Workers;NIXL 处理点对点 KV 传输,无需固定 NCCL ranks
- 与 Dynamo 对比: llm-d = Kubernetes 原生 + CNCF 治理;Dynamo = NVIDIA 专有 DGX 方案
- 可信度: ⭐⭐⭐⭐⭐ CNCF Sandbox,NVIDIA/Red Hat/Google 背书
- 行动: 已在生产 Kubernetes 跑 vLLM 的团队值得评估;参考 Spheron 的完整部署指南
CNCF KubeCon EU 2026 AI 推理相关动态
- 来源: Cloud Native Now · 2026-08-11
- 重点: CNCF 明确将 AI 推理 workload 纳入核心云原生工作范围,llm-d 框架扩展了 vLLM;PyTorch Foundation 专注模型构建;AICR / KAR / KRO 项目更新
- CNCF AI Conformance Program 持续推进 Kubernetes AI 符合性认证
- 可信度: ⭐⭐⭐⭐ 官方报道
CNCF 博客: 在 Kubernetes 中自托管 LLM(vLLM)
- 来源: CNCF.io 官方博客 · 2026-07-16 · 作者 Matt Kereczman (LINBIT)
- 核心: 生产级 K8s + vLLM 部署实操指南,涉及 Piraeus Datastore(CSI driver)和 llm-d 扩展
- 可信度: ⭐⭐⭐⭐ CNCF 官方渠道,Linux 存储生态背景
- 行动: 适合作为团队内部 runbook 基础
Cloud Native LLM Inference Serving (arXiv 2507.18007)
- 来源: arXiv · 2025-07
- 核心: 云原生架构下 LLM 推理服务的综述,对比了传统 monolithic 静态资源分配 vs. microservices 动态调度;提出基于 K8s autoscaling 的实操方案
- 可信度: ⭐⭐⭐ 学术综述,需核验具体 benchmark 数据时效性
📝 csdn · CSDN 精选
本轮检索说明: 本次 Tavily 搜索结果中英文技术内容占主导,CSDN 相关高价值内容检索结果有限。已参考昨日(Aug 22)归档的 2026-08-22T1220-jay-csdn-rag-tensorrt-sourcecode-highvalue.md 和 2026-08-23-csdn-llm-inference-rag.md。
CSDN 筛选原则(按任务规则): 仅收录有版本、环境、命令、源码分析、复现过程或真实排障经验的高价值文章。
如需精筛 CSDN,建议:
1. 搜索关键词:site:csdn.net vLLM 源码分析、site:csdn.net SGLang 部署、site:csdn.net RAG 实战 2026
2. 参考昨日已归档的 2026-08-22T1220-jay-csdn-rag-tensorrt-sourcecode-highvalue.md 中的 CSDN 来源模式
🔬 reproduction · 可复现研究
Agentic RAG 路线图(arXiv 2501.09136 后续)
- 来源: 多个 2026 年 7 月 arXiv 论文综合
- 候选条目:
ECHO(arXiv 2026.06): 稀疏 turn memory + agentic RL 剪枝ReGRPO(arXiv 2026.06): Reflection-Augmented Policy Optimization for Tool-Using AgentsProMSA(arXiv 2026.06): Progressive Multimodal Search Agents for Knowledge-Based VQAAgentKGV(arXiv 2026.07): Agentic LLM-RAG + Two-Stage Training for Knowledge Graph Fact VerificationMulti-Turn Agentic Scientific Literature Search via Workflow Induction(arXiv 2026.07)Self-Correcting Long-Horizon Search Agents via Tree-Structured Memory(arXiv 2026.08)EviGraph(arXiv 2026.08): Evidence-Guided Autonomous Research AgentsA Two-Tier Perspective on Inference-Time Parallelism in Multi-Agent LLM Systems(arXiv 2026.08)FinanceHarness(arXiv 2026.07): Autonomous Financial Deep Research Framework- 可信度: ⭐⭐⭐⭐ 均为 2026 年 arXiv,有完整 Paper ID
- 精选建议: 优先关注
Self-Correcting Search Agents和EviGraph,涉及 Memory + Agent 研究前沿
Awesome-Search-Agent-Papers 仓库(持续更新)
- 来源: GitHub YunjiaXi/Awesome-Search-Agent-Papers
- 收录范围: 2026.6~8 月最新 agent search 论文,覆盖 CIGPO、PATS、Agent-UCT、Reason Before You Retrieve 等
多 Agent 系统 ICLR 2026 教训总结
- 来源: LLMs Research Substack · podcast/article
- 核心洞察:
- Speculative Actions: 用小模型预测后续 action,实现并行 API 调用,在电商/搜索/OS 环境下提速 30%
- ROTE (Roleplay Others' Thoughts as Code): 将 Agent 行为建模为可执行脚本,提升 50% 分布外泛化能力,提供行为可解释窗口
- 核心问题: 多 Agent 在生产中面临延迟、token 成本、错误级联、可观测性不足等问题
分类标签
#inference-engine #vllm #sglang #kv-cache #vector-db #qdrant #pgvector #cloud-native #kubernetes #llm-d #cncf #agentic-rag #arxiv #kdd2026 #multimodal #disaggregated-inference
建议写入路径
/shared/research-kb/inbox/jay/2026-08-23T1105-jay-five-category-briefing.md
后续行动
- 精读: C²KV (KDD 2026) 和 llm-d CNCF 部署指南——两者分别代表推理优化和云原生的最新进展
- 核验: HotInfra '26 内存中心架构的具体 CapEx 数据,需对照 Mooncake 官方数据
- CSDN 补充: 建议单独发起一次有针对性 CSDN 搜索,关键词聚焦 vLLM 0.27.x 源码 / SGLang 部署排障
- 主题页更新候选: KV Cache 演进(Five Eras)、llm-d CNCF 路线图、SGLang vs vLLM 选型决策树
Jay · 2026-08-23T11:05 · UTC+8 · 不执行 Git 写入,仅输出草稿