研究简报 · Jay · 2026-07-10 上午
主题
RAG/Agent 系统架构 · KV Cache 优化 · Vector DB 生产对比 · LLM Inference Engine 选型
检索范围
- Tavily Web Search: RAG 2026 architecture, KV cache optimization arXiv, Vector DB comparison 2026, vLLM SGLang 2026, CockroachDB TiDB distributed SQL, Substack AI research newsletters
- 信息源:arXiv、MIT/微软联合论文、TuringPost、FutureAGI、Substack (Nathan Benaich, Cobus Greyling, Sebastian Raschka)、PkgPulse、Kalvium Labs、Devstarsj
📦 Database
[1] pgvector vs Qdrant vs Weaviate: Vector DB 2026 生产对比
来源: PkgPulse (pkgpulse.com)
可信度: 高 — 生产经验驱动,benchmark 数据有来源标注
链接: https://www.pkgpulse.com/guides/pgvector-vs-qdrant-vs-weaviate-vector-databases-2026
摘要:
2026年采用模式已趋稳定:团队从 pgvector 起步(<10M 向量),达到性能上限后迁移 Qdrant。关键变化:
- pgvector 0.7+ 已支持 HNSW,不再是"慢速选项",<500K-2M 向量场景完全够用
- Qdrant (~22k GitHub stars) 在 1M+ 向量时亚毫秒查询,是增长最快的独立向量 DB
- Weaviate 多模态内置向量化,混合搜索开箱即用,但运维复杂度较高
- 所有三款均支持 HNSW 算法
评价: 务实选型指南,decision matrix 清晰。适合作为团队 Vector DB 选型的第一份参考。
标签: vector-database pgvector Qdrant Weaviate RAG production
[2] pgvector vs Pinecone vs Qdrant vs Weaviate (2026) — 决策矩阵
来源: Kalvium Labs
可信度: 高 — 覆盖 4 款主流 DB,附场景化决策表
链接: https://www.kalviumlabs.ai/blog/vector-databases-compared-pgvector-pinecone-qdrant-weaviate
摘要:
多租户支持对比:pgvector 用行级安全、Pinecone 用 namespace、Qdrant 用 payload filter、Weaviate 用原生多租户模型。
| 考虑因素 | 推荐选项 |
|---|---|
| 已用 Postgres,<500万向量 | pgvector |
| 零运维,任意规模 | Pinecone |
| 开源自托管,强性能 | Qdrant |
| 内置向量化+混合搜索 | Weaviate |
| 十亿级向量,企业级 | Milvus |
| 原型/本地开发 | Chroma |
| 嵌入式/本地优先/边缘 | LanceDB |
评价: 决策矩阵实用,Chroma 和 LanceDB 的定位值得注意(不是主要竞品,是不同场景的补充)。
标签: vector-database decision-matrix multi-tenancy pgvector Pinecone
[3] CockroachDB SIGMOD 2026: Scalable Leader Leases
来源: CockroachDB 官方博客
可信度: 高 — 官方工程论文,即将发表于 SIGMOD 2026
链接: https://www.cockroachlabs.com/blog/scalable-leader-leases
摘要:
论文聚焦分布式 SQL 中 lease maintenance 的 CPU 开销问题,提出 Scalable Leader Leases 机制,可将 lease 维护 CPU 降低 85%。核心贡献:
- 多共识组场景下去中心化 lease 分配
- 减少 leaseholder 热点,提升多 region 场景扩展性
可信度判断: 工业界顶会论文,可信度高。需跟进 SIGMOD 2026 正式出版。
建议后续行动: 等待 ACM Digital Library 正式论文,对比同场其他 SIGMOD 分布式系统工作。
标签: distributed-sql CockroachDB SIGMOD2026 consensus multi-region
[4] CockroachDB vs TiDB vs YugabyteDB: 2026 分布式 SQL 对比
来源: sanj.dev
可信度: 中 — 综合对比,有实战经验,但非系统性 benchmark
链接: https://sanj.dev/post/distributed-sql-databases-comparison
摘要:
三款分布式 SQL 核心差异:
- CockroachDB:Go 实现,紧耦合架构,Postgres 兼容,K8s operator 最成熟,Serializable 隔离
- TiDB:计算存储分离(TiDB Server + TiKV),MySQL 兼容,HTAP 原生支持,运维复杂度较高
- YugabyteDB:Per-query 隔离级别灵活,Postgres/MySQL 双兼容,多 region 部署灵活
警示: "不要因为 Hacker News 上的 benchmark 好看就选分布式 SQL。如果单机能跑,RDS 会更快、更便宜、更简单。"
标签: distributed-sql CockroachDB TiDB YugabyteDB architecture
⚙️ Backend / Inference
[5] KV Cache Optimization Strategies for Scalable LLM Inference
来源: arXiv (cs.LG) — Dell Technologies, 2026-03-24
可信度: 高 — 学术预印本,Dell 工程团队出品
链接: https://arxiv.org/abs/2603.20397
摘要:
系统化梳理 KV cache 优化策略,聚焦长上下文(1000K+ tokens)和高吞吐场景下的 GPU memory footprint 问题。覆盖:
- KV cache 量化(int8 vs fp16,2× 内存节省)
- Page attention(vLLM 核心创新,类虚拟内存管理)
- Continuous batching(动态批处理)
- Prefix caching(共享前缀复用)
- 驱逐策略(eviction policies)
核心公式: Llama 70B, 80 layers, 64 heads, 128 head dim, batch=32, seq=2048, fp16 → 206 GB KV memory
评价: Dell 团队的系统化梳理,适合作为 KV cache 优化技术的复习/入门框架。
标签: KV-cache LLM-inference optimization arXiv vLLM
[6] ScoutAttention: KV Cache Offloading via Layer-Ahead CPU Pre-computation (DAC 2026)
来源: arXiv — Accepted at DAC 2026
可信度: 高 — 已接收顶会,代码+论文双公开
链接: https://arxiv.org/abs/2603.27138
摘要:
针对 KV cache GPU 内存瓶颈,提出 CPU 预计算+分层卸载方案,减少 GPU 显存占用的同时维持推理延迟可控。
建议后续行动: 关注 DAC 2026 演示,如与 vLLM/SGLang 现有 offload 策略对比有优势,可补充进 inference engineering skill。
标签: KV-cache offloading DAC2026 inference-optimization
[7] Online Scheduling for LLM Inference with KV Cache Constraints
来源: MIT + Microsoft Research, arXiv:2502.07115v5
可信度: 高 — 学术+工业联合,MIT ORC + 微软研究院
链接: https://arxiv.org/html/2504.11320v4
摘要:
将 LLM inference 建模为在线调度问题,核心挑战是 KV cache 约束下的延迟最小化和资源利用率优化。提出新 batching+调度算法,理论基础扎实。
评价: 偏理论,实际系统调度参考价值需结合 vLLM 实际 eviction policy 理解。适合做 inference scheduler 设计的延伸阅读。
标签: scheduling KV-cache LLM-inference Microsoft-Research theory
[8] vLLM vs SGLang 2026: H100 Benchmarks — 完整选型指南
来源: 多源综合 — Local AI Master、Yotta Labs、Spheron、TECHSY
可信度: 高 — 均有真实 H100 benchmark 数据
关键数据(Llama 3.1 8B, H100): | 指标 | SGLang | vLLM | 差异 | |---|---|---|---| | 吞吐 | 16,215 tok/s | 12,553 tok/s | SGLang +29% | | Output 吞吐 | 893.82 tok/s | 412.99 tok/s | SGLang +116% | | TTFT | 79.42 ms | 102.65 ms | SGLang 更快 | | ITL | 6.03 ms | 7.14 ms | SGLang 更快 |
核心差异: - SGLang:RadixAttention(自动前缀复用),多轮对话+10% boost,TTFT 更低,结构化输出更好 - vLLM:硬件支持最广(NVIDIA/AMD/Intel/Trainium/TPU),生态最成熟,prefix caching 需手动开启 - TensorRT-LLM:吞吐量最高(2100 tok/s),但冷启动 28 分钟,不适合需要灵活切换模型的场景
决策建议: - 共享前缀(RAG pipelines、多轮对话)→ SGLang - 通用生产、跨硬件 → vLLM - 固定模型、超高吞吐 → TensorRT-LLM
标签: vLLM SGLang TensorRT-LLM inference-engine benchmark H100
🤖 RAG / Agent Systems
[9] 20 Advanced RAG Types to Know in 2026
来源: TuringPost
可信度: 中 — 技术梳理,非一手研究
链接: https://www.turingpost.com/p/ragtypes
摘要: 2026 RAG 进化路线图: 1. Agentic RAG — 多步决策,LLM 控制检索策略 2. GraphRAG — 知识图谱关系推理 3. Hybrid RAG — BM25 + dense embedding 混合 4. Corrective RAG (CRAG) — 检索结果自动校验 5. Multimodal RAG — 图像+表格+文本联合检索 6. FD-RAG (Federated) — 边缘/隐私合规场景
Anthropic contextual retrieval trick: 每个 chunk 前缀加上父文档的一句话摘要,检索提升 35-50%。
Chunk size 默认值: 512-1024 tokens,50-100 tokens overlap,再用语义 re-chunker 优化。
标签: RAG agentic-RAG GraphRAG multimodal chunking
[10] The AI Agent Reality Gap
来源: Cobus Greyling Substack
可信度: 中 — 行业观察,有实战洞察
链接: https://cobusgreyling.substack.com/p/the-ai-agent-reality-gap
摘要:
"真正投产的 agent 受限、受 prompt 驱动、定制化构建、有人类监督、手动评估……与大会展示的完全相反——但这些才是在赚钱的。"
核心观察:
- 真正落地的 agent 是 constrained + prompted + custom-built + human-supervised
- 大会celebrated 的 autonomous agent 拿了掌声但难落地
- 落地 agent 关键词:evaluations matter more than architectures
评价: 有价值的行业现实认知,对 hype 有降温作用。适合作为 agent 架构决策的反面参考。
标签: AI-agent production hype Substack
[11] State of AI: February–April 2026 Newsletters
来源: Nathan Benaich Substack
可信度: 高 — AI 投资+研究交叉 newsletter,质量稳定
链接: https://nathanbenaich.substack.com/p/state-of-ai-february-2026-newsletter
补充: https://nathanbenaich.substack.com/p/state-of-ai-april-2026-newsletter
摘要:
值得记录的关键事件:
- AMIE (Google):Cardiology RCT,AI 辅助诊断 vs 普通医生,专家优选 AI 方案 46.7% vs 32.7%,临床错误率从 24.3% 降至 13.1%
- Meta-Harness 论文:固定模型换 harness 可产生 6× 性能差距;自动化 harness 工程 → 4.7 points 提升(IMO 数学)
- TTT-Discover:Test-time RL,单测试问题单次学习,用于自动化科学发现
- 资金事件:ElevenLabs $500M ($11B valuation)、Legora $550M ($5.55B valuation)
标签: Substack AI-research Nathan-Benaich funding medical-AI
[12] The 2026 AI Agent Stack (Brain Bytes)
来源: codingwithroby Substack
可信度: 中 — 生态梳理,信息量大
链接: https://codingwithrobi.substack.com/p/the-2026-ai-agent-stack-drawn-from
摘要:
Model Routing 模式:分类用小模型 → 推理用前沿模型 → embedding/eval 用专用模型。RouteLLM 研究表明 routing 可大幅降低成本同时保持质量。
Memory 工具链: - Mem0:State of AI Agent Memory 2026 - Letta(MemGPT 合并):$10M seed - Zep:新 SOTA agent memory
框架格局(2026): - LangGraph 1.0 GA - Claude Agent SDK - Google ADK - CrewAI / AutoGen(多 agent 协作)
标签: Substack AI-agent-stack model-routing memory LangGraph
📄 精读建议
| 优先级 | 条目 | 理由 |
|---|---|---|
| ⭐⭐⭐ | [5] KV Cache Optimization Strategies (arXiv) | 系统化框架,适合作为 inference engineering skill 基础 |
| ⭐⭐⭐ | [8] vLLM vs SGLang benchmark 汇总 | 生产选型直接参考 |
| ⭐⭐ | [3] CockroachDB SIGMOD 2026 | 等待正式论文 |
| ⭐⭐ | [9] 20 Advanced RAG Types | RAG paradigm 梳理 |
| ⭐ | [11] Nathan Benaich newsletter | 关注 AMIE 和 Meta-Harness 进展 |
| ⭐ | [10] AI Agent Reality Gap | 反 hype 视角,有参考价值 |
分类标签汇总
vector-database pgvector Qdrant Weaviate distributed-sql CockroachDB TiDB KV-cache LLM-inference vLLM SGLang TensorRT-LLM RAG agentic-RAG GraphRAG Substack arXiv SIGMOD2026 DAC2026
建议写入路径
/shared/research-kb/inbox/jay/2026-07-10-1105-morning-briefing-database-backend-cloudnative-inference.md
后续行动
- 本简报写入草稿目录 ✅
- CockroachDB SIGMOD 2026 论文正式出版后跟进
- ScoutAttention 与 vLLM offload 策略对比值得单独梳理
- Meta-Harness 论文(harness engineering 6x 性能差距)建议精读原文
Jay · 2026-07-10 11:05 CST · Tavily web search · 未执行 git 操作