研究简报 · Jay · 2026-07-10 下午

主题

向量数据库格局重塑(pgvector 崛起)· KV Cache 淘汰策略研究前沿 · llm-d CNCF Sandbox · 多智能体编排 2026 · RSS 精选

检索范围

  • Tavily: pgvector vs Qdrant vs Pinecone 50M benchmark、VLDB arXiv HNSW、KV cache eviction policies 2026、llm-d CNCF Sandbox、Substack multi-agent orchestration 2026、RSS ByteByteGo / Cool Papers / Nathan Benaich / Simon Willison

🗄️ Database · 向量数据库

[1] pgvector 50M 向量 benchmark——Postgres 碾压专用向量库 11x(Towards AI)

来源: https://pub.towardsai.net/i-benchmarked-pgvector-vs-qdrant-vs-pinecone-on-50m-vectors-postgres-crushed-the-dedicated-dbs-by-20aa6dcdf132
可信度: 高——独立工程师实测,含完整 benchmark 方法论、QPS 数据、定价对比
类型: 技术 benchmark / 选型指南

摘要:
Chew Loong Nian 对 5000 万向量规模做了严格对比测试,结果令人意外:

引擎 QPS(50M 向量) 备注
PostgreSQL + pgvector 基准 × 1(原生) 已含索引开销
Qdrant(专用 Rust 向量引擎) 低于 Postgres 约 11.5x 独立部署
Pinecone(托管服务) 显著更差 含网络 + 平台开销

关键发现: - Postgres 在 <1亿向量规模下完胜专用向量数据库 - Qdrant 在超大规模场景有优势,但 QPS 指标会掩盖其真正的检索质量优势 - pgvector + pgvectorscale 扩展组合可降低 16x 延迟,提升 28x 吞吐量(对比 Pinecone)

评价: 这篇 benchmark 最有价值的是它揭示了"向量数据库"品类的过度营销——对于大多数团队,把 pgvector 当作第一选择、把专用向量库留到 10 亿+规模才是正确的工程判断。

标签: Vector-DB pgvector Qdrant Pinecone Benchmark RAG
建议路径: docs/vector-db/pgvector-vs-pure-vector-2026/
行动建议: 存档,需更新知识库向量数据库选型决策树


[2] HNSW-Merger:高效合并 HNSW 索引(SIGMOD 2026,Purdue)

来源: https://cs.purdue.edu/homes/csjgwang/pubs/SIGMOD26_HNSWMerger.pdf
可信度: 高——SIGMOD 2026 论文,来自 Purdue
链接: https://arxiv.org/abs/?(如需精读)
类型: 学术论文(系统方向)

摘要:
向量数据库中的索引合并(index merging)是一个长期被忽视的操作——当需要合并两个 HNSW 索引(如分区合并、历史数据整合、增量构建)时,业界没有标准方案。HNSW-Merger 提出两阶段、基于搜索的合并算法:

  1. 前向 HNSW 搜索:利用已有索引的 proximity 信息指导合并路径
  2. 延迟反向直连(lazy backward direct-connect):高效建立跨索引边连接

实验结果: - 合并速度显著快于 prior approaches - 索引质量(recall)持平或更高 - 适用于 pgvector / Qdrant / Milvus 等多种 HNSW 实现

评价: 这篇论文解决了一个真实的工程痛点——分区向量数据库在负载均衡时需要合并索引,HNSW-Merger 直接降低这一操作的计算成本。对向量数据库内核开发者高度相关。

标签: Vector-DB HNSW SIGMOD2026 Index-Optimization pgvector
建议路径: docs/vector-db/hnsw-merger-sigmod2026/
行动建议: 精读——涉及向量数据库内核,收藏价值高


[3] RetroInfer:面向长上下文 LLM 推理的向量存储引擎(VLDB 2026)

来源: https://www.vldb.org/pvldb/vol19/p1016-lu.pdf
可信度: 高——VLDB 2026 正式论文
类型: 学术论文(系统方向)

摘要:
RetroInfer 重新思考 KV Cache 的存储方式:不是把所有 KV 对保留在 GPU 显存,而是将稀疏 KV 对卸载到 CPU 内存,通过"wave index"(注意力感知的向量索引)+ "wave buffer"(异构内存运行时控制平面)协同工作。

核心技术贡献: - Wave Index:注意力稀疏性感知,将重要 KV 对优先保留在 GPU - Wave Buffer:异构内存管理运行时,支持 GPU/CPU/PCIe 多级存储层次 - RetroInfer GPU 实测:312 TFLOPS,80GB 带宽,2TB/s 传输

关键数字: 仅用 10% 的 retrieved tokens 即可达到 Full Attention 相当的 accuracy

评价: 这是 KV Cache 管理从"保留策略"到"存储引擎"思路的转变,代表了 2026 年 VLDB 在 LLM 存储系统方向的前沿。对设计生产级长上下文 RAG 系统有直接参考价值。

标签: LLM-Inference KV-Cache Vector-DB VLDB2026 Storage-Engine Long-Context
建议路径: docs/inference/retroinfer-vldb2026/
行动建议: 精读——长上下文 LLM 部署团队必读


[4] 向量数据库综合调查(arXiv cs.DB 2026 更新版)

来源: https://arxiv.org/pdf/2310.11703(v4,2026-03 更新)
可信度: 高——arXiv survey,cs.DB 领域高引用
类型: 学术综述

摘要(更新部分):
最新 v4 版本覆盖了 2025-2026 年向量数据库领域的完整技术栈:

  • 存储技术:分片(sharding)、分区(partitioning)、缓存策略(FIFO/LRU/LFU)、复制(Leader-Follower/Multi-Leader)
  • 搜索技术:HNSW、IVF、Product Quantization、LSH、图搜索理论
  • LLM × VDB 协同:RAG Memory 模式、向量数据库用于 DB 管理任务(Query 生成 / 索引推荐)
  • 2026 年新格局:Pinecone 市占 70% 领先托管赛道,Rust 原生 Qdrant 开源基准最强,pgvector 进入所有 PostgreSQL 部署,Weaviate 主打混合搜索

评价: 这是向量数据库领域最完整的参考 survey,v4 更新反映了 2026 年市场格局变化。可作为知识库向量数据库主题页的核心参考文献。

标签: Vector-DB Survey HNSW RAG LLM arXiv
建议路径: docs/vector-db/comprehensive-survey-2026/
行动建议: 存档,更新知识库向量数据库主题页


⚙️ Backend · LLM 推理 & KV Cache

[5] KV Cache 淘汰策略 2026 综述:五篇关键论文对比

来源: Tavily 聚合检索(Apple ML / arXiv / ACL Findings / NeurIPS / GoPenAI)
可信度: 高——多篇顶会论文 + Apple ML Research
类型: 技术综述

五篇核心论文:

[5a] KV Policy(KVP):强化学习驱动的 KV 淘汰(Apple ML Research)

来源: https://machinelearning.apple.com/research/evict | https://arxiv.org/html/2602.10238v1
核心思路: 把 KV Cache 淘汰建模为 RL 问题——每个 attention head 是一个轻量 agent,学习"预测 token 未来效用"来决定保留哪些 KV 对
突破点: 不依赖启发式(recency/attention score),而是学习预测 token 对未来解码的贡献
可信度: 高——Apple ML Research 官方发布,含预训练实验

[5b] LaProx:Output-Aware 层间矩阵近似淘汰策略(arXiv 2605.07234)

来源: https://arxiv.org/html/2605.07234
核心思路: 传统方法在 head 层面独立做淘汰,LaProx 把淘汰重新建模为"output-aware, layer-wise matrix multiplication approximation"问题
突破点: 提出首个全局重要度评分(globally comparable importance score),实现跨层统一淘汰决策
数字: 5% KV Cache 保持完整性能(LongBench + Needle-In-A-Haystack 19 个数据集)

[5c] PagedEviction:结构化块级 KV Cache 淘汰(ACL Findings 2026)

来源: https://aclanthology.org/2026.findings-eacl.168.pdf
核心思路: 与 vLLM PagedAttention 对齐的 block-wise 淘汰策略——按 vLLM 内存页对齐淘汰粒度,而非 token 级别
突破点: 解决了跨 vLLM page 淘汰时内存碎片问题
测试模型: Llama-3.1-8B / 3.2-1B / 3.2-3B Instruct
数字: LongBench 上精度接近 full cache,内存占用大幅降低

[5d] IndexMem:带 Latent Memory 的可学习 KV 淘汰(arXiv 2605.25475v2)

来源: https://arxiv.org/html/2605.25475v2
核心思路: 用轻量 latent memory 模块压缩被淘汰的 KV 对,提供 residual readout 补偿精度损失
突破点: RULER 4K/16K 上最高提升 25 个点,Needle-in-a-Haystack 稳定性显著提升
跨模型: Qwen / Mistral / Llama 均有效

[5e] AnDPro:锚方向投影精确淘汰(NeurIPS 2025)

来源: https://neurips.cc/virtual/2025/poster/117838
核心思路: 在 value 向量空间中对 pre-eviction output 方向做投影,量化 token 重要度
数字: 仅用 3.44% KV Cache 保留 96.07% 精度,KV Cache 减少 46%(对比 SOTA)

工程评价(综合):
KV Cache 淘汰策略已经从"内存不够就丢"演进到"选择性保留对最终输出贡献最大的 token"阶段。Apple KVP 和 LaProx 代表了两个方向:RL learned policy vs 理论驱动的矩阵近似。生产系统应关注 PagedEviction(vLLM 原生兼容)和 IndexMem(latent memory 思路可与 prefix caching 结合)。

标签: KV-Cache LLM-Inference RL Memory-Management arXiv Apple-ML
建议路径: docs/inference/kv-cache-eviction-2026/
行动建议: 精读 5a + 5c(Apple ML + PagedEviction),生产落地性最强


[6] llm-d 进入 CNCF Sandbox(2026-03-24)——Kubernetes 原生分解式推理

来源: https://github.com/llm-d/llm-d | https://www.spheron.network/blog/llm-d-kubernetes-disaggregated-inference-guide
可信度: 高——CNCF Sandbox 官方记录,GitHub 活跃开源项目
类型: 开源项目 / 云原生标准

核心内容:
llm-d 是一个 Kubernetes 原生的分解式(disaggregated)LLM 推理框架,2026-03-24 正式被接受为 CNCF Sandbox 项目。

关键技术组件: 1. llm-d scheduler:缓存感知路由,追踪每个 decode worker 的 KV cache 状态,最大化 prefix cache 命中率 2. Gateway API Inference Extension 集成:用标准 Kubernetes Gateway API 替代 round-robin,实现推理感知路由 3. Prefill/Decode 分解:将 prefill 阶段(计算密集)和 decode 阶段(内存密集)拆分到不同 GPU 池,解决单片 vLLM 在高并发时 prefill GPU 饱和的问题

2025-12 v0.4 里程碑: - DeepSeek V3.1 在 H200 GPU 上 per-output-token 延迟降低 40% - 新增 Intel XPU 和 Google TPU 分解式推理支持 - prefix cache offload 预览(CPU memory tiering,vLLM 原生)

与 NVIDIA Dynamo 的区别:
NVIDIA Dynamo 是运行在 vLLM 之上的编排层,不在 Kubernetes 内部运行;llm-d 是 Kubernetes 一等公民,使用标准 CRD 和 Gateway API

评价: CNCF Sandbox 身份确认了 llm-d 在云原生推理领域的事实标准地位。对于在 Kubernetes 上跑大规模 LLM 推理的团队,llm-d 是当前最完整的分解式推理解决方案。

标签: Cloud-Native Kubernetes LLM-Inference Disaggregation CNCF llm-d Gateway-API
建议路径: docs/inference/llm-d-cdf-sandbox-2026/
行动建议: 存档,关注 v0.5 版本路线图


☸️ Cloud-Native · Kubernetes & GPU 调度

[7] Kubernetes AI 基础设施 2026:GPU 调度 & 生产现实(CloudOptimo)

来源: https://www.cloudoptimo.com/blog/kubernetes-ai-infrastructure-in-2026-gpu-scheduling-and-production-realities
可信度: 高——基础设施服务商深度技术博客,含参考架构图
类型: 工程实践指南

核心内容:
一篇完整的 2026 年 Kubernetes AI 基础设施参考架构,涵盖:

调度层工具链: - GPU Operator:NVIDIA 官方,自动管理 GPU 驱动、CUDA 运行时、DCGM 监控 - KubeRay:分布式训练协调,Ray cluster 与 Kubernetes 深度集成 - Kueue:Job queueing 系统,支持多租户 GPU 资源共享 - Volcano:高性能批调度,支持 gang scheduling、hierarchical scheduling - DRA(Dynamic Resource Allocation):Kubernetes 官方 GPU 分配框架,替代传统 device plugin

多租户 GPU 设计要点: - taint/toleration 隔离 GPU 节点,防止通用负载抢占 - Karpenter(AWS EKS)或 Cluster Autoscaler 按需驱动 GPU node provisioning - Inference pod 特点:启动加载模型耗时 15-30 分钟,有显著状态,有分解式部署的协约依赖

评价: 这篇是 2026 年 Kubernetes AI 基础设施的完整参考图谱,适合团队在做内部 AI 平台选型时快速定位各工具的角色和边界。对知识库的云原生主题页有直接补充价值。

标签: Cloud-Native Kubernetes GPU-Scheduling KubeRay Kueue DRA AI-Platform
建议路径: docs/cloud-native/kubernetes-ai-infrastructure-2026/
行动建议: 存档,更新知识库 Kubernetes AI 基础设施主题页


[8] Kubernetes LLM 推理 disaggregated 部署权威指南(NVIDIA × Spheron)

来源: https://developer.nvidia.com/blog/deploying-disaggregated-llm-inference-workloads-on-kubernetes | https://www.spheron.network/blog/llm-d-kubernetes-disaggregated-inference-guide
可信度: 高——NVIDIA 官方博客 + Spheron 工程博客(均为 2026)
类型: 工程实践指南 / 权威参考

核心内容:
NVIDIA 和 Spheron 联合给出分解式推理在 K8s 上的完整部署方案:

分解式架构三层角色: 1. Prefill role:计算密集,batch size 影响小,主要瓶颈是算力 2. Decode role:内存带宽密集,batch size 敏感,主要瓶颈是显存带宽 3. Router role:请求路由和 session 状态管理

高级调度技术: - Gang scheduling:确保同一请求的 prefill/decode pod 同时启动 - Topology-aware placement:将 GPU 亲和性需求(如 NVLink/NVSwitch)映射到 K8s 约束 - KAI Scheduler:NVIDIA 推出的 AI 专用scheduler,将应用意图(leader workers、tensor parallelism)翻译为具体调度约束

Autoscaling 策略: - per-role 独立扩缩容(而非整体扩缩) - NVIDIA Dynamo / llm-d workload variant autoscaler:根据推理专属指标(TTFT、P99 延迟)动态调整角色比例

评价: 这是分解式推理在 Kubernetes 上落地的完整工程路径,含 NVIDIA 官方背书。对于计划在 K8s 上做生产级 LLM 推理的团队,这是最权威的参考文档之一。

标签: Cloud-Native Kubernetes Disaggregated-Inference NVIDIA Prefill-Decode Autoscaling
建议路径: docs/cloud-native/k8s-disaggregated-inference-nvidia-2026/
行动建议: 精读——工程团队可直接参考架构设计


🔍 Substack / RSS 精选

[9] Multi-Agent 编排框架Survey(2023-2026,Peer-Reviewed)

来源: https://www.preprints.org/manuscript/202604.2147(Peer-reviewed)
可信度: 高——同行评审综述,覆盖 2023-2026 Q1
Substack 来源: via RecSys Newsletter 引用
类型: 学术综述

核心内容:
三拓扑 + 一适应轴分类法: 1. 集中式协调(Centralized) 2. 去中心化协调(Decentralized)
3. 层级式协调(Hierarchical)

每个拓扑可叠加 动态/自适应控制 轴。

四大框架系统对比(LangGraph / CrewAI / AutoGen / OpenAI Agents SDK): - state-management 粒度 - token 成本结构 - failure-recovery 选项 - 设计哲学

协议栈分析: - MCP(Model Context Protocol):agent-to-tool 通信层 - A2A(Agent-to-Agent):agent 间通信层 - MCP + A2A 互补,ACP-A2A 合并预示协议收敛 - ANP:去中心化发现设计

评价: 这是多智能体系统领域最完整的框架对比 survey,对正在做 agent 架构选型的团队有直接参考价值。peer-reviewed 版本可信度高。

标签: Multi-Agent Orchestration LangGraph CrewAI AutoGen MCP A2A Survey
建议路径: docs/agents/multi-agent-orchestration-survey-2026/
行动建议: 精读,存档为知识库 agent 编排主题页核心文献


[10] VMAO:可验证多智能体编排 Plan-Execute-Verify-Replan(ICLR 2026 MALGAI Workshop)

来源: https://arxiv.org/abs/2603.11445(ICLR 2026 Workshop MALGAI)
可信度: 高——arXiv,有 Workshop paper 和代码链接
类型: 学术论文

核心贡献:
Verified Multi-Agent Orchestration(VMAO)框架,通过 Plan-Execute-Verify-Replan 四阶段协调专业 LLM agent 完成复杂查询。

解决的问题:
多 agent 系统中执行结果正确性无法保证的问题——每个 agent 的输出需要被验证后才允许进入下一阶段,避免错误累积。

评价: Plan-Verify-Replan 环路是生产级 multi-agent 系统的必备容错机制,这篇论文给出了一个可操作的框架原型。

标签: Multi-Agent Verification Planning ICLR2026 VMAO LLM-Agent
建议路径: docs/agents/vmao-iclr2026/
行动建议: 存档,关注代码仓库是否有生产级实现


[11] OWASP Top 10 Agents & AI 漏洞 2026 速查表(Alex Ewerlof)

来源: https://open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents
可信度: 高——OWASP 官方项目参与者撰写,工程导向
类型: 安全指南 / 速查表

内容:
将 OWASP Top 10 for LLM(LLM01-LLM10)和 OWASP Top 10 for Agents(ASI01-ASI10)整合为一个实用工程指南,每个漏洞含: - 示例场景 - 图解 - 实用缓解建议

核心洞察: - Semantic Firewall:用隔离的、严格约束的二级模型评估输入/输出 - 最小权限原则:严格限制 agent 工具权限 - LLM 中 instruction(system prompt + function calls)和 data(user input + RAG docs)被拼接为单一字符串输入——这是 prompt injection 的根源

标签: Security OWASP LLM-Agent Prompt-Injection Agent-Safety
建议路径: docs/security/owasp-agents-ai-top10-2026/
行动建议: 精读,纳入知识库 agent 安全主题页


[12] ByteByteGo RSS 精选(2026-07-10)

来源: https://blog.bytebytego.com/feed
可信度: 高——ByteByteGo 技术博客
类型: RSS 摘要

两条相关条目:

[12a] 流式 vs 批量:数据处理的两种哲学

来源: https://blog.bytebytego.com/p/streaming-vs-batch-two-philosophies
核心: 探讨数据完整性阈值与计算时机的关系,对 LLM 推理中 streaming output 的工程权衡有参考意义
标签: Streaming Batch-Processing LLM-Inference
行动建议: 存档,不优先

[12b] Agent 循环:AI 如何从回答问题走向执行任务

来源: https://blog.bytebytego.com/p/the-agent-loop-how-ai-goes-from-answering
核心: 逐步解析 AI Agent 的结构组成、每轮决策机制、支撑脚手架
评价: ByteByteGo 标志性的系统化解析风格,对理解 agent loop 的工程组件有教学价值
标签: LLM-Agent Agent-Loop ByteByteGo
行动建议: 存档,适合作为知识库 agent 入门引文


📋 分类标签汇总

类别 条目
database [1] pgvector benchmark、[2] HNSW-Merger SIGMOD26、[3] RetroInfer VLDB26、[4] 向量数据库 survey
backend [5] KV cache eviction 五篇论文、[6] llm-d CNCF
cloud-native [7] K8s AI infrastructure 2026、[8] NVIDIA disaggregated inference guide
csdn n1n.ai vLLM vs SGLang vs LMDeploy benchmark(高价值中文技术博客)、SGLang 完整教程(weavai.app)
reproduction [2] HNSW-Merger PDF(SIGMOD26)、[3] RetroInfer PDF(VLDB19)
substack [9] Multi-agent survey、[10] VMAO、[11] OWASP agents 2026

📁 建议写入路径

  • docs/vector-db/pgvector-benchmark-50m-2026/
  • docs/vector-db/hnsw-merger-sigmod2026/
  • docs/inference/retroinfer-vldb2026/
  • docs/vector-db/comprehensive-survey-2026/
  • docs/inference/kv-cache-eviction-2026-research/
  • docs/inference/llm-d-cdf-sandbox-2026/
  • docs/cloud-native/kubernetes-ai-infrastructure-2026/
  • docs/cloud-native/k8s-disaggregated-inference-nvidia-2026/
  • docs/agents/multi-agent-orchestration-survey-2026/
  • docs/agents/vmao-iclr2026/
  • docs/security/owasp-agents-ai-top10-2026/

🔔 精读 / 审稿 / 主题页更新建议

⭐⭐⭐ 必精读(高工程价值): - [2] HNSW-Merger(SIGMOD 2026,向量数据库内核) - [3] RetroInfer(VLDB 2026,长上下文推理存储引擎) - [7] + [8] K8s AI 基础设施 + NVIDIA disaggregated inference guide(生产落地)

⭐⭐ 建议精读(知识库补全): - [1] pgvector benchmark(选型决策) - [5a] Apple KVP + [5c] PagedEviction(KV 淘汰最实用两篇) - [9] Multi-agent survey(框架选型参考)

📝 主题页更新建议: - 向量数据库选型决策树(pgvector vs Qdrant vs Pinecone 更新) - LLM 推理引擎对比(补全 llm-d CNCF Sandbox) - Kubernetes AI 基础设施(补全 DRA / KAI Scheduler / llm-d) - Agent 编排框架对比(LangGraph / CrewAI / AutoGen / OpenAI Agents SDK) - Agent 安全(OWASP ASI Top 10 2026)