五分类知识库简报 · Jay · 2026-08-11 11:05
📡 主题
RAG 范式迁移 / Vectorless Agent / 云原生推理 / pgvector 工程基准 / OpenAI–HF 安全事件
一、Database
⭐ 高价值
1. CIDR 2026 | PostgreSQL-V:解耦向量索引新架构
- 来源:[PDF] Fast Vector Search in PostgreSQL: A Decoupled Approach
(cs.purdue.edu/homes/csjgwang/pubs/CIDR26_PostgreSQLVector.pdf)
- 核心:提出 PostgreSQL-V,将向量索引(HNSW/IVFFlat)从 PostgreSQL WAL 解耦,
调用原生向量库(Faiss)进行索引,LSM-tree 架构支持高并发读写。
- 评价:学术系统论文,面向亿级向量写入场景,与 Milvus 分片策略形成对比。
建议精读:索引构建参数与 LSM compaction 权衡。
- 可信度:高(CIDR 2026 同行评审)
2. Vector DB Benchmark 2026(Salt Technologies,Q1 2026) - 来源:https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026 - 核心数据(1M vectors / 1536 dim): | DB | p50 | p99 | |---|---|---| | Qdrant | 4ms | 25ms | | Redis | 5ms | 20ms | | Milvus | 6ms | 35ms | | Pinecone | 8ms | 45ms | | pgvector | 18ms | 90ms | - 评价:pgvector p99 90ms 对多数 RAG 场景可接受,但与专用向量库差距明显(~3-4x)。 HNSW 参数(m/ef_construction)调优可改善;Aurora 优化型读取 + pgvector HNSW 可将查询吞吐量提升 9 倍、成本降低 75-80%(AWS 官方博客)。 - 决策框架:<5M 向量 → pgvector;5M-100M → pgvectorscale;>100M → Milvus;零运维 → Pinecone。
3. 阿里云 RDS pgvector 配置指南(2026-06 更新)
- 来源:https://www.alibabacloud.com/help/zh/rds/apsaradb-rds-for-postgresql/pgvector-use-guide
- 高价值细节:
- 最大向量维度 16000,建索引最大 2000 维
- maintenance_work_mem 不足时 lists > 2000 会报 OOM,需合理配置
- ivfflat.probes 与召回率/速度权衡(越大越慢但召回越高)
- 分类标签:database pgvector production index-tuning
二、Backend
⭐ 高价值
1. AAAI 2026 | "Keyword Search Is All You Need":向量数据库非必须
- 来源:Subramanian et al.,AAAI 2026;via Abdullah Grewal (Medium)
- 核心结论:Claude Code、Cursor、Windsurf、Devin、Cline、Sourcegraph Amp 等
2026 年主流 coding agent 不再将语料库索引进向量数据库,
而是将检索作为工具暴露给 LLM(ReAct agent + pdfmetadata/rga 等工具调用)。
在相同 LLM、相同评测集下,keyword search + agentic tool use 性能与向量 RAG 基本持平。
- 评价:范式颠覆性证据。不意味着向量 DB 消亡,而是 coding agent 场景从向量优先切换为工具优先。
知识密集型 RAG(法律/医疗/客服)仍依赖向量检索。
- 可信度:较高(AAAI 2026 peer-reviewed),但基准为 Claude 3 Sonnet,换模型结论可能不同。
- 建议写入:reproduction 标签,纳入 Agent-as-Retriever 对比实验设计。
2. Agentic RAG 三大原则(arXiv:2605.27123,2026-05) - 来源:https://arxiv.org/abs/2605.27123 - 核心原则: 1. 自主策略(Autonomous Strategy):LLM 动态决定是否检索、如何检索, 不被外部规则/分类器约束 2. 多步推理循环:不一次性 retrieve-then-generate,而是迭代式 query rewriting → tool switching → self-verification → re-retrieval 3. 可观测性:检索策略本身成为 Day-2 运营信号 - A-RAG 框架(arXiv:2602.03442v1):三层检索接口(keyword_search / semantic_search / chunk_read), 层级粒度工具让 agent 自适应选择。 - 对比经典 RAG vs Agentic RAG: | 维度 | 经典 RAG | Agentic RAG | |---|---|---| | 每轮检索次数 | 1 | 1-6 动态 | | 查询改写 | 可选 | 默认 | | 多跳推理 | 无 | 有 | | 自检机制 | 无 | faithfulness judge | | LLM 调用/轮 | 1 | 3-8 |
三、Cloud-Native
⭐ 高价值
1. CNCF Annual Survey 2026:K8s 成为 AI 推理默认平台 - 来源: - CNCF Blog(2026-03-05):https://www.cncf.io/blog/2026/03/05/the-great-migration-why-every-ai-platform-is-converging-on-kubernetes - The New Stack:https://thenewstack.io/kubernetes-native-ai-infrastructure - SiliconANGLE:https://siliconangle.com/2026/03/20/cloud-native-ecosystem-k8s-ai-kubeconeu - 核心数据:82% 容器用户在生产环境运行 K8s;66% 的 GenAI 推理运行在 K8s 上。 CNCF 预测 2026 年 GPU 调度、事件驱动推理、KAITO 将成为 K8s AI 基础设施主流。 - 阿里云+OpenStack+K8s + Gateway API Inference Extensions 架构: - 训练集群(高吞吐)与推理集群(低延迟/弹性扩缩容)分离是最佳实践 - Ceph + 云原生存储为 AI 数据湖基础 - llm-d CNCF sandbox 项目支持 GPU 分片共享(单卡多工作负载混部) - 评价:KubeCon EU 2026 核心议题,AI inference on K8s 已从实验进入生产。
2. CNCF Jonathan Bryce:推理是云原生最大挑战 - 来源:YouTube(TFIR)/ Black Hat 2026 - 核心:2025-2026 年推理性能最大改进来自部署架构侧而非硬件侧; vLLM + OpenTelemetry + Kubernetes 构成 AI 推理可观测性三件套; Hammy 项目(CNBC sandbox)实现单 GPU 分片给多个训练/推理工作负载。
四、CSDN
候选(需筛选)
-
CSDN | 百万向量实测:pgvector 比专用数据库慢 3 倍,但省 80% 运维成本 - 来源:https://blog.csdn.net/weixin_47315004/article/details/163127738 - 标签:
csdnpgvectorbenchmarkproduction-cost- 评价:标题党但数据有参考价值,注意发布日期 2026(新鲜) -
阿里云 PolarDB PGVector 插件指南(HNSW + IVFFlat 参数详解) - 来源:https://help.aliyun.com/zh/polardb/polardb-for-postgresql/pgvector - 高价值:HNSW
m(双向链接数)与ef_construction的调参逻辑; IVFFlatlists参数 K-Means 聚类中心数对召回率的影响 - 分类标签:databasepgvectorhnswindex-tuning
五、Reproduction / Engineering Notes
⭐ 高价值
1. pgvector HNSW 索引生产调参速查
-- HNSW 推荐生产配置
CREATE INDEX ON vecs USING hnsw(embedding vector_l2_ops)
WITH (m = 16, ef_construction = 64);
-- 查询时动态调召回(ef_search 越大召回越高)
SET hnsw.ef_search = 100; -- 高召回场景
SET hnsw.ef_search = 40; -- 低延迟场景
-- IVFFlat 推荐配置(召回优先)
CREATE INDEX ON vecs USING ivfflat(embedding vector_cosine_ops)
WITH (lists = 100); -- lists 越大查询越快,但召回可能下降
2. Agentic RAG vs Vectorless RAG 选型决策树
场景?
├─ Coding Agent(代码检索)→ Vectorless + Agent-as-Retriever
├─ 知识密集型 RAG(法律/医疗)→ 向量 DB(pgvector/Qdrant)+ Re-Ranker
├─ 多跳推理 → Agentic RAG + GraphRAG
├─ <100M 向量 + 已有 PG → pgvector + HNSW
└─ >100M 向量 + 严格 SLA → Milvus + GPU indexing
📋 分类标签
database backend cloud-native csdn reproduction
agentic-rag vectorless pgvector kubernetes cncf
📁 建议写入路径
/shared/research-kb/inbox/jay/2026-08-11T1105-jay-five-category-briefing.md
🔬 后续行动建议
- 精读:CIDR 2026 PostgreSQL-V 论文(LSM + 向量索引解耦设计)
- 精读:AAAI 2026 Subramanian keyword search paper(复现 agent-as-retriever vs vector RAG 对比实验设计)
- 审稿:本简报 Vectorless RAG 结论表述是否准确
- 主题页更新:「RAG 范式演进」主题页补充 Agentic RAG vs Vectorless 分支
Jay · 2026-08-11 11:05 · 第三次简报