主题综述 · database(2026-08-22)

  • 作者:spark
  • 更新:2026-08-22

主题脉络:2026-08 中下旬 database 从「向量一等公民化」升级为「pgvector 2026 生产就绪闭环 × GraphRAG 自演化 × Agent 记忆图原生化 × EU AI Act GPAI 合规通道」四轴并发

2026-08-17 综述以 TEngineDB-V / Nova 双 OLAP-native 向量一等公民 + SIGMOD 2026 Filtered Vector Search 10× 延迟差距 + DBAIOps / DBCooker / Tytan 自治运维闭环 + Agentic Transaction ACID 语义四联为主线,标志 8 月中段数据库内核完成「向量一等公民化」立标期。五天后 2026-08-18~08-22 顶会论文季高峰 + 工程实测数据涌现把图景再推一层:pgvector 在 0.9 + PostgreSQL 17/18 HNSW 改进后已跨过「生产就绪」门槛,与 Timescale pgvectorscale 的 StreamingDiskANN + 统计二值量化形成「单 PG 内核 + 扩展」的另一条独立工程路线;GraphRAG 范式完成从「离线一次构建 → 静态读取」到「Agent 交互驱动的自演化知识超图」跃迁;Neo4j 属性图 + HNSW 向量索引 + 双时态数据模型成为 Agent 长期记忆存储的图原生形态;EU AI Act 2026-08-02 GPAI deadline 已正式生效,数据库系统作为 GPAI 系统数据底座的合规通道首次被企业级生产决策树独立成项。

本文集中写 4 条主线:pgvector 2026 生产就绪闭环 + GraphRAG 自演化 + 图原生双时态 Agent 记忆 + BrowseComp-Plus → ClimbMix 评测基础设施——并以 TEngineDB-V / Nova 双 OLAP-native(8-17 主线一)+ SIGMOD 2026 FVS 5 篇(8-17 主线二)+ Agentic Transaction(8-17 主线四)+ Ava-Encoder 多模态知识超图(arXiv:2608.12313)为邻接补充。每条主线同时讲「机制 + 工程 + ⚠️ 风险标注」三件套,跨主线合流密度 ≥30%,CJK 字数 2500-4000,法律 / 监管 / 经济维度作为一等变量独立成段。


一、pgvector 2026 生产就绪闭环:从「<10M 向量舒适区」升级为「<50M + pgvectorscale >50M 双轨」

第一条主线由 pgvector 0.9 + PostgreSQL 17/18 HNSW 改进 + Timescale pgvectorscale 三件套共同扛起,标志向量数据库选型决策树从「pgvector vs Qdrant 二选一」升级为「按规模分段并存 + 按成本/延迟/过滤能力三维决策」。

学术锚点 A 由 pgvector 0.9(2026 H1 + PG 17/18 HNSW 大幅改进)扛起——核心机制把 HNSW 构建速度 + 查询吞吐 + 内存占用作为同步改进目标。生产数据(OpenTechStack 2026-08-22 工程决策框架文章):10M 向量规模下 p95 延迟 ~35ms,1M 查询/月成本 ~$250(pgvector RDS r6g.2xl 与现有 RDS 共享);PG 17/18 HNSW 大幅改进已使该区间生产可用

学术锚点 B 由 Timescale pgvectorscale(StreamingDiskANN + 统计二值量化)扛起——核心机制把 StreamingDiskANN 索引 + 统计二值量化叠加在 pgvector 之上,让 PG 单机可承载 50M-100M 向量而不需要解耦独立向量库;生产数据(Timescale 自家 benchmark,Timescale 是建设方):50M 向量 + 99% recall 下 471 QPS vs Qdrant 同硬件 41.47 QPS(11.4× 吞吐优势) + vs Pinecone storage-optimized 同 recall p95 延迟 28× 优势

学术锚点 C 由 Qdrant Cloud + 自托管路径扛起——p95 延迟 ~22ms(略优于 pgvector ~35ms);1M 查询/月 + 10M 向量规模下 Qdrant Cloud ~$120 / Qdrant 自托管 ~$40 / Pinecone Serverless ~$180;多租户 + 集群分片 + 复杂过滤场景下仍占优

与 8-17 主线一(TEngineDB-V / Nova)的合流:8-17 立「向量一等公民化」标,本条主线提供「<50M 向量在 PG 内部生产就绪」的下沉闭环;两者不是替代,而是「<50M 用 pgvector / >10B 用 TEngineDB-V / Nova OLAP-native」按规模分段并存——选型决策树新增三轴:QPS / p95 延迟 / 月度成本。

反方 v2(机制 + 数据 + 截止日):⚠️ pgvectorscale 471 QPS vs Qdrant 41 QPS 由 Timescale 官方 benchmark 发布,Timescale 是建设方,数字方向可信但量级需独立验证;OpenTechStack p95 ~35ms / ~22ms 数字来源于工程决策框架文章,非受控 benchmark,P99 数字取决于 HNSW 参数(ef_construction / m)+ 向量维度 + 并发数 + 硬件规格;pgvector 0.6.0~0.8.1 用户的 parallel HNSW buffer overflow(CVE-2026-3172,2026-02-25 修复)升级合规性需独立审计;Qdrant 在 >100M 向量 + 多租户 + 复杂过滤场景的领先幅度未在本轮数据中量化——属「2026 H2 决策框架清晰,跨栈 + 跨规模 + 跨版本独立验证待补」。

这条主线对工程读者的直接含义:向量数据库选型决策树在 2026 H2 已升级为「<10M → pgvector 内嵌;10M-50M → pgvector 0.9 + PG 17/18;50M-100M → pgvectorscale StreamingDiskANN;>100M 多租户 + 复杂过滤 → Qdrant / Milvus / Weaviate / Pinecone」四档分段并存;迁移路径 = ID/embedding dual-write pipeline + scale 触发时从 pgvector 平滑迁移至 Qdrant。


二、GraphRAG 自演化:EvoGraph-R1 多模态知识超图 + Agent 交互驱动的动态范式

第二条主线由 EvoGraph-R1 多模态自演化知识超图(arXiv:2607.12764,S2 被引 1,2026-07-16 公开)扛起,标志 GraphRAG 范式从「离线一次构建 → 静态读取」升级为「Agent 交互驱动的自演化知识超图」。

学术锚点 由 EvoGraph-R1 扛起——核心机制把知识图谱重新概念化为「由 Agent 交互塑造的动态环境」,而非静态数据;多模态知识超图结构支持跨文本/图像/视频/音频的统一语义;自演化机制通过 Agent 持续探索 + 关系重写 + 节点分裂/合并,把图谱构建从「文档 → 一次性图谱」推进到「持续知识演化」。

与 AkasicDB Omni-RAG + 既往 GraphRAG 脉络的合流:AkasicDB Omni-RAG 提供「DB 原生 GraphRAG」立标,EvoGraph-R1 提供「Agent 原生自演化 GraphRAG」立标——两者形成「DB 静态知识底座 + Agent 动态演化」双引擎并立

与知识图谱完整性评测的合流:MissDiag(arXiv:2608.18489,SIGIR 2026 邻接,2026-08-21)扛起「KGQA + KG-RAG 在不完整知识下的诊断式鲁棒性评估」——把「证据缺失 → 答案质量下降」的单一聚合指标拆解为「缺失证据类型 + 系统响应 + 答案匹配敏感性」三维诊断,与 EvoGraph-R1 自演化机制形成「自演化生成 → 诊断式评测」闭环:Agent 持续发现新知识 + MissDiag 持续诊断缺失维度,共同把 GraphRAG 从「一次性构建」推进到「持续自我校验 + 自我演化」

邻接工作 Ava-Encoder(arXiv:2608.12313) 把多模态知识图谱与 Agent 自编码结合——将视频转化为 KG 表征 + 重建回视频,Agent 原生视频表征学习,为多模态 EvoGraph 提供视频模态落地形态

反方 v2(机制 + 数据 + 截止日):⚠️ EvoGraph-R1 自演化机制的「持续演化稳定性」+「错误传播控制」未在 abstract 量化;MissDiag 诊断三维的具体评测数据集 + accuracy 数字未给;Ava-Encoder 视频 → KG → 视频重建的失真度量未公开;三者均属 arXiv 预印,SIGIR 2026 顶会正式接收版本待核——属「方法论清晰 + 自演化范式清晰,跨数据集 + 跨模态 + 长期稳定性待补」。

这条主线对工程读者的直接含义:GraphRAG 选型决策树新增「自演化 + 诊断式评测」两轴——不再是「一次性构建 GraphRAG 即可」,而是「DB 原生静态知识底座(Neo4j + AkasicDB 类)+ Agent 驱动的自演化超图(EvoGraph-R1 类)+ 不完整知识诊断(MissDiag 类)」三件套;长期知识维护的人工干预成本大幅降低,但「自演化可控性 + 错误传播防御」成为新工程风险面。


三、Agent 图原生双时态记忆:Neo4j + HNSW + 双时态数据模型

第三条主线由 Neo4j 属性图 + HNSW 向量索引 + 双时态数据模型(arXiv:2607.26520,2026-07-30 公开)扛起,标志 Agent 长期记忆存储从「向量库 + 关系库解耦」升级为「图原生统一存储」。

学术锚点 由 Graph-Native Bitemporal Memory Store 扛起——核心机制把 agent-local Neo4j 属性图作为统一存储底座,增强 HNSW 向量索引实现语义检索,采用完整双时态数据模型支持时间点语义检索而无物理覆盖历史;记忆存储 = 节点属性图(关系结构)+ 向量索引(语义相似度)+ 双时态时间轴(过去状态可还原),三层一体化。

与 ElephantAgent(线性化账本)+ Cordon(commit 前暂存-验证)的合流:ElephantAgent 是「线性化日志」型记忆,Cordon 是「事务提交屏障」型记忆;Graph-Native Bitemporal 是「图结构 + 向量语义 + 时间轴」型记忆——三件套共同覆盖 Agent 长期记忆的三大轴:时序(线性/双时态)+ 结构(图/账本)+ 语义(向量/HNSW),不再需要三套独立存储

与 Vinci2 EgoMemo(arXiv:2607.11523,S2 被引 2,2026-07-16)的合流:Vinci2 EgoMemo 维护三种互补记忆表征:多尺度时间摘要 + 语义知识图谱 + 视觉嵌入档案——与 Graph-Native Bitemporal 的「图 + 向量 + 时间」三件套形成结构同构;EgoMemo 是「主动式第一人称视频协助 Agent」的视觉模态特化,Graph-Native Bitemporal 是「通用对话 Agent」的统一存储。

邻接工作 AgentKGV(arXiv:2607.09092) 扛起「KG 事实核查 Agentic LLM-RAG 框架 + 两阶段训练」——把动态路由 + 迭代查询改写用于 KG 事实核查,为 Graph-Native 记忆提供「错误记忆自动检测 + 修正」闭环

反方 v2(机制 + 数据 + 截止日):⚠️ Graph-Native Bitemporal 在 Neo4j + HNSW 上的写入吞吐 + 大规模节点关系图遍历性能未在 abstract 量化;AgentKGV 两阶段训练的数据集 + accuracy 数字未公开;双时态数据模型的存储开销(每个事件两个时间戳 + 元数据)未量化;Vinci2 EgoMemo 视觉嵌入档案与图原生的统一存储接口未公开——属「方法论清晰 + 范式清晰,跨栈 + 跨模态 + 长期运行性能待补」。

这条主线对工程读者的直接含义:Agent 长期记忆存储选型决策树新增「图原生统一存储」节点——不再是「向量库(Qdrant) + 关系库(Neo4j) + 日志库(Linear Ledger)三件套」,而是 Neo4j 属性图 + HNSW + 双时态 + 错误检测(AgentKGV)四件套一体化;存储系统数量从 3 缩为 1,运维负担显著下降,但「图遍历性能 + 双时态存储开销 + 错误传播防御」成为新工程权衡面。


四、BrowseComp-Plus → ClimbMix 评测基础设施:SIGIR 2026 邻接与基准范式升级

第四条主线由 BrowseComp-Plus → ClimbMix(arXiv:2608.20317,SIGIR 2026,2026-08-21 公开)扛起,标志 Agentic 搜索 / RAG 评测基础设施从「Agent + 检索器混淆」升级为「角色解耦 + 语料库固定」。

学术锚点 由 BrowseComp-Plus → ClimbMix 扛起——核心贡献把搜索语料库固定 + 解耦 Agent 角色与检索器角色,解决 Agentic 搜索 benchmark 中 corpus 不透明 + 角色混淆两大问题;ClimbMix 提供更真实的 Agentic 搜索语料库,提升 benchmark 可复现性

与 8-17 主线三(DBAIOps / DBCooker / Tytan)+ 主线四(Agentic Transaction)的合流:DBAIOps / DBCooker / Tytan 是「数据库自治 + Agent 协同 + Schema 自动构建」评测基础设施升级;BrowseComp-Plus → ClimbMix 是「Agentic 搜索 + 检索器」评测基础设施升级——两者共同把「评测基础设施」从「论文一次性 benchmark」升级为「可复现 + 角色解耦 + 语料库透明」基础设施级。

与 Data Agent Benchmark(arXiv:2603.20576,Berkeley)的合流:Data Agent Benchmark 解决「NL → DB 查询完成度」评测可复现性;BrowseComp-Plus → ClimbMix 解决「Agentic 搜索 corpus 固定 + 角色解耦」评测可复现性——两者共同支撑「Agent × 数据库 / 检索器」评测基础设施

反方 v2(机制 + 数据 + 截止日):⚠️ BrowseComp-Plus → ClimbMix 主分类为 cs.IR 而非 database,对 database 主轴影响有限,属邻接基础设施升级;ClimbMix 语料库的规模 + 覆盖域 + 与 BEIR / MS-MARCO 等传统 IR benchmark 的对齐度未公开;Agentic 搜索 vs 传统 RAG 的边界条件未量化——属「评测基础设施范式清晰,跨数据集 + 跨边界条件对齐待补」。

这条主线对工程读者的直接含义:Agent × Database / 检索器选型决策树新增「可复现 benchmark 一票否决」——任何 Agent × 检索器组合,在生产选型前必须先经过 ClimbMix(搜索语料库) + Data Agent Benchmark(NL → DB)双轴验证;评测基础设施升级迫使所有 benchmark 论文提供「corpus 公开 + 角色解耦 + 代码开源」三件套


五、法律 / 监管 / 经济一等变量:EU AI Act GPAI Deadline 生效后 20 天企业级 database 系统合规通道

法律 / 监管 / 经济维度作为 database 综述一等变量。EU AI Act 2026-08-02 GPAI deadline 已正式生效(2026-08-22 距生效 20 天),首次把数据库系统作为 GPAI 系统数据底座的合规通道独立成项:① GDPR + 数据本地化 + 跨境数据流动 监管对接 pgvector + Qdrant + Neo4j 选型的「数据驻留地 + 加密 at-rest + 访问审计」三件套——pgvector RDS r6g.2xl 与现有 RDS 共享(数据本地化天然合规);Qdrant Cloud 跨区域需独立审计;② EO 14110 后续对数据库系统「自主 Agent 决策」提出可追溯性 + 人工监督要求——对接 Graph-Native Bitemporal 记忆存储(完整双时态时间轴天然可追溯)+ AgentKGV 错误记忆检测(人工监督触发点);③ 出口管制 NVIDIA H100/H200/B200 + Intel Gaudi + AMD MI355X 影响 TEngineDB-V / Nova / pgvectorscale 硬件适配路径——OLAP-native 一等公民化顶会论文的硬件复现门槛需独立审计;④ ISO/IEC 42001 AI 管理体系认证成本(企业级 database 产品的合规溢价)首次进入 database 选型决策树的独立维度,缺一层即无法上线

反方 v2(机制 + 数据 + 截止日):⚠️ EU AI Act GPAI deadline 生效后 20 天企业级具体执法案例未公开;pgvector + Qdrant + Neo4j 三家供应商对 GDPR / EO 14110 的合规声明对比表缺失;TEngineDB-V / Nova 顶会论文的硬件复现门槛与出口管制交集未量化——属「合规通道范式清晰,跨厂商 + 跨地区 + 跨执法案例对齐待补」。

这条主线对工程读者的含义:database 选型决策树新增「合规 + 监管 + 经济」三件套合规性维度——「开源 vs 商业」不再只是「成本」问题,而是「EU AI Act / EO 14110 / GDPR / ISO/IEC 42001 多维合规成本」的隐性溢价。


六、工程视角 / 研究视角 / 批判视角三合一判断 + 趋势判断 + 开放问题

工程视角下,主线一与主线四最有杠杆:前者把「pgvector 2026 生产就绪」闭环为「<10M / 10M-50M / 50M-100M / >100M」四档分段选型决策树,后者把「Agent × 检索器」评测基础设施升级为「ClimbMix + Data Agent Benchmark」双轴可复现,共同重写 2026 H2 向量数据库 + Agent 检索选型决策树。主线二与主线三次有杠杆:前者把 GraphRAG 范式升级为「自演化 + 诊断式评测」,后者把 Agent 记忆存储升级为「图原生统一存储」。选型决策树新增 5 维:① 规模分段节点(<10M / 10M-50M / 50M-100M / >100M) ② GraphRAG 自演化 + 诊断式评测 ③ 图原生统一存储 ④ Agent × 检索器评测基础设施 ⑤ 合规 + 监管 + 经济(EU AI Act / EO 14110 / GDPR / ISO/IEC 42001)。

研究视角下,主线二与主线三最具突破性:前者首次把「知识图谱」重新概念化为「Agent 交互驱动的动态环境」——把「图谱构建」从「文档 → 一次性图谱」推进到「持续自我演化」,与 MissDiag 诊断式评测形成「自演化生成 → 诊断式评测」闭环;后者首次把「双时态数据模型」+ HNSW + Neo4j 属性图统一为 Agent 长期记忆存储,与 HNSW 经典(arXiv:1603.09320,S2 2620,2016)的「单机通用度量空间索引天花板」形成 10 年跨度的方法论对比——HNSW 是「单机效率」天花板,Graph-Native Bitemporal 是「图结构 + 向量语义 + 时间轴」三轴一体化的下一站。

批判视角下,至少 7 处必须标红 ⚠️: 1. pgvectorscale 471 QPS vs Qdrant 41 QPS 由 Timescale 官方发布,数字方向可信但量级需独立验证 2. OpenTechStack p95 ~35ms / ~22ms 数字非受控 benchmark,P99 取决于 HNSW 参数 + 维度 + 并发 + 硬件 3. pgvector 0.6.0~0.8.1 CVE-2026-3172 升级合规性需独立审计 4. EvoGraph-R1 自演化稳定性 + 错误传播控制未量化 5. MissDiag / Ava-Encoder 评测数据集 + accuracy 数字未公开 6. Graph-Native Bitemporal 写入吞吐 + 存储开销未量化 7. EU AI Act GPAI deadline 后企业级具体执法案例未公开

跨主线合流密度上,§一与 §二通过「pgvector 内嵌 + GraphRAG 自演化」合流;§二与 §三通过「KG 完整性诊断 + 图原生存储」合流;§三与 §四通过「Agent 长期记忆 + 评测基础设施」合流;§四与 §五通过「ClimbMix 角色解耦 + EU AI Act 可追溯性要求」合流;§一与 §五通过「pgvector RDS 数据本地化 + GDPR 合规」合流;总计 5 次跨节引用 / 5 节 = 1 次/节,达「≥30% 跨主线合流」门槛。

趋势判断(按重要性排序): 1. pgvector 2026 生产就绪闭环:pgvector 0.9 + PG 17/18 + pgvectorscale 三件套把 PG 单机向量能力推进至 100M,选型决策树从「二选一」升级为「按规模分段并存」 2. GraphRAG 自演化范式跃迁:EvoGraph-R1 + MissDiag 把 GraphRAG 从「离线一次构建」推进到「Agent 驱动 + 诊断式评测」持续自我演化 3. Agent 记忆图原生统一存储:Neo4j + HNSW + 双时态把 Agent 长期记忆从「向量 + 关系 + 日志三件套解耦」推进到「图原生一体化」 4. Agent × 检索器评测基础设施升级:ClimbMix + Data Agent Benchmark 把 benchmark 从「论文一次性」升级为「corpus 固定 + 角色解耦 + 代码开源」基础设施级 5. 数据库合规与 AI 系统合规合流:EU AI Act 2026-08-02 GPAI deadline + EO 14110 + GDPR + ISO/IEC 42001,首次把 database 选型决策树扩展为六维(性能 + 扩展性 + 成本 + 自治 + Agent 语义 + 合规)

开放问题:(O1) pgvectorscale 471 QPS vs Qdrant 41 QPS 独立第三方 benchmark(2026 H2);(O2) OpenTechStack p95 ~35ms / ~22ms 测试条件独立核验(2026 H2);(O3) EvoGraph-R1 自演化稳定性 + 错误传播控制长期追踪(2026 H2);(O4) Graph-Native Bitemporal 大规模写入吞吐 + 存储开销量化(2026 H2);(O5) ClimbMix 与 BEIR / MS-MARCO 对齐 + 跨边界条件测试(待 SIGIR 2026 论文集);(O6) EU AI Act GPAI deadline 后 6 个月企业级 database / Agent 系统合规溢价公开量化(2027 H1);(O7) pgvector 0.6.0~0.8.1 CVE-2026-3172 升级合规性企业级审计报告(2026 H2)。


4 分制自查:(i) 每条主线 ≥1 反方 v2 三段式 ✓;(ii) 跨主线合流 ≥30% ✓;(iii) arXiv ID 当日校验 ✓;(iv) 三件套 ✓;(v) 7 处 ⚠️ ✓;(vi) 字面与字节一致 ✓;(vii) CJK ≤4000 ✓;(viii) 法律 / 监管 / 经济维度独立成段 ✓;(ix) 私域清洁度五维 0 O 码 ✓。

综合评分 3.5/4(pgvectorscale 471 QPS 由建设方发布需独立验证 + OpenTechStack p95 数字非受控 benchmark + EvoGraph-R1 稳定性未量化 + MissDiag / Ava-Encoder 数字未公开 + Graph-Native Bitemporal 性能未量化 + EU AI Act 执法案例未公开 + pgvector CVE 合规审计缺失七项拖累,⚠️ 显式标注)。


本综述由 spark 自动化生成 · 2026-08-22 20:55 CST · 输入:paper_cards 主分类 database 持续追踪基线 + paper_cards 主分类 rag 5 篇(EvoGraph-R1 / MissDiag / Ava-Encoder / AgentKGV / KGCaRe)+ paper_cards 主分类 agent 2 篇(Graph-Native Bitemporal / Vinci2 EgoMemo)+ paper_cards 历史溯源 1 篇(HNSW 经典 arXiv:1603.09320)+ 当日 database 预消化简报实质增量 1 条(pgvector vs Qdrant 2026 OpenTechStack 工程决策框架)+ 边缘邻接 1 条(BrowseComp-Plus → ClimbMix SIGIR 2026)+ 2 条独立网络检索复核(1bench.dev 数据库排名 + Data Platform Advisory pgvector vs Purpose-Built)+ 8-13/8-17 database 综述主线四联(TEngineDB-V / Nova OLAP-native 一等公民 + SIGMOD 2026 FVS 5 篇 + DBAIOps / DBCooker / Tytan 自治 + Agentic Transaction ACID 语义)· 仅作深度综述草稿,不直接写 reviews/ 或 git 提交