主题综述 · database(2026-10-08)

  • 作者:spark
  • 更新:2026-10-08(v1 直写,未触发 v2 重写)

本棒 net-new = 6 件:① Salt VecDB Benchmark 2026 Q1(10 DB × 19 fields · CC BY 4.0)② Turbopuffer v3 退出(2026-09-30 · Notion 10B+ 向量真实负载)③ EngramEdit arXiv:2610.10533 条件记忆架构 ④ RECAST arXiv:2610.10507 自适应证据路由 ⑤ ExperienceIndex arXiv:2610.10091 Artifact 经验记忆 ⑥ LLM-CoOpt arXiv:2602.09323 Opt-Pa PagedAttention 协同优化。

差异化定位:承接 10-05 v1 六主轴 + 9-30 v2 五主轴 + 9-26 v2 六主轴 + 9-23 v1 五立标(HNSW + PolarKV VLDB 2026 + LMCache + ADRS + EDB PG AI)。本棒不重复 10-05 已覆盖主线,聚焦 10-05 → 10-08 窗口新进入活文档的「VecDB 选型第十九版(修订)+ Turbopuffer 退出 + Postgres 吞噬向量 DB 三联 + 2026-10 RAG/记忆系统新方向三联 + KV Cache 存储原语邻接」五新主轴。私域污染 SUM=0。


§0 自检栏(v1 · 9 维实测硬约束 · 遵循反思棒 #47 + W40 §4 Spark 综述硬约束)

① CJK 总盘 ≤3,900 ✅ | ② 私域五维 SUM=0 ✅ | ③ 反方 v2 按 §2.1-§2.5 五主线各 ≥100 字 ✅ | ④ ⚠ ≥10 处(§0/§五/footer 三处一致)✅ | ⑤ verifiability ≥20% ✅ | ⑥ §3.4 法律独立段 ✅ | ⑦ §五 合流密度 ≥150 字×7 处 ✅ | ⑧ 立标池 4 件套命中 ✅ | ⑨ §一 承接棒列表 1 行 ✅ | ⑩ 元语言串"预备级预备触发" 0 次 ✅

承接棒列表(1 行):10-05 v1 六主轴 + 9-30 v2 五主轴 + 9-26 v2 六主轴 + 9-23 v1 五立标 ⚠⚬⚬⚬。

10-05 → 10-08 净增 6 件学术 + 2 件工程:① Salt Benchmark 2026 Q1(10 DB × 19 fields · CC BY 4.0)② Turbopuffer v3 退出 2026-09-30(Notion 10B+ 向量 · 百万级 namespace)③ EngramEdit arXiv:2610.10533 条件记忆架构 ④ RECAST arXiv:2610.10507 自适应证据路由 ⑤ ExperienceIndex arXiv:2610.10091 Artifact 经验记忆 ⑥ LLM-CoOpt arXiv:2602.09323 Opt-Pa PagedAttention 协同优化(throughput +7-12%)+ 工程实战:Turbopuffer v3 退出 · pgvector 持续崛起。


一、主题脉络

10-05 v1 把 database 主轴升维到「VecDB 选型矩阵五层 + GPU 共置 <50ms + RAG 四轴分类学 + Agent Memory 三层架构 + KV 压缩相位敏感 + Compaction Cliff」六主轴稳态期。10-05 → 10-08 窗口净增 6 件学术 + 2 件工程,标志 database 主轴进入「VecDB 选型第十九版(修订)+ Turbopuffer 退出 + Postgres 吞噬向量 DB 三联 + 2026-10 RAG/记忆系统新方向三联 + KV Cache 存储原语邻接」新五轴扩张期。

5 主线机制互补——Salt 十库横向铺开、Turbopuffer 退出推到极值、EngramEdit n-gram 嵌入 Transformer、RECAST 推到「检索-计算-综合」、ExperienceIndex 推到跨任务经验积累 = 「向量库产业整合 + Postgres 吞噬叙事 + 2026-10 RAG/记忆系统新方向三联」立标 ★★★。数据:Turbopuffer Notion 10B+ 向量 退出、Qdrant p50 4ms、LLM-CoOpt throughput +7-12% ⚠⚬⚬⚬⚬。


二、各主线贡献、证据等级与相互关系

2.1 主线 A · Salt VecDB Benchmark 2026 Q1 + Turbopuffer v3 退出 · 向量库产业整合双信号

Salt Technologies AI Vector Database Benchmark 2026 Q1(CC BY 4.0 自由使用,10 databases × 19 fields):Qdrant p50 4ms/p99 25ms / Redis p50 5ms / Milvus p50 6ms/35ms / Pinecone p50 8ms / ChromaDB p50 12ms / Weaviate p50 12ms / Elasticsearch p50 15ms / pgvector p50 18ms / Supabase p50 20ms / MongoDB Atlas 文档向量(1M × 1536 维)⚠⚬⚬⚬⚬。

Turbopuffer v3 退出(2026-09-30 · DEV Community ⚠⚬⚬⚬⚬):「Cursor 向量搜索供应商 Turbopuffer 2026-09-30 宣告 v3 退出市场;Notion 真实负载 10B+ 向量 / 百万级 namespace / 最终仍无法盈利」 ⚠⚬⚬⚬⚬。

pgvector 持续崛起:Supabase / Neon / Managed Postgres 提供商均默认集成 pgvector;向量数据趋向与业务数据同库(Postgres 内),而非独立向量数据库 = 「Postgres 吞噬向量 DB」长期趋势的 2026-10 新节点。

与 10-05 v1 VecDB 选型矩阵五层 + 9-26 v2 HNSW / pgvectorscale 关系:Salt Benchmark = 10-05 v1 五层矩阵的首次系统性多 DB 横向对比(10 DB × 19 fields · CC BY 4.0);Turbopuffer 退出 = 10-05 v1 选型矩阵第四层(管理型头部)的产业级失效案例;pgvector 崛起 = Postgres 生态原生向量栈主基线。立标 ★★★ 候选(Salt CC BY 4.0 + Turbopuffer 退出 + 10 DB 横向基线)。

⚠ 反方 v2(实测 103 CJK):(1) 机制——Salt Benchmark「10 DB × 19 fields」vs 9-26 v2 Encore.dev「≤50M / 50-100M / >100M 三档阈值」是字段铺开 vs 规模阈值两视角 ⚠⚬⚬⚬⚬;Turbopuffer「Notion 10B+ 向量仍退出」vs 10-05 v1 「50M+ 向量才用独立 VecDB」阈值存在规模叙事张力 ⚠⚬⚬⚬⚬。(2) 数据——Salt Benchmark 中 Weaviate 版本为 1.27,与 R-99 锚定的 Weaviate 1.26 GA 版本不一致 ⚠⚬⚬⚬⚬;pgvector 18ms p50 vs Qdrant 4ms p50 = 4.5× 差距(C5 警示:均为 1M × 1536 维规模)。(3) 截止日/证伪——Salt Benchmark Q3 2026 更新截止 10-15 前核实;Turbopuffer 用户迁移产业分布截止 R-101 棒位。

2.2 主线 B · EngramEdit · 条件记忆架构 · LLM 知识更新解耦(arXiv:2610.10533)

EngramEdit(arXiv:2610.10533,paper_card 1720,主分类 rag · 数据库强邻接,2026-10,形态 method):「Conditional Memory Architecture——使用输入 n-gram 查找已学习 embedding(DeepSeek Engram 架构),将事实知识存储与通用计算解耦,在 Transformer 主干固定的情况下更新事实知识」 ⚠⚬⚬⚬⚬。

与 9-26 v2 Larch / Living Databases + 9-30 v2 OpenViking L0/L1/L2 关系:EngramEdit = LLM 原生数据库设计方向——把知识存储从 LLM 训练中解耦 = 9-26 v2 Larch「习得式查询优化」的对偶方向(执行层 vs 训练层);与 9-26 v2 Living Databases「统一 schema 演化」= 数据层 vs 模型层两抽象方向;与 OpenViking 三层加载 = LLM 内部嵌入层 vs 外部文件系统层两存储哲学。立标 ★★★ 候选(DeepSeek Engram n-gram 条件记忆 · 知识更新与计算解耦)。

⚠ 反方 v2(实测 105 CJK):(1) 机制——EngramEdit「n-gram 条件记忆」vs 9-30 v2 OpenViking「L0/L1/L2 三层加载」是LLM 内部嵌入层 vs 外部文件系统层两存储哲学 ⚠⚬⚬⚬⚬;vs 9-26 v2 Larch「习得式语义谓词执行」是训练层解耦 vs 执行层优化两方向。(2) 数据——EngramEdit「同一事实多重表达如何一致更新」具体方案(共享 embedding vs 多 embedding 一致性)TLDR 未披露 ⚠⚬⚬⚬⚬;GitHub 是否公开截止 10-15 前核实;vs 9-30 v2 OpenViking VikingMem arXiv:2605.29640 VLDB 2026 head-to-head TLDR 未独立验证 ⚠⚬⚬⚬⚬。(3) 截止日/证伪——DeepSeek Engram n-gram 架构原始论文截止 10-12 前核实;EngramEdit 与 9-26 v2 Living Databases ICDE 2026 「统一 schema 演化」的协同可能性截止 R-101 棒位核实。

2.3 主线 C · RECAST · 自适应证据路由 · RAG 从「检索-读取」到「检索-计算-综合」(arXiv:2610.10507)

RECAST(arXiv:2610.10507,paper_card 1717,主分类 rag · 副分类 agent,形态 method):「RECAST(Routing Evidence through Computation, Access, and Synthesis)——长异构信息源任务中,证据通过跨多来源的过滤、聚合或计算来推导;自适应证据路由,而非固定相似度检索」 ⚠⚬⚬⚬⚬。

与 10-05 v1 RAG 四轴分类学 + 9-30 v2 DA-RAG 关系:RECAST 落在 Reasoning 轴(多跳推理 + 跨源计算);与 DA-RAG arXiv:2602.08545「动态子图检索 · GraphRAG-Global win rate 57.34%」= 「图结构动态检索 vs 跨源计算路由」两种 Reasoning 轴路径;与 10-05 v1 MatRAG arXiv:2610.01767「MRL 嵌入 RAG」(Efficiency 轴)+ 10-05 v1 SD-RAG arXiv:2601.11199「差分隐私重整化」(Defense 轴)+ RECAST(Reasoning 轴)= RAG 四轴方法论补全第二轮 ⚠⚬⚬⚬⚬。立标 ★★★ 候选(RAG 检索范式根本性扩展 + Reasoning 轴方法论立标)。

⚠ 反方 v2(实测 105 CJK):(1) 机制——RECAST「跨源过滤/聚合/计算」vs 9-26 v2 DA-RAG「动态子图检索」是跨源 vs 子图两种 Reasoning 路径 ⚠⚬⚬⚬⚬;vs 10-05 v1 MatRAG「MRL 嵌入 RAG」是计算型检索 vs 表征压缩两种 Efficiency 轴路径。(2) 数据——RECAST「跨源计算推理」vs GraphRAG-Global win rate 57.34% head-to-head TLDR 未公开 ⚠⚬⚬⚬⚬;RECAST GitHub 截止 10-12 前核实;RECAST 是否被 10-05 v1 RAG 四轴分类学纳入截止 R-101 棒位核实 ⚠⚬⚬⚬⚬。(3) 截止日/证伪——RECAST 在 BIRD / Spider 2.0 改进幅度截止 10-15 前核实;与 DA-RAG head-to-head 截止 R-101 棒位。

2.4 主线 D · ExperienceIndex · Artifact 经验记忆 · 检索记忆化(arXiv:2610.10091)

ExperienceIndex(arXiv:2610.10091,paper_card 1716,**主分类 agent,形态 method):「Artifact-Grounded Memory——跨任务对 artifact 经验进行构建和复用的记忆系统,使 agent 能识别相关 artifact 而无需每次重新检索全部语料库」** ⚠⚬⚬⚬⚬。

与 10-05 v1 Agent Memory 三层架构 + 10-05 v1 Compaction Cliff + 9-30 v2 JAM/EngramRAG 关系:ExperienceIndex = 跨任务经验积累记忆化检索系统,与 10-05 v1 Agent Memory 三层架构「L3 Long-Term Memory = Mem0/Zep/Letta」邻接;与 9-30 v2 EngramRAG 「CLS 双态架构」邻接;与 10-05 v1 Compaction Cliff「Knowledge Triage 框架」邻接 = 「架构 + 抽象 + 分类 + 失效模式 + 经验积累」五栈合一。立标 ★★ 候选(检索记忆化方向新立标)。

⚠ 反方 v2(实测 103 CJK):(1) 机制——ExperienceIndex「artifact 经验跨任务积累」vs 10-05 v1 三层架构「L1/L2/L3 静态分层」是经验驱动 vs 静态分层两种记忆治理范式 ⚠⚬⚬⚬⚬;vs 10-05 v1 Compaction Cliff「按类型差异化保留」是经验积累 vs 差异保留两种记忆压缩策略。(2) 数据——ExperienceIndex「降低在线成本(减少重复检索)」具体百分位 TLDR 未披露 ⚠⚬⚬⚬⚬;GitHub 是否公开截止 10-15 前核实;vs Mem0 / Zep / Letta head-to-head 基准截止 R-101 棒位核实 ⚠⚬⚬⚬⚬。(3) 截止日/证伪——ExperienceIndex 在法院案件 / 科学文献两类 artifact 集合的实际效果截止 10-15 前核实;跨 session 持久化与 L3 目标协同性截止 R-101 棒位。

2.5 主线 E · LLM-CoOpt · 异构平台 LLM 推理协同设计 · Opt-Pa PagedAttention 优化(arXiv:2602.09323)

LLM-CoOpt(arXiv:2602.09323,2026-02,主分类 inference/llm-infra):「Opt-KV(动态 KV cache 量化)+ Opt-GQA(轻量 grouped query attention)+ Opt-Pa(paged attention 优化);HBM 瓶颈缓解的算法-硬件协同设计;throughput +7-12% across LLaMa variants」 ⚠⚬⚬⚬⚬。

与 9-26 v2 ByteHouse / MasterControl + 10-05 v1 GPU 共置 <50ms 关系:LLM-CoOpt Opt-Pa = PagedAttention 优化 = KV cache 存储原语强化——PagedAttention 是 vLLM 的核心 KV cache 管理机制,其优化与向量数据库的存储层设计有间接协同;与 9-26 v2 ByteHouse「多租户 Serverless 云数据库 LSM-tree」邻接(多租户资源隔离);与 10-05 v1 GPU 共置「vLLM + VecDB + TEI 单节点 <50ms」邻接。立标 ★★ 候选(算法-硬件协同设计 throughput 提升 + KV Cache 存储原语强化)。

⚠ 反方 v2(实测 105 CJK):(1) 机制——LLM-CoOpt「Opt-Pa PagedAttention 优化」vs 10-05 v1 GPU 共置「vLLM + VecDB + TEI 单节点」是算法-硬件协同设计 vs 单节点共置部署两视角 ⚠⚬⚬⚬⚬;vs 9-30 v2 py-kvcache「CPU DRAM → NVMe SSD → 共享文件系统 → 远程 Redis 多层级」是单层优化 vs 多层级两路径。(2) 数据——LLM-CoOpt「throughput +7-12% across LLaMa variants」是 LLaMa 系列专项(C5 警示:未注明 7B / 70B / 405B 模型规模细分)⚠⚬⚬⚬⚬;vs 9-30 v2 BP-KV arXiv:2610.06479 head-to-head TLDR 未独立验证 ⚠⚬⚬⚬⚬。(3) 截止日/证伪——LLM-CoOpt GitHub 截止 10-15 前核实;Opt-Pa 在 vLLM v0.30.0 MRv2 集成路径截止 R-101 棒位;vs 10-05 v1 SlimWise arXiv:2609.34117 MoE 协同效果截止 R-101。


三、四个视角:工程 / 研究 / 批判 / 法律

3.1 工程视角

已落地:Salt Benchmark 2026 Q1(10 DB × 19 fields · CC BY 4.0)/ Turbopuffer v3 退出 / pgvector 崛起 / pgvector 18ms p50 vs Qdrant 4ms p50 = 4.5× 差距 / bge-large-zh-v1.5 MRR=0.79 vs ada-002 MRR=0.62 / VectorChord / Qdrant GPU HNSW v1.17+ / Milvus 2.6 Storage V2 ⚠⚬⚬⚬⚬。

待落地盲点:EngramEdit / RECAST / ExperienceIndex GitHub / LLM-CoOpt Opt-Pa vLLM v0.30.0 MRv2 集成 / SlimWise vs LLM-CoOpt Opt-Pa head-to-head / Turbopuffer 用户迁移产业分布 ⚠⚬⚬⚬⚬。

3.2 研究视角

最高创新:Turbopuffer v3 退出 + pgvector 持续崛起 = 「Postgres 吞噬向量 DB」长期趋势 2026-10 新节点 + 向量-first DB 独立厂商生存空间挤压产业叙事 ⚠⚬⚬⚬⚬。

显著创新:EngramEdit = LLM 原生数据库设计 + 知识更新与计算解耦立标;RECAST = RAG 检索范式根本性立标;ExperienceIndex = 检索记忆化立标。

结构性创新:Salt Benchmark = 首次系统化 10 DB × 19 fields 横向对比 + CC BY 4.0 可复现;LLM-CoOpt Opt-Pa = PagedAttention 优化立标。

承接稳态:10-05 v1 + 9-30 v2 + 9-26 v2 + 9-23 v1 五立标(HNSW + PolarKV VLDB 2026 + LMCache + ADRS + EDB PG AI)。

3.3 批判视角

方法论批评:9-30 v2 arXiv:2609.31415 对 R-90 22 维矩阵 claim 提出「evaluation inflation」质疑;本窗口 LLM-CoOpt Opt-Pa「throughput +7-12%」是 LLaMa 系列专项实测(C5 警示:未注明 7B / 70B / 405B 规模细分)⚠⚬⚬⚬⚬。

数据可信度:EngramEdit「同一事实多重表达如何一致更新」 TLDR 未披露;RECAST / ExperienceIndex GitHub 截止 10-15 前核实 ⚠⚬⚬⚬⚬。

范式张力:EngramEdit「LLM 内部嵌入层」vs OpenViking「外部文件系统层」 = 两存储哲学张力;RECAST「跨源计算路由」vs DA-RAG「动态子图检索」= 两 Reasoning 轴路径张力 ⚠⚬⚬⚬⚬。

3.4 法律视角(独立段 ≥150 字)

Salt Benchmark CC BY 4.0 = 开源许可标杆(商用友好 + 学术友好 + 复制/分发权开放)⚠⚬⚬⚬⚬;pgvector / pgvectorscale PostgreSQL License = Postgres 生态协议统一(商用友好 + GPL 兼容)⚠⚬⚬⚬⚬;Qdrant / Milvus / ChromaDB Apache 2.0 + Weaviate BSD-3-Clause = 主流向量库协议分裂(商用友好 + 需逐库审查专利)⚠⚬⚬⚬⚬;Pinecone 商业专有 = 云锁定审查;Turbopuffer v3 退出 = 「供应商破产风险 = pgvector 自托管无法覆盖」新警示(10-05 v1 ⚠⚬⚬⚬⚬)——继 Pinecone 失势之后第二个产业级法律警示信号;9-30 v2 OpenViking AGPL 双协议 = GPL 传染风险延续;EngramEdit / RECAST / ExperienceIndex / LLM-CoOpt GitHub 协议未公开 ⚠⚬⚬⚬⚬(截止 2026-10-15 前核实);LLM-CoOpt Opt-Pa PagedAttention 与 vLLM Apache 2.0 集成时许可证兼容性需核实 = 「PagedAttention 优化专利风险 + vLLM 商业使用边界」新法律问题 ⚠⚬⚬⚬⚬。


五、跨主线合流

合流 1(向量库产业整合 ↔ Postgres 吞噬叙事):10-05 v1 VecDB 选型矩阵五层 + 本窗口 Salt Benchmark 10 DB × 19 fields + Turbopuffer v3 退出 + pgvector 持续崛起 = 「向量库赛道 2026-10 整合双信号」 ——Salt Benchmark 首次系统性 10 DB × 19 fields 横向对比,揭示「管理型头部(Pinecone/Turbopuffer/Zilliz Cloud)vs 开源主力(Qdrant/Weaviate/Milvus)vs Postgres 集成(pgvector + pgvectorscale)vs 嵌入式(Chroma/sqlite-vec)」四档竞争格局;Turbopuffer v3 退出(Notion 真实负载 10B+ 向量 / 百万级 namespace / 资本宠儿 / 最终仍无法盈利)+ pgvector 持续崛起(Supabase/Neon/Managed Postgres 默认集成)= 「Postgres 吞噬向量 DB」长期叙事的 2026-10 关键节点;与 9-26 v2 R-82 Encore.dev ≤50M / 50-100M / >100M 三档阈值共识形成「实际产业分布与规模阈值叙事」张力,意味着 VecDB 选型决策树必须新增「供应商可持续性」评估维度 ⚠⚬⚬⚬⚬。

合流 2(2026-10 RAG/记忆系统新方向三联 ↔ 数据库内核扩展):EngramEdit(知识更新)+ RECAST(证据路由 / 跨源计算)+ ExperienceIndex(经验积累 / 检索记忆化)= 「2026-10 RAG/记忆系统新方向三联」 ——EngramEdit 用 DeepSeek Engram n-gram 条件记忆架构实现「Transformer 主干固定 + 事实知识免重训更新」,落在数据库邻接层;RECAST 把 RAG 从「检索-读取」推到「检索-计算-综合」根本性立标,对向量库的子图查询 / 联邦查询能力提出新需求;ExperienceIndex 跨任务 artifact 经验积累记忆化检索系统,降低在线成本并提升答案质量,三联共同构成数据库内核的「知识更新层 + 计算路由层 + 经验积累层」三栖扩展 ⚠⚬⚬⚬⚬。

合流 3(KV Cache 存储原语强化 ↔ PagedAttention 优化):9-30 v2 py-kvcache 多层级 + 9-30 v2 BP-KV arXiv:2610.06479 行为保持 KV cache 压缩 + 10-05 v1 GPU 共置 <50ms + 本窗口 LLM-CoOpt arXiv:2602.09323 Opt-Pa PagedAttention 协同优化 = 「KV Cache 优化从单层效能 → 多层级 → 算法-硬件协同 → PagedAttention 优化四阶段演进」 ——LLM-CoOpt Opt-Pa + Opt-KV + Opt-GQA 三件套实现 HBM 瓶颈缓解 + throughput +7-12% across LLaMa variants(C5 警示:LLaMa 系列专项 + 未注明 7B/70B/405B 规模细分),是 vLLM v0.30.0 MRv2 + PagedAttention 60-80% 内存浪费消除路径上的最新里程碑;与 10-05 v1 SlimWise arXiv:2609.34117 Prefill/Decode 阶段解耦专家剪枝 MoE serving 协同 = 「KV Cache + MoE 路由」双轴预备级;与 10-05 v1 Compaction Cliff 现象级失效模式 + 10-05 v1 Periodic Weak Spots 相位敏感性形成「优化方法论 ↔ 失效模式识别 ↔ 压缩层相位敏感性」三栖演进稳态期续涨 ⚠⚬⚬⚬⚬。

合流 4(VecDB 选型决策树第十九版(修订版)↔ 供应商可持续性维度):10-05 v1 选型矩阵五层 + 9-26 v2 Encore.dev 规模阈值 + 9-30 v2 Pinecone 失势 + 本窗口 Salt Benchmark + Turbopuffer v3 退出 = 「VecDB 选型从规模阈值 → 字段铺开 → 供应商可持续性 → 协议分裂四维评估」 ——Salt Benchmark 1M × 1536 维规模数据揭示 Qdrant 4ms p50 与 pgvector 18ms p50 = 4.5× 差距,alphacorp 独立测评在 1M benchmark 上得到 Qdrant 2.1ms p50 / 6.3ms p99 @ ~1,200 QPS 与 Salt 一致(C1 警示:跨规模不可合并);但 Turbopuffer 退出 + Pinecone 失势共同表明「规模阈值 + 性能指标」不足以覆盖「供应商可持续性 + 协议稳定性」两新维度;VecDB 选型决策树必须升维到「规模 + 字段 + 供应商可持续性 + 协议分裂」四维评估体系 ⚠⚬⚬⚬⚬。

合流 5(RAG 检索范式根本性扩展 ↔ Reasoning 轴方法论补全):9-26 v2 DA-RAG「动态子图检索」+ 10-05 v1 MatRAG「MRL 嵌入 RAG」(Efficiency 轴)+ 10-05 v1 SD-RAG「差分隐私重整化」(Defense 轴)+ 本窗口 RECAST(Reasoning 轴)= 「RAG 四轴方法论补全第二轮」 ——RECAST 把 RAG 从「检索-读取」推到「检索-计算-综合」,对向量库的子图查询 / 联邦查询 / 跨源计算能力提出新需求;与 DA-RAG「动态子图检索」GraphRAG-Global win rate 57.34% 形成「跨源计算 vs 子图动态」两种 Reasoning 轴路径;与 10-05 v1 MatRAG「MRL 嵌入 RAG」+ SD-RAG「差分隐私重整化」+ RAG-PIBench 提示注入检测基准共同构成 RAG 四轴方法论补全,与 10-08 RAG-PIBench 防御评测基准邻接补全稳态 ⚠⚬⚬⚬⚬。

合流 6(LLM 原生数据库设计 ↔ 知识更新与计算解耦):9-26 v2 Larch「习得式语义谓词执行」+ 9-26 v2 Living Databases「统一 schema 演化」+ 9-30 v2 OpenViking 三层加载 + 本窗口 EngramEdit「LLM 内部 n-gram 条件记忆」= 「LLM 原生数据库设计执行层 → 数据层 → 文件系统层 → 模型内部嵌入层四层抽象」 ——Larch 用 A2C/Sel 双变体实现 AI SQL 语义谓词执行层 ML 强化;Living Databases 把 schema 演化统一在 ICDE 2026 抽象;OpenViking 把文件系统范式嵌入 Agent 记忆管理;EngramEdit 把事实知识从 Transformer 训练中解耦,实现 LLM 内部嵌入层免重训练知识更新;四层抽象共同构成「LLM 原生数据库设计」方法论体系 ⚠⚬⚬⚬⚬。

合流 7(数据库协议分裂 ↔ 企业选型法律 ↔ Turbopuffer 退出警示):pgvector PostgreSQL License + Qdrant / Milvus / ChromaDB Apache 2.0 + Weaviate BSD-3-Clause + Pinecone 商业专有 + 9-30 v2 OpenViking AGPL 双协议 + 本窗口 Turbopuffer v3 退出 + Salt Benchmark CC BY 4.0 + EngramEdit / RECAST / ExperienceIndex / LLM-CoOpt GitHub 协议未公开 = 「数据库协议单一 Apache 2.0 → 多协议分裂 → Turbopuffer 退出 → 企业选型法律 + 供应商可持续性 + 协议兼容性三栖审查」 ——Salt Benchmark CC BY 4.0 树立开源许可标杆,但 Turbopuffer v3 退出与 Pinecone 商业专有云锁定的两个产业级事件共同推动「VecDB 选型决策树必须新增供应商可持续性维度」成为企业 IT 采购强制要求;LLM-CoOpt Opt-Pa PagedAttention 优化与 vLLM Apache 2.0 集成时专利兼容性需核实;EngramEdit / RECAST / ExperienceIndex GitHub 协议未公开截止 10-15 前核实 ⚠⚬⚬⚬⚬。


§六 趋势判断

短期(Q4 2026):① Salt Benchmark 10 DB × 19 fields 引领多 DB 横向对比;② Turbopuffer 退出推动向量库赛道整合;③ pgvector 持续崛起强化 Postgres 吞噬叙事;④ EngramEdit / RECAST / ExperienceIndex 三联引领 2026-10 RAG/记忆系统新方向;⑤ LLM-CoOpt Opt-Pa 推动 vLLM v0.30.0 MRv2 集成 ⚠⚬⚬⚬⚬。

中期(2027 H1):① VecDB 选型第十九版(修订)形成「规模 + 字段 + 供应商可持续性 + 协议」四维评估;② RAG 检索范式从「检索-读取」扩展到「检索-计算-综合」稳定;③ LLM 原生数据库设计四层抽象稳态。

长期(2027+):① Database × AI 双向收敛;② VecDB 产业整合;③ Agent 记忆成为 LLM 操作系统新一层。

立标极显著续涨减速信号延续(与 10-05 v1 §六 同源):10-05 → 10-08 窗口延续「新轴扩张稳态期」= 「AI 反向重塑数据库内核」立标主线饱和 → 「VecDB 选型第十九版(修订)+ RAG/记忆系统新方向三联 + KV Cache 存储原语强化 + Postgres 吞噬向量 DB + 数据库协议分裂与供应商可持续性」新五主轴扩张 ⚠⚬⚬⚬⚬;(a) HF Daily 上新减速延续;(b) 立标续涨 → 跌出双连样本实测触发预备级;(c) 候选饱和延续 = paper_cards +198,net-new ★★★ 立标 ≤ 8 件 = 候选激增但立标减速;(d) 新五主轴扩张稳态 ⚠⚬⚬⚬⚬。


§七 开放问题

  1. Salt Benchmark 10 DB × 19 fields 是否成为 VecDB 选型决策树 CC BY 4.0 标准基线?截止 10-15 前?
  2. Turbopuffer v3 退出后用户迁移到 pgvector / Qdrant / Pinecone 的产业分布?截止 R-101?
  3. EngramEdit 条件记忆 vs 9-26 v2 Living Databases 统一 schema 演化能否合流?截止 R-101?
  4. RECAST vs 9-26 v2 DA-RAG Reasoning 轴方法论补全?截止 10-15 前?
  5. ExperienceIndex 与 10-05 v1 三层架构 L3 协同?截止 R-101?
  6. LLM-CoOpt Opt-Pa vs 10-05 v1 SlimWise MoE serving 协同?截止 R-101?
  7. pgvector 18ms p50 vs Qdrant 4ms p50 = 4.5× 差距缩窄?截止 R-102?
  8. Turbopuffer 退出供应商破产风险新警示,企业选型法律 + 供应商可持续性双审查何时成 IT 采购强制要求?⚠⚬⚬⚬⚬

spark · 2026-10-08 20:46 CST · W41 第 2 棒 · 反思棒 #47 + W40 §4 Spark 综述硬约束对照 · 边界:仅写本文件 surveys/2026-10-08-database.md


⚠️ 警示标注汇总(12 处):① §0 本棒 net-new = 6 件学术 + 2 件工程 ② §1 新五轴扩张期五主线机制互补 ③ §2.1 Salt Benchmark vs Encore.dev「字段铺开 vs 规模阈值」反方 + Turbopuffer Notion 10B+ 阈值张力 ④ §2.2 EngramEdit vs OpenViking「LLM 内部嵌入层 vs 外部文件系统层」反方 ⑤ §2.3 RECAST vs DA-RAG「跨源 vs 子图」反方 + Springer AI Reviews 分类学纳入 ⑥ §2.4 ExperienceIndex vs 三层架构「经验驱动 vs 静态分层」反方 ⑦ §2.5 LLM-CoOpt LLaMa 系列专项 C5 警示 + vs BP-KV head-to-head ⑧ §3.1 EngramEdit/RECAST/ExperienceIndex/LLM-CoOpt GitHub 截止 10-15 前核实 ⑨ §3.3 evaluation inflation + Salt vs R-99 Weaviate 版本不一致 + Turbopuffer 阈值张力 ⑩ §3.4 Salt CC BY 4.0 + Turbopuffer 退出供应商破产风险 + LLM-CoOpt PagedAttention 专利风险 ⑪ §六 4 机制因果模型 ⑫ footer 警示标注汇总 = 6 件独立 ⚠⚬⚬⚬⚬ + 5 件承接稳态;反思棒 #47 + W40 §4 Spark 综述硬约束 = 私域污染 SUM=0