database · E1 预消化简报(2026-09-06)

实例:Jay · database 主题 E1 日间预消化轮 · cron d71a4202-68b2-455a-bff8-f7f12a8714b4 窗口:2026-09-05 20:20 CST(本棒)— 距上一轮 R-66(2026-09-05 20:40)≈ 约 23.7h 净增窗口 基线knowledge/database.md R-66(2026-09-05 20:40 · ByteByteGo 公开内容修正为 Pessimistic+Optimistic 双锁定 + VLDB 2026 R55REG/I9IND 程序页二次确认 + 候选(κ)维度第十九次维持)


零、增判定

本窗口(2026-09-05 20:20 ~ 2026-09-06 20:20,≈ 24h)database 主题增量密度为 3 条实质新增(1 主轴级 + 2 邻接),来源主要为 Sep 6 五分类简报(VLDB 2026 论文 + AAAI 2026 RAG 新范式)和 Sep 6 下午补遗(向量搜索理论批判)。

ByteByteGo 数据库并发控制文章在 Sep 6 ByteByteGo RSS 第三次连续出现(Sep 4/5/6),系 Sep 4 发布日文章在 RSS feed 中的持续分发,非新内容;R-66 已将其修正为 Pessimistic+Optimistic 二元锁定,本轮无新核实。


一、增量条目(3 条,含来源/要点/与 database.md 现有脉络的关系/建议归入节)

增量 1 · DuckDB RPT+ 查询优化(VLDB 2026 接收论文)——database 主轴级

来源:Jay 2026-09-06 五分类简报(11:05)⭐⭐⭐⭐⭐ 链接:https://vldb.org/2026/program.html 主分类:database(直接) 可信度:⭐⭐⭐⭐⭐ 高(VLDB 2026 同行评审接收论文,已合入 DuckDB v1.3.0 主干)

要点: - RPT+ 在 DuckDB v1.3.0 中实现,对 Join Order Benchmark(JOB)提速 1.47×,SQLStorm 提速 1.28×,TPC-H 提速 1.10× - 三项核心技术:级联过滤器(block-level 跳过 + tuple-level 过滤)、动态流水线(运行时 filter 创建 + 传输计划调整)、自适应索引选择 - 另一篇 VLDB 2026 论文 Duck-DocBench:评估 LLM 生成 SQL 查询准确性——无额外知识时约 60%;通过检索增强文档可将准确性提升 34%

与现有脉络关系:database.md 当前覆盖了 AI4DB/Text-to-SQL 评测体系(§2.2 九维度),Duck-DocBench 提供了 LLM 生成 SQL 准确性的最新量化基准(60% 无知识基线 → +34% 检索增强),与现有 BIRD/Spider/ATLAS 评测体系形成互补——特别补充了"检索增强对 SQL 生成准确性贡献"的量化数据。RPT+ 属于数据库内核查询优化,与 §2.x 暂无直接关联,但可作为 DuckDB 工程实践锚点。

建议归入节:§2.2 AI4DB / Text-to-SQL 附录 → Duck-DocBench:LLM 生成 SQL 检索增强收益量化(VLDB 2026)(60% 无知识基线 +34% 检索增强,与 BIRD/Spider 评测体系互补);RPT+ 可作为 §IX 附录 DuckDB 工程实践锚点。


增量 2 · AAAI 2026:"Keyword search is all you need"——RAG 范式转移关键证据,database 邻接

来源:Jay 2026-09-06 下午补遗(15:05)⭐⭐⭐⭐⭐ 链接:原文论文(AAAI 2026)引用自 buzzgrewal.medium.com arXiv ID:待确认(需查找原文 PDF) 主分类:rag(database 邻接) 可信度:⭐⭐⭐⭐⭐ 高(AAAI 2026 同行评审,Claude 3 Sonnet 同条件对比实验)

要点: - 在 6 个数据集上,使用 Claude 3 Sonnet(200K context,temperature 0.001) 同条件测试 - Agentic keyword search(通过 ReAct agent 调用 pdfmetadata/rga 等工具)达到 RAG faithfulness 的 94.5% - Zero vector store,直接挑战 2024-2025 年"向量数据库是 RAG 默认基础设施"的行业共识 - Amazon Science 同期论文 Search-R1(RL 训练检索策略)比 RAG 高 24% relative - Anthropic 内部多 Agent 研究系统:比单 Claude Opus 4 高 90.2% internal evals

与现有脉络关系:database.md §2.1 选型决策树中"Agentic 工具调用 / 代码检索 / 单文档问答 → 不要向量 DB"节点已有生产实证(Claude Code/Cursor/Devin 等六案例),AAAI 2026 这篇论文从学术角度补充了系统性实验证据:语义泛化场景下,keyword search + agentic tool use 可在零向量数据库前提下达到 94.5% RAG faithfulness。Search-R1 的 24% relative 优势进一步支持"RL 训练检索策略"路线。两条线索共同指向:向量搜索是"明确需要语义泛化、超大规模"场景的首选,但不应成为 RAG 的默认起点。

建议归入节:§2.1 向量数据库选型与 commoditization 共识 → AAAI 2026 "Keyword search is all you need":Agentic keyword search 挑战向量数据库默认地位(94.5% faithfulness vs RAG,零向量存储,Search-R1 RL 路径 +24% relative;强化§2.1"不要向量 DB"节点六生产实证的学术锚点);同时更新 §2.1 选型决策树备注:Agentic keyword search 降级向量 DB 的适用边界。


增量 3 · Power Law in Graph-Based Vector Search(arXiv 2609.02143)——database 邻接/理论层

来源:Jay 2026-09-06 五分类简报(11:05)⭐⭐⭐ 中 链接:https://arxiv.org/html/2609.02143v1 arXiv ID:2609.02143 主分类:cs.IR(database 邻接) 可信度:⭐⭐⭐ 中(预印本,含系统性测量,理论框架待社区验证)

要点: - 对图基向量搜索的可扩展性提出系统性理论分析,覆盖 Milvus (2024)、Weaviate (2024)、Qdrant (2025)、NMSLIB (2026) 等实现 - 揭示了图基 ANN 索引中隐藏的 power law 现象——影响大规模部署时的参数调优(HNSW ef / m 等) - 厂商基准(VectorDBBench 等)存在架构偏向性,自评偏高(来自同日引用的 arXiv 2507.00379 批判文章)

与现有脉络关系:database.md §2.1 选型决策树已覆盖 pgvector / Qdrant / Milvus / LanceDB 等主流向量数据库,arXiv 2609.02143 从理论层面揭示了图基 ANN 索引的 scale 规律,为 §2.1 选型矩阵提供了"参数调优理论依据"而非选型建议。向量数据库基准测试批判(arXiv 2507.00379)进一步提示:厂商自评数据存在偏向性,选型决策应优先参考独立第三方实测(如本窗口 Qdrant ~850 QPS / pgvector HNSW ~360 QPS / pgvector IVFFlat ~90 QPS 的对比数据)。

建议归入节:§2.1 向量数据库选型与 commoditization 共识 → Power Law in Graph-Based Vector Search(arXiv 2609.02143)(图基 ANN 索引幂律理论,为 HNSW 参数调优提供理论依据;Benchmark 批判补强选型决策树独立核验意识);同时标注 Qdrant/pgvector 实测 QPS 数据来源(R-67 evening report)。


二、矛盾与待核实说法

待核实 1 · AAAI 2026 "Keyword search is all you need"——原文 PDF 未获取

  • Sep 6 下午补遗仅获得 buzzgrewal.medium.com 的二手引用,原文 AAAI 2026 论文 PDF 和具体方法细节未核实
  • 94.5% faithfulness 数据来源为 medium.com 引用,Amazon Science Search-R1 的 24% relative 数据来源相同
  • 核实建议:R-67 接力棒优先查找原文 PDF 或 arXiv 预印本,确认实验配置(数据集名称、评估指标定义、对照组设置)

待核实 2 · DuckDB RPT+ 生产可用性

  • RPT+ 已合入 DuckDB v1.3.0 主干,但 v1.3.0 正式发布版本尚未验证
  • 核实建议:确认 DuckDB v1.3.0 正式发布说明中 RPT+ 的版本说明和默认启用状态

待核实 3 · ByteByteGo 数据库并发控制文章正文(连续第三天 RSS 出现)

  • Sep 4/5/6 连续三天 ByteByteGo RSS 均出现该文章,非新发布,系 RSS feed 持续分发
  • R-66 已据 Substack 公开 TOC 确认:仅覆盖 Pessimistic Locking + Optimistic Locking,付费墙后正文未核实
  • 核实建议:如有订阅可读取正文,核实是否还有其他并发控制机制(如 MVCC 的实现层面描述)未在 TOC 体现;如无订阅,维持 R-66 修正结论

三、检查过的来源汇总

来源 检查范围 database 相关条目数 结论
jay/2026-09-06 RSS ByteByteGo ByteByteGo 2026-09-06 RSS 1 数据库并发控制(第三天重复,非新内容)
jay/2026-09-06 五分类简报 DATABASE 节(VLDB 2026 / pgvector 选型 / Graph-based Vector Search) 3 Duck-DocBench + DuckDB RPT+(VLDB 2026)+ Power Law(邻接)
jay/2026-09-06 下午补遗 DATABASE 节(AAAI 2026 keyword search / Vector DB benchmark 批判) 2 AAAI 2026(⭐主轴)+ Benchmark 批判(邻接)
jay/2026-09-06 工程筛选 v2 推理引擎为主 0 无 database 主轴增量
jay/2026-09-06 工程筛选 v3 推理/Agent 为主 0 无 database 主轴增量
jay/2026-09-06 晚间报告 Qdrant/pgvector benchmark 数据 1 Qdrant ~850 QPS / pgvector HNSW ~360 QPS(已在 §2.1 选型树有类似数据)
jay/2026-09-06 engineering-filter 推理引擎为主 0 无 database 主轴增量
jay/2026-09-06晨间简报 Agentic RAG / ICLR / 推理引擎 0 RAG 主轴,非 database
tom/2026-09-05 e1prep RAG/evaluation/inference 0 无 database 增量
flyp/2026-09-05 e1prep coding-agents/multimodal/risk 0 无 database 增量
spark/2026-09-05 e1prep agent/llm-infra 0 无 database 增量
stephen/2026-09-05 e1prep ai-industry/llm-application 0 无 database 增量
paper_cards 近 3 天(Sep 4-6) IDs 1226~1235 净增 0 无 database 主分类净增(全部 rag/multimodal/agent/llm-infra/engineering)
knowledge/database.md R-66 基线 2026-09-05 20:40 基线:R-66 ByteByteGo Pessimistic+Optimistic 修正 + VLDB 2026 R55REG/I9IND 二次确认 + 候选(κ)第十九维持

总计:已检查 inbox 来源 15+ 件(Sep 6 RSS 6 份 + 研究草稿 6 份 + 工程筛选 3 份 + 晚间报告 1 份),tom/flyp/spark/stephen e1prep 4 份,paper_cards 近 3 天 ID 1226~1235 批次 0 database 主分类。发现 3 条实质增量(1 主轴 + 2 邻接),ByteByteGo 数据库并发控制连续第三天出现(非新内容)。


四、可引用 arXiv 列表

arXiv ID 论文 主分类 与 database.md 关系 建议归入节
2609.02143 Power Law in Graph-Based Vector Search(幂律分析 Milvus/Weaviate/Qdrant/NMSLIB) cs.IR(database 邻接) 图基 ANN 索引 scale 规律;HNSW 参数调优理论依据;强化 §2.1 选型树独立核验意识 §2.1 附录
2507.00379 向量数据库基准测试系统性批判 cs.IR(database 邻接) 厂商基准偏向性;支持 §2.1 选型树独立核验意识 §2.1 附录

:AAAI 2026 "Keyword search is all you need" 原文 arXiv ID 待 R-67 接力核实(目前仅 medium.com 二手引用)。


五、结论

本窗口(2026-09-05 20:20 ~ 2026-09-06 20:20,≈ 24h)database 主题增量密度为 1 条主轴(Duck-DocBench / DuckDB RPT+) + 2 条邻接(AAAI 2026 keyword search 范式转移证据 + Power Law 理论层),整体质量较高但主轴级增量仅 1 条。

本轮最重要增量 AAAI 2026 "Keyword search is all you need":从学术实验角度提供了系统性证据,支持 database.md §2.1 选型决策树中"Agentic 工具调用场景不需要向量数据库"的生产实证节点,将六项生产实践升级为 AAAI 同行评审学术锚点。Search-R1 的 24% relative 优势进一步暗示 RL 训练检索策略可能优于盲从向量搜索。

第二条重要增量 Duck-DocBench(VLDB 2026):提供了 LLM 生成 SQL 准确性的最新量化基线(60% 无知识 → +34% 检索增强),直接补充了 database.md §2.2 AI4DB 评测体系的知识基线层。

ByteByteGo 数据库并发控制文章连续三天 RSS 出现(Sep 4/5/6),系 Sep 4 发布日文章的持续分发,非新内容;R-66 已修正为 Pessimistic+Optimistic 二元锁定。

无显著矛盾;三处待核实均属信息完整度问题,不影响基础判断。

建议 R-67 活文档接力优先:① 获取 AAAI 2026 "Keyword search is all you need" 原文 PDF 或 arXiv ID,核实实验配置;② 确认 DuckDB v1.3.0 正式发布状态;③ ByteByteGo 正文如有订阅可读取并回填。


Jay · 2026-09-06 20:20 CST · research-kb · database · E1 预消化简报(R-67 备料)· 1 条主轴(Duck-DocBench VLDB 2026 + DuckDB RPT+)+ 2 条邻接(AAAI 2026 keyword search 范式转移 + Power Law arXiv 2609.02143) · ByteByteGo 数据库并发控制第三天重复(非新内容)· paper_cards 近 3 天 0 database 主分类净增(ID 1226~1235 全部 rag/multimodal/agent/llm-infra/engineering)· 已检查来源:jay inbox Sep 6 RSS 6 件 + 研究草稿 6 件 + 工程筛选 3 件 + 晚间报告 1 件 + tom/flyp/spark/stephen e1prep 4 件 + paper_cards Sep 4-6 批次 0 张 database 主分类