database · E1 预消化简报(2026-10-11)
本次窗口:2026-10-10 20:20 ~ 2026-10-11 20:20 CST+8 检查范围:jay inbox(Oct 10-11 约35件)+ tom/flyp/spark/stephen inbox(近2天)+ paper_cards(Oct 9-11 新入池 ID1741~1755 及抽查)+ knowledge/database.md(R-101 沿革锚定) E1轮次:database主题第一百零三次预消化
〇、检查过的来源清单
| 来源 | 文件 | 时间 | DB相关性 |
|---|---|---|---|
| jay/inbox | 2026-10-11T1105-database-backend-cloudnative-csdn.md |
Oct11 11:05 | 🟢 核心:Vector DB Benchmark 2026(pgvectorscale 11.4× vs Qdrant)、VLDB 2026 AI负载改写数据库内核、AI负载内核优化、CSDN数据库内核 |
| jay/inbox | 2026-10-11T1505-database-backend-cloudnative-csdn.md |
Oct11 15:05 | 🟢 核心:TDSQL 72.6M QphDS 登顶 TPC-DS(VLDB 2026)、Winder.ai SGLang vs vLLm 实测(间接关联) |
| jay/inbox | 2026-10-11T2105-jay-evening-five-category-briefing.md |
Oct11 21:05 | 🟢 TDSQL 72.6M QphDS(VLDB 2026)确认收录 + Qwen4-Exp/QSA 架构 |
| jay/inbox | 2026-10-11T1450-jay-engineering-filter.md |
Oct11 14:50 | 🟡 SGLang OOM Bug(#43488/#43557)、KV异构内存调度(KEEP DAC 2026)、DUAL-BLADE NVMe卸载 |
| jay/inbox | 2026-10-11T1935-jay-evening-briefing-github-hf-openmodels.md |
Oct11 19:35 | 🟡 antirez/ds4 DeepSeek V4 推理引擎(无 DB 直接增量) |
| jay/inbox | 2026-10-11-agentic-systems-vector-db-mlops.md |
Oct11 ~10:00 | 🟡 Vector DB 选型决策树更新、pgvector vs Qdrant 2026 判断 |
| jay/inbox | 2026-10-11-1001-rss-cool-papers.md |
Oct11 10:01 | 🟡 arXiv 2610.12338(VFold 跨层对称性 KV 压缩)、2610.12274(HarnessSQL)、2610.12300(稀疏检索)、2610.11922(Project Greenhouse) |
| jay/inbox | 2026-10-11-agent-rag-mlops-csdn-substack.md |
Oct11 ~12:00 | 🟡 Is Agentic RAG Worth It?(benchmark 对比,无 DB 新增量) |
| jay/inbox | 2026-10-10-database-e1prep.md |
Oct10 20:20 | 🟡 Oct10 基线:HarnessSQL / NativeScope / RetroInfer / Build26-BRK223 / pgvectorscale 471 vs Qdrant 41 |
| jay/inbox | 2026-10-10-ai-engineering-backend-db-deploy.md |
Oct10 17:35 | 🟡 RetroInfer / VectorLiteRAG / VikingRAG(已在 Oct10 E1 覆盖) |
| tom/inbox | 2026-10-11-agent-rag-longcontext-radar.md |
Oct11 ~09:00 | 🟡 Agent/RAG 雷达;无 database 直接增量 |
| tom/inbox | 2026-10-11-rag-e1prep.md |
Oct11 晚 | 🟡 RAG E1,无 database 直接增量 |
| tom/inbox | 2026-10-11-evaluation-e1prep.md |
Oct11 晚 | 🟡 Evaluation E1,无 database 直接增量 |
| tom/inbox | 2026-10-11-0900-hf-daily-2026-10-11.md |
Oct11 09:00 | 🟢 HF 每日,无 DB 新增量 |
| flyp/inbox | 2026-10-11-multimodal-e1prep.md |
Oct11 晚 | 🟡 Multimodal E1,无 database 直接增量 |
| flyp/inbox | 2026-10-10-1550-flyP-critical-read-OneSearch-VL-unified-multimodal-deep-research-agent.md |
Oct10 15:50 | 🟡 多模态研究 Agent,无 database 直接增量 |
| spark/inbox | 2026-10-10-agent-e1prep.md、2026-10-10-llm-infra-e1prep.md 等 |
Oct10-11 | 🟡 Agent/LLM-infra E1,无 database 直接增量 |
| stephen/inbox | 2026-10-10/11-ai-industry-e1prep.md、news-x-vip-radar.md 等 |
Oct10-11 | 🟡 AI industry/radar,无 database 直接增量 |
| paper_cards | ID1741~1755(Oct 9-11 新入池) | Oct 9-11 | 🟢 确认无 database 主分类新卡;抽查含 database 标签的 ID1741(2610.12461 · agentic security · 非 DB) |
| paper_cards | 抽查 ID1736~1748(arXiv 2610 系列) | Oct 9-11 | 🟡 1736=2610.12415 / 1737=2610.12312 / 1738=2610.12085(均为 agent/rag/architecture,无 database 主分类新卡) |
| organized/queue | work-queue.md(2026-10-11 20:00) |
Oct11 20:00 | 🟢 Top 优先级:Memento 3(arXiv:2610.11794,非 database 主分类) |
一、今日该主题最重要的增量
总体判断:database 主题本轮增量密度为「偏低」。较 Oct9(R-101:Swan/RCC/WBL 三存储引擎锚 + JEVDB/galahad-kv 等8条)和 Oct10(R-102:HarnessSQL/NativeScope/RetroInfer 等4条)均显著收敛。今日有意义的 database 层增量共3条:① TDSQL 72.6M QphDS 登顶 TPC-DS(VLDB 2026 现场数据,国产数据库里程碑);② CSDN AI负载改写数据库内核(VLDB 2026 现场观察,方法论层);③ pgvector 分水岭判断(Vector DB Benchmark 2026 综合数据)。paper_cards Oct 9-11 新入池 ID1741~1755 中无 database 主分类新卡。
🟡 增量1(database 主分类):TDSQL 72.6M QphDS 登顶 TPC-DS — 国产分布式数据库里程碑(VLDB 2026 · 已收录 Oct11 T1505)
来源:jay/2026-10-11T1505-database-backend-cloudnative-csdn.md §一§✅;jay/2026-10-11T2105-jay-evening-five-category-briefing.md §3/5;VLDB 2026 Conference Program,vldb.org/2026/program.html
TLDR:腾讯 TDSQL 在 10,000 GB TPC-DS 集群配置下得分 72.6 million QphDS,比第二名高 1.81×,比第三名高 3.82×;单位成本优势比第二名低 79%、比第三名低 37%
要点: 1. 核心数据(VLDB 2026 官方会议记录): - 10,000 GB TPC-DS 集群配置:TDSQL 得分 72.6 million QphDS - 第二名 1.81× 差距;第三名 3.82× 差距 - 单位成本优势:比第二名低 79%、比第三名低 37%(per 1000 QphDS) - 核心技术:MPP 执行框架 + Forward Node 机制 + 向量化执行引擎 + 运行时 Filter 优化 2. 工程意义:国产数据库(腾讯 TDSQL)首次在 TPC-DS 公开 benchmark 上取得领先,标志国产分布式 OLAP 进入世界前列 3. 可信度:⭐⭐⭐⭐(VLDB 官方会议记录,有具体数字)
与 knowledge/database.md Oct10 基线(R-102)现有脉络的关系: - Oct10 基线锚定了 Build26-BRK223(Microsoft 官方数据库 × AI Agent 设计)和 pgvector 选型数据 - 本增量填补:TDSQL 72.6M QphDS 是 R-100 锚定"腾讯云 TDSQL-C Serverless"(Log is Database 架构案例)之后的第一个公开 benchmark 数据锚点——将国产数据库从"生产案例"升级为"benchmark 冠军" - 建议归入节:§2.1 向量数据库选型与 commoditization 共识邻接 → 在 TDSQL-C Log is Database(Oct9 R-100 工程案例锚)之后新增"腾讯 TDSQL 72.6M QphDS(VLDB 2026 · TPC-DS 10TB · 72.6M QphDS · 第二名 1.81× · 第三名 3.82× · 国产 OLAP 里程碑)"
⚠️ 警示:TPC-DS 10TB benchmark 排名具体对手未披露(第二名、第三名是谁未标注);建议 R-103 补充 VLDB 2026 官方论文或补充材料以确认对手身份
🟡 增量2(database 强邻接):AI负载改写数据库内核——VLDB 2026 现场观察(CSDN · 2026-10-02)
来源:jay/2026-10-11T1105-database-backend-cloudnative-csdn.md §一§⭐⭐⭐;https://www.ctyun.cn/developer/article/816562341011525(天翼云内核优化);需补充检索;本文核心洞察来自 CSDN 博客(2026-10-02,作者 VLDB 2026 现场参会)
TLDR:VLDB 2026 核心议题——向量检索从"辅助索引"升级为"主路径算子",AI负载的不确定性倒逼数据库内核重新设计(优化器代价模型、存储层向量列与标量列列式共存)
要点: 1. 向量检索从"辅助索引"升级为"主路径算子"(VLDB 2026 核心议题) - 方向:在 B+ 树节点上挂向量索引分片;优化器为向量检索设计专门代价模型;存储层向量列与标量列列式共存 2. AI 工作负载的不确定性 vs 传统内核的确定性假设 - 传统内核追求:确定性事务提交、确定性索引查找、确定性执行计划 - AI 负载本质:模型输出不可预测、查询模式不可预测、数据分布动态漂移 - 作者结论:内核工程师的价值反而更高——驾驭不确定性比工程化确定性更难 3. CSDN 天翼云数据库内核优化实战(ctyun.cn)(同文件 §一§⭐⭐) - 三类内核瓶颈:锁竞争(缓冲池/事务表/日志缓冲区)、写路径刷盘打断读连续性、线程调度开销 - 无锁数据结构(CAS 页表定位)+ 读写锁改良版顺序锁,读操作零锁等待 - 冷热分离实战:分区表+分层表空间+K8s 分级存储;核心表查询 1200ms→200ms(↓83%),SSD 占用 减少 80% 4. 工程建议:内核工程师主动写 AI 应用——哪怕是一个简单的 RAG 工具、一个 Agent 工作流,真实体验"查询模式完全由模型决定"的感受 5. 可信度:⭐⭐⭐(CSDN 博客,VLDB 2026 现场参会者一手观察)
与 knowledge/database.md Oct10 基线(R-102)现有脉络的关系: - Oct10 基线锚定了 Build26-BRK223(Microsoft 官方"为 AI 应用和 Agent 设计数据库")和 HarnessSQL(SQL Agent harness-native 训练) - 本增量填补:AI 负载改写数据库内核提供了内核工程师视角的认知框架——与 Build26-BRK223(系统设计者视角)和 HarnessSQL(Agent 训练者视角)共同构成"AI × 数据库"三视角(内核/系统/Agent) - §2.3 AI 重塑数据库内核范式与 Agent 记忆邻接:本增量属于方法论层面的认知重构,与 R-62 阿里云 Agentic DB(★★★★)、R-63 Oracle AI Database 26ai(★★★★)共同构成"AI 内核认知演进三锚" - 建议归入节:§2.3 AI 重塑数据库内核范式与 Agent 记忆邻接 → 在阿里云 Agentic DB + Oracle 26ai 锚之后新增"VLDB 2026 现场:向量检索升级为主路径算子 + AI负载不确定性 vs 内核确定性假设(methodology · CSDN · 2026-10-02)"
⚠️ 警示:CSDN 文章为厂商/现场观察综合稿,无独立可验证 benchmark 数据;核心判断(向量检索升级为主路径算子)需对照 VLDB 2026 官方论文集确证
🟡 增量3(database 邻接):Vector DB Benchmark 2026 — pgvector 时代翻篇(Salt Technologies · 2026-02)
来源:jay/2026-10-11T1105-database-backend-cloudnative-csdn.md §一§⭐⭐⭐;Salt Technologies AI Vector Database Benchmark 2026(2026-02,CSV/JSON 可下载);https://aiml.qa/blog/qdrant-vs-pgvector(2026-06,updated Sep 6)
TLDR:pgvector 已翻篇——pgvectorscale 将 50M 向量场景性能提升 11.4 倍,与 Qdrant/Pinecone 正面竞争;选型判断从"要不要用专用向量库"变成"你的具体规模和数据平台是什么"
要点: 1. 2026 行业共识转折点:
pgvector 时代已经翻篇——pgvectorscale 将 50M 向量场景性能提升 11.4 倍,与 Qdrant/Pinecone 正面竞争。选型判断从"要不要用专用向量库"变成"你的具体规模和数据平台是什么"。 2. 关键数据(Salt Technologies Benchmark 2026 + aiml.qa 2026-06 更新): | 维度 | pgvector + pgvectorscale | Qdrant | Milvus | Pinecone | |------|--------------------------|--------|--------|----------| | 规模天花板 | 5000万向量(可战) | 亿级 | 十亿级+ | 托管 | | p95 延迟(50M/99%recall) | 28× lower than Pinecone s1 | 4.74ms p50 | 18ms+ | 基准 | | QPS(50M) | 471 QPS | 41 QPS | 领先 | 托管 | | ACID 事务 | ✅ 完整 ACID | ❌ | ❌ | ❌ | | SQL + 向量联合查询 | ✅ via Postgres | ❌ | ❌ | ❌ | | 许可证 | PostgreSQL | Apache 2.0 | Apache 2.0 | 专有 | 3. 2026 新增标配:Hybrid Search - 纯向量检索丢失 exact-match(SKU 编号、专业术语) - 纯 BM25 丢失语义相似性 - RRF(Reciprocal Rank Fusion)融合 = 2026 生产 RAG 必选 - Qdrant/Milvus/Weaviate 均已支持 sparse+dense 混合 4. Reddit 生产实测(340M 向量): - Milvus 的 heterogeneous node 架构(ingest/query 分离)在高并发写入+检索混合场景下干扰更少 - Qdrant 同构节点在高负载写入时对查询延迟影响更大 5. 可信度:⭐⭐⭐⭐(Salt Technologies 独立 benchmark + aiml.qa 2026-09 更新;CSV/JSON 数据可下载)
与 knowledge/database.md Oct10 基线(R-102)现有脉络的关系: - Oct10 基线锚定了 aiml.qa 的 pgvectorscale 471 vs Qdrant 41 QPS 第三方实测(⚠️ D120 单一来源警示) - 本增量补强:Salt Technologies Benchmark 2026 提供了更系统的行业共识判断("pgvector 时代翻篇")——将选型讨论从"具体 benchmark 数字"升级为"行业范式转变认知" - §2.1 选型决策树第二十版确认:本增量确认 R-102 提出的"第二十版"选型树成立——pgvector 分水岭判断已获行业验证 - 建议归入节:§2.1 向量数据库选型与 commoditization 共识 → Salt Technologies Benchmark 2026 综合判断补强(pgvector 分水岭 · 行业共识)
⚠️ 警示:Salt Technologies 和 aiml.qa 的方法论透明度仍待确认;建议 R-103 核验 VectorDBBench(Zilliz 开源)是否有对应数据交叉验证
二、待核实矛盾与持续警示
⚠️ T1(持续):TDSQL TPC-DS benchmark 对手身份未披露
- 问题:TDSQL 72.6M QphDS 数据只披露了与第二名(1.81×)和第三名(3.82×)的差距倍数,未披露具体对手名称
- 风险:无法判断第二名是 Snowflake/Redshift/Databricks 等哪个系统;国产 vs 海外对比结论不完整
- 建议:R-103 检索 VLDB 2026 官方 TPC-DS 排名页面或补充材料,确认对手身份
⚠️ T2(持续,D120 重申):pgvectorscale vs Qdrant benchmark 方法论透明度
- 问题:Salt Technologies 和 aiml.qa 均未公开完整测试方法论(数据量、查询集、硬件配置细节)
- 风险:471 vs 41 QPS 的 11.4× 差距是否来自公平对比存疑(Qdrant 配置是否最优?)
- 建议:R-103 以 VectorDBBench(Zilliz 开源)在自有硬件上复测作为替代依据
⚠️ T3(持续,D121 重申):HarnessSQL(arXiv 2610.12274)preprint 阶段
- 问题:HarnessSQL 自 Oct10 R-102 以來仍是 preprint,实验规模和基线公平性未经同行评审
- 建议:R-103 核验是否有 SIGMOD/VLDB/ICDE 投稿或接收记录
三、可引用的 arXiv 号列表(本次新增)
本次(R-103)新增 arXiv
| arXiv ID | 主题 | 来源文件 | 归入章节 | 备注 |
|---|---|---|---|---|
| 无新 arXiv | 本轮 database 增量均为已有 arXiv 补强或 VLDB 2026 公开数据 | — | — | — |
沿用 arXiv(本次交叉引用但不计入新增)
| arXiv ID | 主题 | 归入章节 | 备注 |
|---|---|---|---|
| 2610.12274 | HarnessSQL · SQL Agent Harness 原生训练 | §2.2 | Oct10 R-102 主分类锚入 |
| 2505.02922 | RetroInfer · PVLDB 2026 · Microsoft Research | §2.6 | Oct10 R-102 邻接锚入 |
| 2610.12338 | VFold · 跨层对称性 KV Cache 压缩 | §2.6/§2.11 | Oct10 R-102 第三十三维候选 |
| 2610.12243 | NativeScope · 关系局部化检索 | §2.12 | Oct10 R-102 邻接锚入 |
| 2610.10845 | galahad-kv · 50M-token KV 持久化 NVMe | §2.6 | Oct9 R-101 第三十二维候选 |
| 2607.19697 | RCC · redo log 双重用途 | §2.4 | Oct9 R-101 三锚之一 |
| 2609.03209 | MasterControl Seventeen Every Time · LLM+SQL 企业分析治理 | §2.2/§2.9 | cs.DB 主分类,Oct9-10 paper_cards 入池 |
四、无显著新增量时的如实说明
本次存在有限增量:本轮共识别 3条增量(2条 VLDB 2026 现场数据 + 1条 Vector DB Benchmark 2026 行业共识),均为补强型(对 Oct9-10 基线的交叉验证或方法论补充),无 database 主分类新 arXiv 论文。
与前轮对比: - R-101(Oct9):8条增量(Swan/RCC/WBL 三存储引擎锚 + JEVDB/galahad-kv + TAPs + 天翼云/TDSQL-C 工程案例) - R-102(Oct10):4条增量(HarnessSQL 主分类 + NativeScope + RetroInfer PVLDB 2026 + Build26-BRK223) - R-103(Oct11):3条增量(均为补强型,无新 arXiv 论文)
核心判断:Oct11 是 database 主题的低产出日——所有增量均为对已有锚点的补强或行业共识验证。paper_cards Oct 9-11 新入池约40张卡中,无 database 主分类新卡(2610 系列新卡主要集中于 agentic/architecture/multimodal 方向)。
tom/flyp/spark/stephen 近2天主要覆盖 agent/RAG/multimodal/risk/llm-infra/evaluation 主题,无 database 专项条目通过其他 agent 渠道流入。
Jay · 2026-10-11 20:20 CST+8 · E1 database预消化第一百零三次 · 检查来源:jay inbox Oct10-11 约35件 + tom/flyp/spark/stephen inbox ~50件 + paper_cards ID1741~1755(约40件) + knowledge/database.md(R-102)