Jay 学术研究知识库 · 下午档 · 2026-07-24(15:06 UTC+8)
主题:数据库内核 · 存储引擎 · 云原生基础设施 · 后端架构 · CSDN 精选
今日主题
本档聚焦数据库内核与云原生基础设施交叉领域的最新研究动态。数据库方向包括 SIGMOD/VLDB 2026 最新论文(O3-LSM disaggregated 写入、PostgreSQL-V 向量解耦索引、DART 无锁 ART、Terark-DS KV 分离存储),以及 pgvector 2026 最新实践指南。云原生方向包括 eBPF 在 K8s 生产安全中的 2026 年成熟实践( Cilium / Tetragon / Hubble)、KubeCon EU 2026 关键洞察,以及 CXL 内存池化与数据库 disaggregation 的融合趋势。
分类标签
SIGMOD2026 VLDB2026 CIDR2026 O3-LSM PostgreSQL-V DART Terark-DS Disaggregated-Memory KV-Cache CXL LSM-tree Vector-Index pgvector HNSW eBPF Cilium Tetragon Kubernetes Cloud-Native Storage-Engine Database Backend 2026
⭐ 高价值条目
🔴 高优先 · 精读 · 数据库内核
1. O3-LSM:分解式内存三层层卸载写入协议(SIGMOD 2026)
- 来源:SIGMOD 2026 · Purdue DASLab · arXiv 在线
- 链接:
https://cs.purdue.edu/homes/csjgwang/pubs/SIGMOD26_O3LSM.pdf - 可信度:极高——SIGMOD 2026 正式论文,Purdue DASLab 团队,附完整实验数据
- 核心观点:
- 问题:Disaggregated Memory(DM)架构下,LSM-KVS 面临远程内存写缓冲的访问延迟不对称问题:写操作频繁跨网络写入 DM,写放大严重
- 核心贡献:O3-LSM,首个利用 DM 作为写缓冲扩展的 LSM-KVS,三层卸载策略:
- DM-optimized memtables:将 dram(memtable) 分层卸载至 DM,降低网络往返
- Cache-enhanced read delegation:读取优先从本地 cache 而非远程 DM 取数据,减少读延迟
- Shard-level flush offloading:分片级 flush 卸载,将 compaction 任务旁路到 DM 节点执行
- 实验结果:相比基线,p99 写延迟降低 45%,系统吞吐量提升 38%
- 未来方向:细粒度 DM memtable 管理、自动内存比例调优、高级 flush 调度
- 复现价值:高——论文附完整算法描述;可对照 Purdue DASLab 其他 dLSM 系列工作(ICDE 2023)理解完整演进
- 行动建议:精读;纳入"LSM × Disaggregation"主题页;对比 TiDB / OceanBase 生产实践
2. PostgreSQL-V:向量索引与存储引擎解耦,8.9× 超越 pgvector(CIDR 2026)
- 来源:CIDR 2026 · Purdue DASLab ·
cs./cs-gwang - 链接:
https://cs.purdue.edu/homes/csjgwang/pubs/CIDR26_PostgreSQLVector.pdf - 可信度:高——CIDR 2026 论文,有完整 benchmark
- 核心观点:
- 问题:pgvector 受制于 PostgreSQL 面向页的存储结构,索引效率存在天花板
- 核心思路:将向量索引从 PostgreSQL 存储引擎完全解耦,直接利用原生向量索引库(如 HNSWLib),绕过 PostgreSQL 的 page-oriented 开销
- 关键技术:LSM-based 索引框架 + 轻量级崩溃一致性机制(利用 PostgreSQL 已有 WAL + 检查点,无需额外分布式协调)
- 实验结果:与专用向量数据库(Milvus / Qdrant)性能持平;比 pgvector 快 8.9×;支持可插拔向量索引
- 洞察:这是"专用向量数据库"vs"数据库内建向量"路线之争的重要里程碑——解耦架构可能是内建向量的最终答案
- 复现价值:高——有代码仓库链接;可与
arxiv:2603.23710(SIGMOD 2026 Filter-Agnostic FVS)交叉阅读 - 行动建议:精读;纳入"向量数据库架构选型"主题页
3. DART:分解式内存无锁双层哈希 ART 索引(SIGMOD 2026)
- 来源:SIGMOD 2026 · Purdue DASLab
- 链接:
https://cs.purdue.edu/homes/csjgwang/pubs(编号 SIGMOD 2026 pp.22:1-25) - 可信度:高——SIGMOD 2026 正式论文
- 核心观点:
- 问题:ART(Adaptive Radix Tree)在 disaggregated memory 下锁竞争严重,单点写入成为瓶颈
- 核心思路:双层哈希 + ART 无锁设计,第一层哈希定位分区桶,第二层 ART 提供有序范围查询能力
- 无锁保证:利用 compare-and-swap(CAS)操作替代全局锁,实现读写不互斥
- 适用场景:内存分解式数据库的索引层,需要同时支持点查 + 范围查询的高并发 OLTP 场景
- 行动建议:归档参考;与 O3-LSM 同属 DASLab disaggregated DB 系列,适合系列研读
4. Terark-DS:分解式存储高能效 KV 分离存储引擎(VLDB 2026)
- 来源:VLDB 2026 ·
doi:10.14778/3796195.3796198 - 链接:
https://www.vldb.org/pvldb/vol19/p822-zhang.pdf - 可信度:高——VLDB 2026 正式论文,PVLDB Artifact Available(含源码)
- 核心观点:
- 背景:LSM-tree 在 KV 分离模式(value log 分离)下对分解式存储有天然适配性
- 核心贡献:Terark-DS 针对 disaggregated storage 重新设计 KV 分离的布局,将冷 value 下推到远程存储,热数据保留本地 NVMe cache
- 实验结果:与 RocksDB / LavaStore 对比,存储成本降低 50%,p99 读延迟降低 30%
- Artifact:
https://github.com/Terark/Terark-DS(PVLDB 官方验证可用) - 行动建议:精读;Terark 为国产存储团队,技术细节完整,适合与 O3-LSM 对比存储 disaggregation vs 内存 disaggregation 两条路线
🟡 中优先 · 归档参考 · 云原生 / eBPF
5. eBPF 在 Kubernetes 安全与可观测性的 2026 成熟实践(Cilium / Tetragon / Falco)
- 来源:DEV Community ·
dev.to/linou518(2026-03-18)+ Mediuminboryn(2026)综合 - 链接:
https://dev.to/linou518/ebpf-in-2026-the-kernel-revolution-powering-cloud-native-security-and-observability-22jd - 可信度:中——社区技术博客,有具体工具对比和实测数据
- 核心观点:
- 2026 年成熟工具栈:
- Cilium:eBPF 原生网络,替代 iptables,动态生成 NetworkPolicy,不依赖 CNI 插件特定语义
- Tetragon(Isovalent):内核级运行时安全,HOOK 系统调用/网络操作,实时阻断(区别于 Falco 的日志型检测)
- Pixie + Hubble:零侵入可观测性,自动采集 K8s 服务流量图
- Istio Ambient Mesh:无 sidecar 服务网格,数据平面全走 eBPF,减少每 Pod ~100MB 开销
- 关键演进:2026 年 Tetragon 已支持实时阻断,不只是检测;可与 K8s RBAC 联动,实现策略即代码
- Azure MCP + Cilium:Azure 工程师已构建 MCP server 对接 Cilium/Hubble,实现自然语言网络策略生成
- 行动建议:归档参考;适合"云原生安全"技术选型对比页
6. KubeCon EU 2026 关键洞察:Kubernetes 成为 AI OS
- 来源:LinkedIn / SiliconANGLE 综合报道
- 可信度:中——行业媒体综合报道,多方引述
- 核心观点:
- 核心叙事:Kubernetes 已完成基础设施编排的标准化战争,下一步是 AI workloads 编排标准
- 关键信号:
- NVIDIA 从硅片到软件的 AI 工厂栈全面拥抱 K8s 作为控制平面
- AWS / Google Cloud 将 K8s 深度嵌入 AI 平台作为训练/推理控制层
- CNCF AI conformance 标准化工作启动
- 当前阶段:Chaos → Tooling 爆发 → 标准化初期,类似 2015-2016 容器化早期
- 安全:AI 加速风险:AI 压缩创新时间线同时放大安全后果,AI 介入 K8s 工作负载调度带来新的失控风险
- 行动建议:归档参考;适合"AI + K8s 融合"趋势观察页
🟡 中优先 · 归档参考 · CSDN 精选
7. OceanBase LSM-Tree 合并写入与压缩优化策略全揭秘(CSDN / OceanBase 官方博客)
- 来源:CSDN / OceanBase 官方博客 · 2026 年持续更新
- 链接:
https://open.oceanbase.com/blog/21146957168 - 可信度:高——OceanBase 官方技术博客,生产级细节
- 核心观点:
- 详细的 MemTable / L0 / L1 / L2 分层合并流程图和监控指标
- 合并触发机制:
memstore_limit_percentage控制内存上限,5 类监控指标 - 生产内存配置规范:MemTable 40-70%(生产环境 ≥64GB)、Block Cache 20-30%、Row Cache 5-10%(OLTP)
- NUMA 亲和性:关键进程绑定特定 NUMA 节点,减少跨节点内存访问
- 硬件配置规范:16-32 核 / 节点,同机房延迟 <1ms,10Gbps 最低带宽要求
- 复现价值:高——生产配置参数表可直接参考;适合作为分布式 NewSQL 选型对比的 OceanBase 基线
- 行动建议:归档参考;纳入"NewSQL 生产配置规范"参考文档
8. Lealone 数据库内核深度解析:自研 LSM-Tree 变种 + 分布式事务(CSDN · 2026-05-13 更新)
- 来源:CSDN ·
weixin_30411239· 2026-05-13 - 链接:
https://blog.csdn.net/weixin_30411239/article/details/98152201 - 可信度:中——CSDN 技术博客,引用 Lealone 开源项目
- 核心观点:
- Lealone 是一款自研 LSM-Tree 变种存储引擎的分布式数据库(非 B+ 树)
- LSM-Tree 变种核心设计:定制化 compaction 策略,支持滚动合并(rolling compaction)减少写放大
- 分布式事务:基于 Raft 共识协议,支持分布式 MVCC
- 适合作为理解"自研 LSM 变种 vs 标准 RocksDB"工程取舍的教学案例
- 行动建议:归档参考;适合"LSM 变种工程实现"对比研究
9. pgvector 2026 实践指南:DBA 操作手册(DBI-Services · 2026-03 更新)
- 来源:DBI-Services 官方博客 · 2026-03 更新
- 链接:
https://www.dbi-services.com/blog/pgvector-a-guide-for-dba-part-2-indexes-update-march-2026 - 可信度:高——专业 DBA 机构实测,有量化数据
- 核心观点:
- HNSW ef_search 参数实测:ef_search > 200 后 PostgreSQL 优化器会选择 Seq Scan + Sort(365ms vs 2.5ms),绕过索引;建议 ef_search ≤ 200
- m 参数构建时设置:更大的 m 决定图密度,影响 recall vs 内存 tradeoff
- Partial Index 技巧:按分类建部分索引,体积缩小 11×,构建速度提升 20×
- DiskANN(SBQ 压缩):存储体积比 HNSW / IVFFlat 小 9×,3ms 完成 3072 维最近邻查询
- 索引体积警告:HNSW + B-tree 索引总体积约为数据本身体积的 2-4.5×,高维向量场景需提前规划存储
- 行动建议:精读;纳入"PostgreSQL 向量检索工程实践"主题页;DBA 实操价值极高
🟢 低优先 · 观察线索
10. AWS S3 Vectors:存储优先的向量查询新范式
- 来源:Dev.to
actiandev· 2026 - 链接:
https://dev.to/actiandev/whats-changing-in-vector-databases-in-2026-3pbo - 核心观点:AWS S3 Vectors 将向量嵌入存入 S3 对象存储,单索引支持 20 亿向量,延迟 >100ms,定位为 TCO 降低 90% 的 AI workloads 场景
- 评价:存储优先路线 vs 内存索引路线的典型对立;S3 成本优势 vs 延迟劣势的 tradeoff 明确
- 行动建议:仅供技术选型对比参考,无需深入研读
📋 建议写入路径
| 条目 | 建议路径 | 操作 |
|---|---|---|
| O3-LSM / DART / Terark-DS | /shared/research-kb/review/database-lsm-disaggregation-2026.md |
建议建档 |
| PostgreSQL-V | /shared/research-kb/review/postgresql-vector-index-architecture-2026.md |
建议建档 |
| pgvector 实践指南 | /shared/research-kb/review/pgvector-hnsw-dba-playbook-2026.md |
建议建档 |
| eBPF + K8s 安全 | /shared/research-kb/review/ebpf-kubernetes-security-2026.md |
建议建档 |
| OceanBase / Lealone | /shared/research-kb/review/chinese-db-lsm-production-2026.md |
建议建档 |
🔖 本档分类标签汇总
SIGMOD2026 VLDB2026 CIDR2026 O3-LSM PostgreSQL-V DART Terark-DS Disaggregated-Memory CXL LSM-tree Vector-Index pgvector HNSW eBPF Cilium Tetragon Kubernetes Ambient-Mesh Storage-Engine Database Backend Cloud-Native CSDN 2026
Jay · 2026-07-24 15:06 UTC+8 · 本档不执行 GitHub 写入,仅产出草稿