研究知识库简报 · 2026-09-14 · Database / Backend / Cloud-Native / Inference


📌 Database

OmniTable: 统一宽表系统 — PB 级 LLM 数据治理

  • 来源: VLDB 2026 Best Industry Paper · arxiv.org/abs/2609.11148
  • 作者: Yuzhuo Fu et al.
  • 摘要: 工业级 LLM 开发中,数据分散在数百张物理表,特征工程依赖人工编排,数据血缘几乎缺失。OmniTable 提出基于"逻辑统一、物理分离"架构的统一宽表层,四项核心贡献:① 逻辑-物理映射统一多源异构数据;② 声明式特征生命周期管理(自动依赖解析、执行规划、算子融合、血缘追踪);③ 自适应执行引擎(CPU/GPU 异构路由、UDF 级容错、自动存储布局优化);④ 混合加速数据探索(全局 ID 索引 + OLAP 卸载 + 后台物化视图,吞吐量 >20 TB/hour)。生产环境管理超过 35 PB 训练数据,人工 curation 周期大幅缩短。
  • 评价: 工业实践价值极高,VLDB Best Industry Paper 背书。宽表抽象 + 声明式特征管理契合当前 LLM 数据工程痛点,可作为 ML 数据平台架构参考。
  • 标签: database llm-infra data-engineering vldb2026
  • 行动: 精读 + 架构笔记

FFX: Factorized and Vectorized Execution 统一执行引擎

  • 来源: arxiv.org/abs/2609.09002(2026 年 6 月更新)
  • 作者: Sunny Yasser, Anas Dorbani, Amine Mhedhbi
  • 摘要: 多对多连接在欺诈检测、网络分析、推荐等场景产生大量中间结果,因子化表示(factorized representation)可压缩中间结果但与向量化执行不兼容。FFX 提出三个核心机制:① Packed Factorized Vectors 编码任意 f-tree,同时保持缓存友好布局;② Cascade Update 算子在因子化层次间传播 tuple 归约,无需重建;③ Factorized Semantic Processing 使 LLM 算子直接序列化因子化中间体并预测笛卡尔积,输出扁平 tuple 和预测结果,减少 token 开销。
  • 评价: 系统论文,因子化执行 + 向量化引擎的深度结合,对数据库执行层优化有直接参考价值。
  • 标签: database query-execution vectorization systems
  • 行动: 可精读第 5-6 节算子设计

SQLMorph: Text-to-SQL 细粒度评估指标

  • 来源: arxivlens.com · 2026-09-08
  • 作者: Maxime Lamothe, Amine Mhedhbi, Mohammadhossein Malekpour
  • 摘要: Text-to-SQL 系统评估缺乏细粒度指标,SQLMorph 提出查询变异(mutation)和细粒度指标框架,对 NL → SQL 转换质量进行多维度评测。
  • 评价: 评估方法论文,对 RAG + NLIDB 场景有参考意义。
  • 标签: database text-to-sql evaluation
  • 行动: 关注评测基准是否开源

📌 Backend / Distributed

Cost-Aware Optimization for Agentic Query Execution

  • 来源: arxiv.org/pdf/2606.03152(2026 年 6 月)
  • 摘要: 传统 SQL+LLM 混合查询预先指定完整计划后执行,Agentic Query Execution 改为单步执行、观察中间结果再决策下一步(动态工作流)。核心问题转化为 Agent 工作流优化:动态构建工作流中的运行时决策优化。SQL 负责确定性关系计算,LLM 算子仅在需要语义推理时调用。
  • 评价: 代表 NLIDB + Agent 融合趋势,动态规划思路对构建 RAG + Tool-use 系统有启发。
  • 标签: backend llm-systems agentic query-optimization
  • 行动: 结合 VikingRAG 对比读

VikingRAG: 目录感知语义数据管理

  • 来源: arxiv cs.DB 2026-09(具体编号待查)
  • 摘要: 现有 RAG 方法利用文档结构获取证据但 token 成本高。VikingRAG 整合语义和结构访问,支持结构上下文高效 + 证据缺口驱动多轮检索。核心:① 将 agentic 多轮检索轨迹物化为 experience edges,复用于相似查询;② 自适应升级机制(无需多轮时跳过)。
  • 评价: RAG 优化方向明确,experience edges 思路值得关注。
  • 标签: backend rag retrieval llm-systems
  • 行动: 与 OmniTable 数据探索思路对比

NLKGQ: 自然语言查询知识图谱

  • 来源: arxiv cs.DB 2026-09-11(new listing)
  • 摘要: 当领域词汇和语义在 OWL 本体中良好建模后,LLM 可零样本生成准确结构化查询(SPARQL),无需任务特定微调或检索增强。适用于研究人员零门槛访问特定档案元数据。
  • 评价: 本体工程 + LLM 结合的典型案例,垂直领域知识库构建可参考。
  • 标签: backend knowledge-graph llm ontology
  • 行动: 作为技术线索记录
  • 来源: arxiv.org/abs/2510.20082(2026 年 3 月)
  • 摘要: 真实场景查询优化实践调研,覆盖现实系统中的挑战与趋势。
  • 评价: 综述类,可作为查询优化知识补充。
  • 标签: backend query-optimization survey
  • 行动: 泛读

📌 Cloud-Native / Infrastructure

BUD / SuperBUD: 区块链历史访问认证

  • 来源: arxiv cs.DB 2026-09-11(new listing)
  • 摘要: 传统区块链通过维护完整状态树提供认证读取。BUD(Block Update Digest)改用写日志承诺链,SuperBUD 通过指数层级将长期未变区间压缩为短证明。摘要数量在对数级别,支持 f 个拜占庭验证器下的安全性证明。
  • 评价: 区块链存储优化方向,系统层面设计思路可参考。
  • 标签: cloud-native blockchain storage consensus
  • 行动: 作为技术线索记录

前期补充 — SIGMOD/VLDB 2026 分片与共识进展

  • Marlin BFT: 分片 BFT 协议,物联网场景下传统 quorum共识在延迟/可用性上的局限性,推动自适应分片策略研究。
  • Sublime(SIGMOD 2026 最佳论文): 推断待补充。
  • 来源: 前期搜索积累
  • 标签: cloud-native distributed-systems consensus sigmod2026
  • 行动: 待精读原论文

📌 CSDN 高价值条目

注:CSDN 本次无新增明确高价值条目。近期关注方向: - vLLM / SGLang 生产级调度与 OOM 排障 - FlashAttention kernel 集成与 FP8 量化工程 - Kubernetes + PGVector / Milvus 生产部署实践 - RAG pipeline 幻觉检测与评估方法

如发现具体文章,补入当日 reproduction 分类。


📌 Reproduction / Engineering Notes

vLLM / SGLang 生产环境命令与排障(历史积累)

  • 来源:前期草稿 engineering-filter-round* 系列
  • 核心内容:OOM 排查命令、--gpu-memory-utilization 调优、Prefill- decode 分离调度
  • 标签:reproduction vllm sglang production
  • 状态:已有积累,待整理复现步骤

📊 摘要统计

分类 条目数 重点
database 3 OmniTable ⭐、FFX ⭐、SQLMorph
backend 4 Agentic QE ⭐、VikingRAG ⭐、NLKGQ、QoW
cloud-native 2 BUD/SuperBUD、SIGMOD 分片共识
csdn 0 待补充
reproduction 1 vLLM/SGLang 排障积累

💡 本轮亮点

  1. OmniTable(VLDB 2026 Best Industry Paper) — PB 级 LLM 数据治理完整架构,35PB 生产验证,声明式特征管理理念可复用于其他大规模 ML 数据平台。
  2. FFX — 因子化执行与向量化引擎的统一,代表数据库执行层优化新方向。
  3. Agentic Query Execution — 动态工作流 + LLM 语义算子融合,体现 NLIDB + Agent 融合趋势。

建议写入路径: /shared/research-kb/inbox/jay/2026-09-14-database-backend-cloudnative-inference.md 状态: 草稿完成,待人工审核后合并。