📚 Jay 研究简报 · 2026-08-09
本简报覆盖 2026-08-03 ~ 2026-08-09 期间数据库、后端、云原生领域高价值学术论文与工程文献,按类别整理。
🗄️ Database
⭐ 高价值条目
1. Token-Native Storage: Read and Write in your Agent's Language
- arXiv: 2608.02376 · cs.DB / cs.CL / cs.IR
- 作者: Kumar Shivendu(署名)
- 发布时间: 2026-08-03(v2 2026-08-06)
- 核心观点:
- 当前数据库和搜索引擎仍以 UTF-8 存储文本,但 Embedder、Reranker、LLM Agent 均以 Token ID 工作,每次读取都需字符→Token 转换。
- 论文提出 Token-Native Storage:直接以 BPE Token ID 存储文本,跳过字符编码。
- 英文压缩率:plain uint16 打包比 UTF-8 节省 2.25×;加熵编码器达 3.30×。
- 关键发现:按频率重排序 BPE 编号后,plain integer codec(StreamVByte)解码速度比熵编码快 ~7×,且压缩率几乎相当。
- 核心主张:Tokenizer 标准化(类比 ASCII/UTF-8),不同模型族共享词表。
- 可信度: ⭐⭐⭐⭐⭐(跨领域实验充分,6种Tokenizer + 3种语料,覆盖英语/代码/印地语)
- 后续行动: 精读;评估对现有向量数据库存储层的改造价值;关注标准化进展
- 标签:
storagetokenizationBPEvector-DBcompressionLLM-native
2. Filtered Vector Search in a Disaggregated Lakehouse: Composing Table-Format Pruning with Per-File ANN
- arXiv: 2608.05441 · cs.DB
- 发布时间: 2026-08-07
- 核心观点:
- 近似最近邻(ANN)搜索常需结合过滤条件,但通常"向量索引"和"过滤"是分开处理的。
- 论文提出在 Apache Iceberg + Parquet 湖仓架构下,将 IVF 索引嵌入 Parquet 文件 footer,通过 Iceberg 元数据层面先做文件裁剪(partition/zone-map/bitmap),再做 per-file ANN。
- 关键性能:11.5M × 768 数据集,Recall@10≥0.90,predicate 裁剪 355/444 文件后 IVF 比 brute-force 快 ~32×;JOIN 场景下加速 ~94×(14.7s → 157ms)。
- 索引构建:分布式、非破坏性(metadata-only Iceberg replace),所有引擎均可读取。
- 可信度: ⭐⭐⭐⭐(大规模真实数据集 IBM Granite embeddings,量化数据充分)
- 后续行动: 关注与现有 Lakehouse(Delta/Iceberg)生态集成可行性
- 标签:
vector-searchlakehouseIcebergANNfiltered-searchcloud-native-DB
3. RaG-Tree: Combining R-Tree and HNSW for Multi-Attribute Range Filtered Approximate Nearest Neighbor Search
- arXiv: 2608.01255 · cs.DB
- 发布时间: 2026-08-04
- 核心观点:
- 多属性范围过滤 ANN(MR-ANNS):在高维向量上同时施加多个属性范围约束,是现代 AI 应用基础操作。
- 现有方案要么依赖单一属性做剪枝,要么沿单个属性递归划分,难以利用属性间相关性。
- RaG-Tree:将 R-tree 分区层次与感知划分的 HNSW 图耦合——R-tree 做范围剪枝,HNSW 图适配局部向量分布做 ANN。
- 支持动态增量更新(incrementally update affected HNSW partitions);自适应搜索算法最小化图遍历。
- 可信度: ⭐⭐⭐⭐(多真实数据集实验,与 SOTA 基线对比充分)
- 后续行动: 关注与多租户向量数据库场景的结合
- 标签:
vector-indexHNSWR-treeMR-ANNSmulti-attributeindexing
4. Two-sided RDMA Striking Back for Disaggregated Memory Databases(Lotus)
- arXiv: 2607.26227 · cs.DB
- 作者: Hokeun Cha, Aditya Akella, Xiangyao Yu(UW-Madison)
- 发布时间: 2026-07(月度列表)
- 核心观点:
- 内存解聚合(Disaggregated Memory)数据库中,RDMA one-sided 因 API 限制无法表达复杂系统功能(饥饿预防、优先级调度、抢占);且索引需多次网络往返,造成网络放大。
- Lotus:重新挖掘 two-sided RDMA,通过 (1) 轻量级缓存 + (2) 高效批处理 解决内存服务器 CPU 瓶颈。
- 实测:YCSB 基准下吞吐量比 SOTA one-sided RDMA 方案高 8.2×,p999 尾延迟低 42.9×。
- 可信度: ⭐⭐⭐⭐⭐(系统方向顶级团队,量化数据完整)
- 后续行动: 精读;云数据库解聚合架构设计参考
- 标签:
RDMAdisaggregated-memorycloud-nativedistributed-DBperformance
5. Hiding the Cost of Querying Parquet Files in the Datapath(Oasis)
- arXiv: 2608.02268 · cs.DB / cs.AR
- 作者: Jonas Dann et al.
- 发布时间: 2026-08-03
- 核心观点:
- 云原生数据库解聚合存储与计算后,扫描操作(含存储往返)约占查询运行时长 50%;Parquet 解码是 CPU 热点(存储/网络带宽增速 > CPU 性价比增速)。
- Oasis:将 Parquet 解码卸载到 SmartNIC 网络数据通路,与 DuckDB 端到端集成。
- 效果:在最优情况下 DuckDB 查询吞吐几乎翻倍(≈2×)。
- 可信度: ⭐⭐⭐⭐(硬件加速+数据库交叉领域,工程数据充分)
- 后续行动: 关注 SmartNIC 生态和云厂商定制硬件趋势
- 标签:
SmartNICParquetduckdbhardware-accelerationcloud-native-DB
6. ACME: Automated Clause Mapping Engine for Testing Emerging Database Systems
- arXiv(待确认) · FSE 2026 Industry Track
- 场景: 数据库系统自动化测试,SQL clause 映射
- 可信度: ⭐⭐⭐(会议论文,工程导向)
- 标签:
testingDB-testingautomation
7. TYTAN: Interactive Neurosymbolic Construction of Analytic Semantic Schemas
- arXiv: 2608.06331 · cs.DB / cs.AI
- 核心观点: 自动化从关系数据库构建分析语义 Schema(实体/属性/度量识别),结合符号分析与 LLM 推理;覆盖 8 个真实+基准数据库,语义角色准确率 92-100%。
- 可信度: ⭐⭐⭐⭐
- 标签:
semantic-schemaneurosymbolicNL-to-SQLauto-schema
🔧 Backend
候选条目
8. A General Sufficient Condition for Rewriting Horn-ALCHI Atomic Queries into GQL
- arXiv: 2608.04945 · cs.DB / cs.AI
- 会议: ISWC 2026(技术报告)
- 核心观点: ISO 标准 GQL(Graph Query Language)扩展一阶逻辑含受控递归,论文引入 DL automata 形式化方法,识别出一大类可 Rewrite 为 GQL 的 Horn-ALCHI OMQs。
- 可信度: ⭐⭐⭐⭐(形式化工作,会议录用)
- 标签:
GQLgraph-DBontology-queriesknowledge-graph
9. LazyAttention: Efficient RAG with Deferred Positional Encoding
- 来源: Yongjoo Park 组 · ICML 2026
- 核心观点: RAG 检索阶段延迟位置编码以提升效率,结合语义查询优化
- 可信度: ⭐⭐⭐⭐
- 标签:
RAGattentionpositional-encodingLLM
☁️ Cloud-Native / MLOps
候选条目
10. Cloud-native and Distributed Systems for Efficient and Scalable LLMs: A Research Agenda
- arXiv: 2604.17227 · Survey/Agenda
- 核心观点: 综述云原生架构、分布式系统如何支撑 LLM scaling;覆盖计算/系统/运营挑战,微服务、容器化、编排等架构模式。
- 可信度: ⭐⭐⭐⭐(综述类,引用丰富)
- 后续行动: 适合作为背景文献参考;关注其中 resource management 章节
- 标签:
LLM-scalingdistributed-systemscloud-nativemicroservices
11. Clinical MLOps: A Framework for Responsible Deployment and Observability of AI Systems in Cloud-Native Healthcare
- DOI: 10.61927/igmin336 · IgMin Research · 2026-03
- 核心观点: 医疗 AI 系统的 MLOps 全流程框架,聚焦负责任部署、可观测性与合规性
- 可信度: ⭐⭐⭐(行业应用向,非顶会)
- 标签:
MLOpshealthcareobservabilityresponsible-AI
12. MLOps in the Cloud-Native Era — Scaling AI/ML Workloads with Kubernetes and Serverless
- 来源: Cloud Native Now · 2026-08-06
- 核心观点: Kubernetes 规模化训练 + Serverless 推理的 MLOps 实践;Kubeflow 在弹性 K8s 上的端到端 ML 生命周期管理
- 可信度: ⭐⭐⭐(行业媒体,概览性质)
- 标签:
KubernetesKubeflowserverlessMLOpsinference
13. Engineering RAG Systems for Real-World Applications: Design, Development, and Evaluation
- arXiv: 2506.20869 · SEAA 2026(LNCS 16082)
- 核心观点: 工业级 RAG 系统全生命周期工程方法论(设计/开发/评估),面向软件工程视角
- 可信度: ⭐⭐⭐⭐(会议论文,软件工程顶会子会)
- 标签:
RAGsoftware-engineeringsystem-designproduction
🔍 Reproduction / 代码复现类
候选条目
| 论文 | 复现难度 | 关键资源 | 备注 |
|---|---|---|---|
| Lotus (RDMA two-sided) | 🔴 高 | YCSB benchmark | 需 RDMA 硬件环境 |
| Oasis (SmartNIC Parquet) | 🔴 高 | DuckDB 集成代码 | 需 SmartNIC |
| Token-Native Storage | 🟡 中 | 参考实现(文中) | 概念验证可 CPU 模拟 |
| RaG-Tree | 🟡 中 | 实验代码 | 现有 HNSW 库可扩展 |
| TYTAN | 🟡 中 | 多数据库 benchmark | LLM 调用成本需考虑 |
📋 分类标签汇总
storage tokenization BPE vector-DB compression LLM-native · vector-search lakehouse Iceberg ANN filtered-search cloud-native-DB · vector-index HNSW R-tree MR-ANNS multi-attribute indexing · RDMA disaggregated-memory cloud-native distributed-DB performance · SmartNIC Parquet duckdb hardware-acceleration · semantic-schema neurosymbolic NL-to-SQL · GQL graph-DB ontology-queries knowledge-graph · RAG attention positional-encoding · LLM-scaling microservices · MLOps Kubernetes Kubeflow serverless · responsible-AI observability
📁 建议写入路径
- 本次草稿路径:
/shared/research-kb/inbox/jay/2026-08-09-research-digest.md - 后续行动建议:
- ⭐ 精读(Priority 1): Token-Native Storage(2608.02376)、Lotus(2607.26227)
- ⭐ 精读(Priority 2): Filtered Vector Search(2608.05441)、RaG-Tree(2608.01255)
- 📖 泛读存档: Cloud-native+LLM Survey、TYTAN、Oasis
- 🔬 复现评估: Token-Native Storage → 概念验证;RaG-Tree → 现有 HNSW 扩展
Jay · 2026-08-09 · 研究知识库每日简报