Jay 中文简报 · 2026-08-18 第三次(15:05)
主题:向量数据库 2026 选型对比 · Inference Engine 生态更新 · VLDB 2026 前瞻 · Cloud-native LLM 系统研究 · RAG 架构演变 检索范围:Tavily / arXiv (cs.DB, cs.DC) / vLLM Blog / SGLang GitHub / Substack (AIxFunda, Micheal Lanham, The AI Engineer) / Google Cloud Next'26 本次覆盖:database · backend · cloud-native · csdn · reproduction
一、Database
🔷 VeloANN — SSD 驻留图索引系统,高吞吐向量 ANN 搜索
arXiv: 预印本(cs.DB)· 2026 ·
作者: Weichen Zhao, Yuncheng Lu, Yao Tian, Hao Zhang, Jiehui Li, Minghao Zhao, Yakun Li, Weining Qian
可信度: ⭐⭐⭐⭐⭐ · 有完整技术描述和架构图,专注 SSD 驻留图 ANN 工作负载
标签: vector-index SSD-resident graph-ANN HNSW disk-ANN performance-optimization
核心贡献: VeloANN 针对"数据量超出 GPU/HBM 内存但适合 SSD 场景"的向量 ANN 搜索场景,改进了两个关键瓶颈: - 局部性优化(locality optimization):改善 SSD 驻留图的 I/O 局部性,减少随机读 - 异步执行(asynchronous execution):图遍历与 I/O 操作重叠,提升整体吞吐量
与 DiskANN 的区别:DiskANN(Microsoft)侧重单机能支持数十亿向量;VeloANN 侧重"中大规模但高吞吐"场景。两者互补。
工程价值:
对于向量数据库选型,当数据量超过内存但需要在 SSD 层实现高吞吐时,VeloANN 的设计思路值得参考。其局部性优化策略可启发 Qdrant/Milvus 在 disk 模式下的配置调优。
建议后续:关注是否有开源代码发布;可作为 Milvus/Qdrant disk-index 配置的参考架构
🔷 AkasicDB — 统一 Vector-Graph-Relational DBMS,专为 Omni RAG 设计
arXiv: 2608.09214 · SIGMOD Companion '26(2026-05-31 Bengaluru)·
作者: (待补充,可通过 arXiv HTML 页面获取完整列表)
可信度: ⭐⭐⭐⭐ · SIGMOD Companion 演示论文,2026 年最新
标签: Omni-RAG vector-graph-relational unified-DB query-optimization graph-traversal
核心发现: - 现有 RAG 架构在处理"向量检索 + 图遍历 + 关系查询"混合负载时,图遍历和向量搜索都产生大量开销 - 查询优化被关系 planner 主导,缺乏对图/向量特性的感知 - AkasicDB 提出统一 DBMS 原生支持 Omni RAG 三种查询模式
技术定位:在 SIGMOD Companion '26 发表,属于演示/演示稿性质,完整系统和评估数据在 arXiv 有更详细描述。
建议后续:精读论文方法章节,关注其"relational planner 如何感知向量和图执行特性"的设计
🔷 August 2026 arXiv 新数据库论文(精选)
来源: @UFCS X (Databases Papers) · arxiv.org/list/cs.DB/current
可信度: ⭐⭐⭐ · 均为 2026-08 新提交,持续更新
本周高价值条目:
① Window Function Optimization: Co-Evaluation and Other Techniques
arxiv.org/abs/2608.06043 · Daniel Lindner, Felix Naumann, Alberto Lerner
- 标签: window-function query-optimization DBMS
- 关注理由:窗口函数是 OLAP 场景核心,co-evaluation 优化对 ClickHouse/Apache Spark 用户有参考价值
② PLB: Priority-Aware Load Balancing for Replicated Databases under Constrained Resources
arxiv.org/abs/2608.06140 · Belkis Djeffal, Pierre Bourhis, Romain Rouvoy
- 标签: load-balancing replication DBMS distributed
- 关注理由:副本数据库的优先级感知负载均衡,对分布式关系数据库的多读场景有直接工程价值
③ Filtered Vector Search in a Disaggregated Lakehouse
arxiv.org/abs/2608.05441 · Rakesh Jain, Thomas Griffin, Syed Zawad
- 标签: filtered-vector-search lakehouse disaggregated ANN table-format-pruning
- 关注理由:将表格式裁剪与每文件 ANN 索引组合,是 Iceberg + 向量搜索融合方向的最新研究
④ BEGIN AI TRANSACTION: Semantic Isolation for Durable AI Workflows
arxiv.org/abs/2608.05412 · Barzan Mozafari
- 标签: AI-transaction semantic-isolation AI-workflows
- 关注理由:Mozafari(H尾部系统在 VLDB/ICDE 活跃作者),语义隔离的 AI 工作流持久化是新方向
🔷 pgvector vs Qdrant vs Milvus — 2026 选型决策框架
来源: DEV Community · dev.to/linou518 · 2026
可信度: ⭐⭐⭐⭐ · 实用决策框架,有 SQL 示例和 benchmark 引用
标签: pgvector Qdrant Milvus vector-DB-selection RAG production
实用决策树(综合多个 2026 对比分析):
向量数量 < 500万?
→ pgvector(PostgreSQL 用户首选,无需引入新数据库)
向量数量 500万~5000万?
→ Qdrant(过滤查询性能最优,单 binary 运维简单)
向量数量 > 1亿?
→ Milvus(K8s 原生分布式,HNSW 分片能力强)
必须混合搜索(BM25 + dense)?
→ Weaviate(原生 hybrid search)
完全不想运维?
→ Pinecone / Zilliz Cloud(托管服务)
关键差异总结:
| 维度 | pgvector | Qdrant | Milvus |
|---|---|---|---|
| 定位 | PostgreSQL 扩展 | 高性能专用向量引擎 | 分布式向量平台 |
| 规模上限 | ~5000万向量 | ~5亿向量 | 数十亿+ |
| 过滤性能 | 中等(SQL 层面) | 最优(payload index) | 良好 |
| 运维复杂度 | 低(PostgreSQL 生态) | 低(单 binary) | 高(K8s 集群) |
| 生态 | LangChain/LlamaIndex | LangChain/LlamaIndex/Haystack | LangChain/LlamaIndex/Haystack |
🔷 PostgreSQL 18 vs MySQL 9.7 — 2026 全面对比
来源: kunalganglani.com/blog/postgresql-vs-mysql-2026 · 更新至 2026-08-10
可信度: ⭐⭐⭐⭐ · 2026 年最新数据,对比维度全面
标签: PostgreSQL MySQL comparison 2026 vector-search JSON
关键进展(2026):
PostgreSQL: - PostgreSQL 18.4(2026-05-11 稳定版)包含原生 JSON Table 函数 - PostgreSQL 19 Beta 1(2026-06-04)异步 I/O 子系统完整版 - pgvector 持续迭代,向量搜索仍是 PostgreSQL 生态最强武器 - 2026 Stack Overflow 调查:PostgreSQL 连续第 N 年蝉联"最受欢迎数据库"
MySQL: - MySQL 9.7.1(2026-06-16 最新版)跳跃式版本迭代(从 9.0 到 9.7 不到两年) - 新增:原生 VECTOR 数据类型(9.0)、JSON Duality Views(9.6)、JavaScript 存储过程(9.0) - MySQL 9.x vector search 能力仍不如 pgvector 成熟 - 仍然是 WordPress/LAMP 生态的首选
2026 决策建议:
新项目默认选 PostgreSQL(JSONB、向量搜索、数组类型、范围类型全面领先);
选 MySQL 的场景:WordPress、需要 Oracle 兼容性、团队 MySQL 经验极深
二、Backend(Inference / LLM Systems)
🔷 vLLM Blog — Qwen3-Omni 多模态推理工程实践
来源: vLLM Project Blog · vllm-project.github.io · 发布于 2026-06-29
可信度: ⭐⭐⭐⭐⭐ · vLLM 官方工程博客,第一手实战经验
标签: vLLM-Omni Qwen3-Omni multimodal production inference-engineering
核心内容(从 vLLM 官方博客目录提取): - Experience and Lessons Learned from Serving Multi-Stage Qwen3-Omni in vLLM-Omni(2026-06-29) - 多阶段 Qwen3-Omni 在 vLLM-Omni 中的服务实战经验 - 工程教训:多模态数据流在推理引擎内部的处理路径
其他近期 vLLM 官方博客高价值条目: - Micro-Agent: Beat Frontier Models with Collaboration inside Model API(2026-06-23):在 Model API 内部实现多模型协作以超越前沿模型 - Engineering TTS Inference in vLLM-Omni(2026-06-16):TTS 推理工程实践,支持 Qwen3-TTS、Fish Speech S2 Pro 等 - Beyond One Model: Fusion in vLLM Semantic Router(2026-06-12):语义路由器模型融合 - Session-Aware Agentic Routing(2026-06-01):长程 LLM Agent 的会话感知模型选择 - vLLM on the DGX Spark(2026-05-28):架构、配置与本地评估 - vLLM Semantic Router v0.1 Iris(2026-01-02):首个主要版本发布
工程价值: vLLM 博客是推理引擎领域的核心一手来源。Qwen3-Omni 的多模态服务经验对构建多模态 Agent 的团队有直接参考价值。
🔷 SGLang — 2026 新动态:RadixAttention 生产验证,TPUSupport,DeepSeek-V4
来源: SGLang GitHub CHANGELOG · github.com/sgl-project/sglang · 2026-07/08
可信度: ⭐⭐⭐⭐⭐ · 官方 GitHub,真实版本记录
标签: SGLang RadixAttention agentic RAG multi-turn TPU production
2026 年重要更新:
[2026/07] RadixArk + Google:SGLang 全功能 TPU 支持
- 博客:blog(SGLang RadixArk TPU 博客)
- 意义:SGLang 从 GPU 扩展到 TPU,生态大幅扩展
[2026/07] GLM5.2 NVFP4 agentic workloads:2 周内达到 500 TPS
- 博文标题:Serving GLM5.2 NVFP4 agentic workloads with SGLang
- 工程数据:500 TPS,2 周内达到生产级别
- 关键:FP4 量化 + SGLang 的吞吐优化组合
[2026/06] 新一代投机解码:DFlash + Spec V2
- 博客:blog(SGLang Spec V2 博客)
- DFlash:SGLang 的新一代投机解码算法
[2026/04] DeepSeek-V4 Day-0 支持:推理到 RL 验证
- 标题:DeepSeek-V4 on Day 0: From Fast Inference to Verified RL with SGLang and Miles
- SGLang + Miles(RL 基础设施)联合支持 DeepSeek-V4,从推理到 RL 全链路
SGLang vs vLLM 在 2026 的定位差异:
| 维度 | vLLM | SGLang |
|---|---|---|
| 核心优势 | 通用性、稳定性、GPU 覆盖最广 | RadixAttention(共享前缀复用) |
| 最佳场景 | 通用推理服务 | 多轮对话、RAG 流水线、agentic 工作流 |
| Prefix 复用 | 手动配置 | 自动 RadixAttention 复用 |
| TPU 支持 | 有限 | RadixArk + Google TPU 完整支持 |
| 社区规模 | 66k+ GitHub stars | 400k+ GPUs 生产部署 |
| 生产稳定性 | 最成熟 | 快速追赶 |
🔷 The AI Agents Stack (2026 Edition) — The AI Engineer O'Reilly
来源: Substack · The AI Engineer · Paolo Perrone · 2026-06-08(17 分钟阅读)
URL: theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
可信度: ⭐⭐⭐⭐⭐ · O'Reilly 转载,工业界工程方法论标杆
标签: agent-stack production-agent guardrails memory observability RAG MCP 2026
六大层次架构(2026 最新):
Layer 1: LLM(推理核心)
Layer 2: Tool / Action(工具执行,MCP 协议)
Layer 3: Memory(会话/长期记忆,三层架构)
Layer 4: Guardrails(Agent 专用护栏,区别于 LLM 护栏)
Layer 5: State Management(状态管理,状态图)
Layer 6: Observability + Evals(可观测性 + 评测,贯穿全栈)
2024→2026 三大变化: 1. MCP 标准化:整个 Tool 层全新,MCP 协议成为工具连接事实标准 2. 推理模型改变 Agent 自主性:推理模型(o1/o3/miniMax-m2 等)使单次调用 Agent 替代部分多步链 3. Memory 成为第一等架构原语:三层(Working + Episodic + Semantic)而非"加个向量数据库"
Agent 护栏的关键工程教训:
"guardrails before action" 模式——团队学到在工具执行层授权,而非输出层过滤
原因:等到过滤响应时,Agent 已经执行了操作(发了邮件、调用了 API)
Observability 2026 新维度: - 结构化 tracing(不只是 LLM 调用记录) - Eval pipeline + 回归测试套件 - Prompt + Tool 版本控制 - 在线/离线评测 - 漂移检测 - Agent 输出人工审核
🔷 vLLM vs SGLang vs LMDeploy — 2026 推理引擎对比
来源: premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026
可信度: ⭐⭐⭐⭐ · 2026 年最新对比,包含 benchmark 数据和决策框架
标签: inference-engine comparison vLLM SGLang LMDeploy production 2026
关键结论:
SGLang 的最佳场景(比 vLLM 优 29%+ 吞吐): - 多轮对话客服机器人(共享上下文) - 编码助手(共享模板前缀) - Agentic 工作流(RAG、工具调用循环) - RAG 应用(文档上下文跨查询复用)
LMDeploy 的最佳场景: - 量化模型在资源受限硬件上的部署 - 对速度优先级高于通用性的场景
HuggingFace TGI 状态:
TGI 已进入维护模式,仅接受 minor bug fix PR;推荐迁移到 vLLM 或 SGLang
三、Cloud-Native
🔷 arXiv:2604.17227 — Cloud-native and Distributed Systems for Efficient LLMs
arXiv: 2604.17227 · cs.DC(分布式系统)· 45 页,5 图
可信度: ⭐⭐⭐⭐⭐ · 2026 年最新,全面综述 LLM 的云原生分布式系统挑战
标签: cloud-native distributed-systems LLM scaling microservices containerization orchestration
核心贡献(从摘要提取): - 分析 LLM 在规模部署时面临的计算、系统、运维挑战 - 探索云原生架构(微服务、容器化、编排)实现 LLM 扩展 - 首次针对"LLM 的云原生和分布式系统支持"提出的全面研究议程
覆盖的关键挑战: - 计算挑战:GPU 利用率、内存带宽、KV-cache 管理 - 系统挑战:服务发现、负载均衡、分布式容错 - 运维挑战:多版本模型管理、A/B 测试、金丝雀发布
工程价值:
这是 2026 年 LLM 分布式系统领域的系统性文献。对规划 LLM 微服务架构、K8s 集群部署、资源调度策略的团队有参考价值。
建议:适合精读,关注其对"Prefill-Decode 分离"和"KV Cache 卸载"的系统设计讨论
🔷 Google Cloud Databases at Next'26 — AlloyDB Lakehouse 联邦查询
来源: Google Cloud Blog · cloud.google.com/blog/products/databases/whats-new-for-google-cloud-databases-at-next26
可信度: ⭐⭐⭐⭐ · Google 官方发布,Next'26 大会内容
标签: AlloyDB lakehouse Iceberg BigQuery federated-query cloud-native PostgreSQL
AlloyDB Lakehouse Federation(预览阶段): - AlloyDB(PostgreSQL 兼容)用户可直接在 AlloyDB Studio UI 中发现和查询 BigQuery / Apache Iceberg 表 - 查询下推到 BigQuery 进行过滤和聚合,无需数据迁移 - AlloyDB 事务数据与 BigQuery 历史数据可直接 JOIN
技术意义:
这代表了云原生数据库的演进方向——事务处理(OLTP)和分析处理(OLAP)的边界进一步模糊,PostgreSQL 兼容接口 + Iceberg 数据湖成为新标准配置。
Vibe Coding 集成: - Google AI Studio 推出 Agent 驱动的自动化应用创建工作流 - 从自然语言 prompt 秒级创建连接到 Firestore/Cloud SQL 的应用 - Cloud SQL for PostgreSQL 即将支持
🔷 VLDB 2026 — Boston,2026-08-31 至 09-04
来源: vldb.org/2026
可信度: ⭐⭐⭐⭐ · 2026 数据库领域顶会
标签: VLDB conference 2026 Boston research
重要日期提醒: - 2026-08-31 ~ 09-04,Boston - PVLDB Volume 20 新规则(2026-04 生效):每位作者每年最多投 12 篇论文(研究 track)
本届重点关注领域(基于 Call for Papers): - Database engines(数据库引擎) - Distributed database systems(分布式数据库系统) - ML + AI + Databases(ML/AI/数据库交叉) - Novel database architectures(新型数据库架构) - Graph and network data(图与网络数据) - Text and semi-structured data(文本与半结构化数据)
对 Jay 实例的意义:2026-08-31 VLDB 开始,届时可检索论文并关注 RAG + 向量搜索相关投稿
四、CSDN
本节说明:CSDN 内容依赖主动搜索发现,本次 Tavily 搜索未触发 CSDN 高价值条目。CSDN 覆盖记录见 2026-08-18T0820 和 T1220 文件(含多模态 RAG、PyTorch 源码分析、LangGraph 企业架构等高价值条目)。
本次未新发现新的高价值 CSDN 条目。
五、Reproduction(论文复现与代码资源)
🔷 Micheal Lanham — RAG 架构对比分析:Pipeline vs Agentic vs Knowledge Graph
来源: Substack · michael-lanham.substack.com · 2026 年
URL: micheallanham.substack.com/p/comparative-analysis-of-rag-architectures
可信度: ⭐⭐⭐⭐ · 工程导向分析,2026 RAG 架构全景图
标签: RAG-architecture Pipeline-RAG Agentic-RAG Knowledge-Graph-RAG production 2026
核心框架(从摘要提取):
Pipeline RAG(传统 RAG): - 流程:Ingest → Chunk → Embed → Index → Query Embed → Retrieve Top-k → Augment Prompt → Generate Answer - 最佳场景:简单问答、结构化知识查询、固定知识库 - 局限:对动态知识、多跳推理、长程依赖效果有限
Agentic RAG(智能体 RAG): - 流程:Agent 自主决定是否检索、检索什么、何时停止 - 最佳场景:复杂查询、多跳推理、工具调用混合任务 - 局限:延迟更高、成本更高、需要好的 Agent 评测
Knowledge Graph RAG(图 RAG): - 流程:知识图谱作为结构化记忆层,向量检索作为回退 - 最佳场景:需要关系推理、多实体关联、专业领域知识 - 局限:图谱构建和维护成本高
2026 RAG 选型建议:
57% 的组织已部署多阶段 Agent,"质量"仍是生产级部署的首要阻碍
选型原则:从 Pipeline RAG 开始,只有当 Pipeline 无法满足需求时才升级到 Agentic RAG
后续行动:适合作为团队 RAG 架构选型决策的参考文档,建议与团队具体场景结合验证
🔷 LazyAttention — ICML 2026:延迟位置编码的高效 RAG
来源: Yongjoo Park 团队 · ICML 2026(研究)
论文: Haocheng Xia, Mihir Pamnani, Hanxi Fang, Supawit Chockchowwat, Yongjoo Park
可信度: ⭐⭐⭐⭐⭐ · Yongjoo Park 是数据库/ML 系统领域活跃研究者(QuickSel、SAQE 作者)
标签: RAG attention positional-encoding long-context ICML-2026 efficiency
核心创新:将 Deferred Positional Encoding 引入 RAG 场景,解决长上下文注意力开销问题
意义:对构建长程 RAG(>32k token 上下文)的团队有直接参考价值
🔷 CADENZA — VLDB 2026 Demo:语义查询的意图依赖计划空间
来源: Yongjoo Park 团队 · VLDB 2026(Demo)
论文: Jaehyun Ha, Yongjoo Park, Wook-Shin Han
可信度: ⭐⭐⭐⭐ · VLDB Demo track,侧重系统演示
标签: semantic-query intent-planning VLDB-2026 demo
关注理由:意图依赖计划空间用于语义查询,是数据库自然语言接口(NLIDB)方向的最新进展
📋 汇总表
| 类别 | 条目 | 优先级 | 来源 | 关键结论 |
|---|---|---|---|---|
| Database | VeloANN(SSD 图索引) | ⭐⭐⭐⭐⭐ | arXiv | 局部性+异步执行优化 SSD 向量 ANN |
| Database | AkasicDB(Omni RAG 统一 DBMS) | ⭐⭐⭐⭐ | arXiv | 向量+图+关系统一查询优化 |
| Database | August 2026 arXiv DB 新论文 | ⭐⭐⭐ | @UFCS | Window Function优化/Filtered ANN Lakehouse/BEGIN AI Transaction |
| Database | pgvector vs Qdrant vs Milvus 选型 | ⭐⭐⭐⭐ | DEV Community | 按规模(<500万/5000万/1亿+)决策树 |
| Database | PostgreSQL 18 vs MySQL 9.7 | ⭐⭐⭐⭐ | kunalganglani | 2026最新:PG全面领先,MySQL仅LAMP生态占优 |
| Backend | vLLM Qwen3-Omni 实战 | ⭐⭐⭐⭐⭐ | vLLM Blog | 多模态推理工程第一手经验 |
| Backend | SGLang 2026 新动态 | ⭐⭐⭐⭐⭐ | GitHub | RadixAttention生产验证、TPU支持、DeepSeek-V4 RL |
| Backend | AI Agents Stack 2026 | ⭐⭐⭐⭐⭐ | AI Engineer/O'Reilly | 六大层次架构,2024→2026三大变化 |
| Backend | vLLM vs SGLang vs LMDeploy | ⭐⭐⭐⭐ | premai.io | SGLang多轮/RAG最优,LMDeploy量化受限硬件最优 |
| Cloud-native | Cloud-native LLM 系统研究 | ⭐⭐⭐⭐⭐ | arXiv:2604.17227 | LLM分布式系统全面研究议程 |
| Cloud-native | AlloyDB Lakehouse Federation | ⭐⭐⭐⭐ | Google Cloud | PostgreSQL+Iceberg融合,事务+分析边界模糊 |
| Cloud-native | VLDB 2026 | ⭐⭐⭐⭐ | vldb.org | 2026-08-31 Boston,关注RAG/向量/图方向 |
| Reproduction | RAG 架构对比(Pipeline/Agentic/KG) | ⭐⭐⭐⭐ | Substack | 2026 RAG 选型决策参考 |
| Reproduction | LazyAttention(ICML 2026) | ⭐⭐⭐⭐⭐ | ICML 2026 | 长程 RAG 注意力效率优化 |
| Reproduction | CADENZA(VLDB 2026 Demo) | ⭐⭐⭐⭐ | VLDB 2026 | 语义查询意图计划空间 |
建议写入路径(合并为单一草稿,已写入本文件):
- 实际写入:/shared/research-kb/inbox/jay/2026-08-18T1505-jay-five-category-briefing.md
是否需要精读: - ⭐⭐⭐⭐⭐ 必须精读:arXiv:2604.17227(Cloud-native LLM 系统)、LazyAttention ICML 2026(长程 RAG) - ⭐⭐⭐⭐ 建议精读:AI Agents Stack 2026 O'Reilly、AkasicDB SIGMOD 2026、VeloANN
是否需要主题页更新:建议新增"RAG 架构选型(Pipeline vs Agentic vs KG)"主题参考页