Jay · 五分类技术简报 · 2026-08-13 上午

检索范围: Tavily 多轮搜索 × 9 queries(LLM Agent/RAG/multimodal 2026、分布式系统、Jepsen、GitHub Trending、arXiv RAG/Agent、Substack、PgVector/Milvus benchmark、HuggingFace datasets、CSDN 高并发)


📦 Database

1. Vector DB 全景测评:Milvus 领跑综合性能

  • 来源: arXiv 2310.11703(Comprehensive Survey on Vector Database)
  • 可信度: ⭐⭐⭐⭐⭐ 学术survey,测试条件可控(2核8G内存)
  • 核心数据: 横向评测 Milvus / Pinecone / Weaviate / ZillizCloud / QdrantCloud / PgVector / ElasticCloud
  • Milvus:综合排名第一,QPS 380,延迟 12.4ms,负载能力最强
  • ZillizCloud:延迟最低(6ms),但负载容量受限
  • ElasticCloud:垫底,QPS 仅 11.29,延迟高达 361ms
  • 召回率:各系统均接近 1.0,差异极小
  • 关键结论: QPS 与召回率存在典型 trade-off;Milvus 在 HNSW 索引实现和并行处理上效率领先
  • 后续行动: 精读 benchmark 方法论,对比 RAGPerf 中的 DiskANN + GPU 场景;建议更新向量数据库主题页

2. FANNS:Filtered ANN Search 实战对比(FAISS vs Milvus vs pgvector)

  • 来源: arXiv 2602.11443
  • 可信度: ⭐⭐⭐⭐⭐ 学术 benchmark 论文
  • 核心数据: 对比 HNSW 和 IVFFlat 在 Milvus/pgvector 中 pre-filtering vs post-filtering 策略表现
  • 在 filter attribute 上建索引 vs 不建索引,QPS-Recall 曲线差异显著
  • pgvector 在带条件过滤的场景中 post-filtering 性能衰减明显
  • 后续行动: 工程选型时注意 filtered search 场景;RAG with metadata filtering 值得跟进

3. RAGPerf:端到端 RAG 基准测试框架

  • 来源: arXiv 2603.10765
  • 可信度: ⭐⭐⭐⭐⭐ MLsys benchmark 框架
  • 核心数据:
  • 支持 LanceDB / Milvus / Qdrant / Chroma / Elasticsearch + HNSW/IVF/DiskANN
  • Milvus + LanceDB 开启 DiskANN(内存 32GB):吞吐量分别下降至 15.3% 和 37.6%(I/O 开销导致延迟 6.1×~12.5×)
  • GPU 索引构建:Milvus + Qdrant 支持,Chroma 依赖纯内存 HNSW,128GB 以下直接失败
  • HNSW 索引 QPS:1.68–1.81 vs FLAT 基线 0.69 QPS
  • 后续行动: 生产部署 RAG pipeline 时关注内存 budget;建议写入 inference engineering 主题页

4. To GPU or Not to GPU:向量搜索在关系引擎中性能实测

  • 来源: arXiv 2605.15957
  • 可信度: ⭐⭐⭐⭐⭐ H100 + CUDA 12.8 实测,含 PCIe 5.0 / NVLink-C2C / DGX-Spark 多种互联
  • 核心数据:
  • cuVS-enabled FAISS + PostgreSQL 17 + pgvector 0.8.2
  • GPU 向量搜索在 H100 NVLink 配置下性能显著领先,但受限于 GPU 显存和 PCIe 带宽
  • 后续行动: GPU 选型参考;LLM 推理 + 向量搜索共卡场景值得关注

5. 时间序列基础模型论文数据集

  • 来源: HuggingFace fineset-io/time-series-foundation-models-papers
  • 可信度: ⭐⭐⭐⭐ 精选自 arXiv + Semantic Scholar,质量评分字段完整
  • 内容: 2602.24238(交通运输预测)、2604.22077(电力系统预测)等最新时间序列 FM 论文
  • 后续行动: 时间序列 + LLM 交叉方向可作为专题追踪

⚙️ Backend

1. LLM Model Comparison 2026:16模型 22字段权威对照

  • 来源: HuggingFace salttechno/LLM-Model-Comparison-2026
  • 可信度: ⭐⭐⭐⭐⭐ 企业级测评,CC BY 4.0 开源
  • 核心数据(重点): | 模型 | 提供商 | 输入成本 | 输出成本 | Context | 开源 | |---|---|---|---|---|---| | GPT-4.1 | OpenAI | $2.00/M | $8.00/M | 1M | ❌ | | o4-mini | OpenAI | $1.10/M | $4.40/M | 200K | ❌ | | Claude Sonnet 4.5 | Anthropic | $3.00/M | $15.00/M | 200K | ❌ | | Gemini 2.5 Pro | Google | $1.25/M | $10.00/M | 1M | ❌ | | Llama 4 Scout | Meta | $0.11/M | $0.34/M | 10M | ✅ | | DeepSeek R1 | DeepSeek | $0.55/M | $2.19/M | 128K | ✅ | | DeepSeek V3 | DeepSeek | $0.25/M | $1.10/M | 128K | ✅ |
  • Benchmark 亮点: DeepSeek R1:MMLU 90.8 / HumanEval 85.3 / MATH 97.3;Claude Opus 4.5:HumanEval 91.0 最高
  • 后续行动: 更新 AI Stack 成本分析页;推荐用于性价比敏感的 RAG/Agent 生产场景

2. AI Model Benchmarks & Pricing Dataset 2026

  • 来源: HuggingFace BenchGeckoAI/ai-model-benchmarks-2026
  • 可信度: ⭐⭐⭐⭐ 每2小时更新,覆盖数千模型
  • 亮点: 含 MCP Servers(Model Context Protocol)字段,20条记录;Arena ELO / MMMU / LiveCodeBench / Aider Polyglot 等 benchmark 元数据
  • 后续行动: 追踪 MCP 生态演进

3. ICLR 2026 论文数据集

  • 来源: HuggingFace ai-conferences/ICLR2026
  • 可信度: ⭐⭐⭐⭐⭐ OpenReview 官方数据
  • 精选论文:
  • RL 缓解 LLM 任务冲突(Zixuan Ren et al.):强化学习在模型合并中的作用,Poster
  • Micro-Macro Retrieval 减少长文本幻觉:提出检索-生成协同优化框架,705 stars
  • GPT-4o 视觉理解系统性评测:多模态基础模型在标准 CV 任务上的全面基准
  • 后续行动: 精读幻觉治理方向论文;更新 LLM systems 主题页

4. AI Agent Papers 精选列表(Awesome-Search-Agent-Papers)

  • 来源: GitHub trending + Sebastian Raschka Substack
  • 核心内容(来自摘要上下文): Sebastian Raschka 列出 2024–2026 必读 LLM 研究论文,覆盖 RAG、Agent、多模态、Long Context 等方向
  • 可信度: ⭐⭐⭐⭐⭐ AI research 领域高影响力作者
  • 后续行动: 对照 arXiv 最新 RAG/Agent 论文交叉验证;补充 reading list

☁️ Cloud-Native

1. ShardingSphere 分布式数据库工程实践

  • 来源: ShardingSphere 官方博客
  • 可信度: ⭐⭐⭐⭐⭐ 一线工程实践
  • 核心内容:
  • 2PC vs 柔性事务(BASE):XA 两阶段对业务侵入小但锁资源,高并发短事务场景不适用;柔性事务通过业务层锁换吞吐
  • JDTX 架构:WAL + MVCC 引擎分离,活跃数据异步刷盘;KV 结构写入 < BTree 索引维护开销;支持跨 MySQL/PostgreSQL/MongoDB/Redis 异构分布式事务
  • 配置动态化 + 高可用:SPI 机制对接 MySQL MGR;数据库实例熔断 / 接入端限流
  • 后续行动: 生产分布式事务选型参考;ShardingSphere 已在大量国内大厂落地,纳入架构选型手册

2. 京东云:高并发数据密集型系统实战

  • 来源: 京东云开发者社区
  • 可信度: ⭐⭐⭐⭐ 规模化生产验证
  • 核心内容:
  • 分库分表:范围求模(避免扩容迁移)vs 哈希取模(均衡但扩缩困难)
  • Redis Cluster 16384 slots 槽位定位:CRC16(key) mod 16384
  • 主从延迟排障:row 模式下大表 DELETE 导致 binlog 同步延迟(2800W→1500W 数据丢失)
  • 延迟复制读写策略:关键读主库,非关键读从库
  • 后续行动: 排障案例归档;Redis 高可用集群设计参考

3. 高并发数据一致性保障

  • 来源: 博客园 Hello-Brand
  • 可信度: ⭐⭐⭐⭐ 图文详解,适合教学
  • 核心内容:
  • CAS 无锁模式:支付/下单并发扣减场景实战 go 代码示例
  • 分布式锁三方案对比:数据库(低可靠)/ Redis(中可靠高性能)/ Zookeeper(高可靠)
  • 跨行转账分布式事务:最终一致性方案
  • 后续行动: 作为内部工程培训素材参考

💻 CSDN

1. Java突击队:12个企业级实战项目(高并发/微服务/分布式/AI Agent)

  • 来源: susan.net.cn(苏三 / CSDN 博客专家)
  • 可信度: ⭐⭐⭐⭐⭐ 工程实践导向,含完整业务链路
  • 核心项目:
  • 100万QPS短链系统:32库×256表,日写入2.6亿+;分库分表/多级缓存/布隆过滤器/Sentinel限流熔断/Prometheus监控
  • SaaS点餐系统:DDD + 多租户 + PostgreSQL
  • Mall Cloud微服务:网关/服务治理/链路监控/分库分表/任务调度全套
  • 秒杀系统:完整高并发场景
  • 后续行动: 可作为架构设计案例库;检查源码是否开源并记录链接

2. 高并发系统水平扩展方法论

  • 来源: 博客园 Honnnnl(2018年经典文,仍有价值)
  • 可信度: ⭐⭐⭐⭐ 系统性方法论
  • 核心内容:
  • 垂直扩展(Scale Up)vs 水平扩展(Scale Out):互联网终极方案是水平扩展
  • 各层扩展机制:DNS → Nginx(反向代理)/ RPC连接池(服务层)/ 数据分片(缓存+DB)
  • 数据层水平拆分:范围分片 vs 哈希分片各有权衡
  • 后续行动: 归档为架构基础参考;新工程师 onboarding 材料

3. ShardingSphere 打造分布式数据库

  • 来源: Apache ShardingSphere 官方 blog
  • 可信度: ⭐⭐⭐⭐⭐ Apache 官方
  • 内容同上 Database 章节,建议合并归档

🔬 Reproduction

1. RAGPerf Benchmark 复现指南

  • 来源: arXiv 2603.10765 + 官方代码
  • 可信度: ⭐⭐⭐⭐⭐ benchmark 框架,可复现
  • 复现要点:
  • Milvus + DiskANN 在 32GB 内存下性能骤降至 15.3%;环境变量 KNN_BUDGET 控制内存
  • Docker Compose 一键部署:LanceDB / Milvus / Qdrant / Chroma / Elasticsearch
  • 评测指标:QPS / Recall / Latency / 内存占用 / GPU 利用率
  • 后续行动: 在 vLLM/SGLang 推理节点旁部署 RAGPerf 采集基线;更新 inference engineering 复现文档
  • 来源: arXiv 2605.15957
  • 可信度: ⭐⭐⭐⭐⭐ H100 实测,含详细硬件配置表
  • 复现要点:
  • cuVS + FAISS v1.13.0 + PostgreSQL 17 + pgvector 0.8.2
  • CUDA 12.8 / GCC 13 / Ubuntu 24.04
  • NVLink-C2C 带宽优势在向量维度 > 512 时显著
  • 后续行动: GPU 选型测试可参考此硬件配置;cuVS 已集成进主流向量数据库

3. FANNS 过滤最近邻 pgvector 实测

  • 来源: arXiv 2602.11443
  • 复现要点:
  • pre-filtering(先过滤再向量搜索)vs post-filtering(先向量搜索再过滤)的选择
  • 在 filter column 上建 B-tree 索引 vs 不建索引,pgvector 表现差异大
  • Milvus 对过滤表达式的优化更成熟
  • 后续行动: 生产 filtered RAG 场景选型参考

📋 汇总建议

分类 高价值条目 建议操作
Database Vector DB survey、RAGPerf、FANNS 精读 benchmark 方法论,更新向量数据库主题页
Backend LLM Model Comparison 2026、ICLR 2026 数据集 更新 AI Stack 成本分析页,精读幻觉治理论文
Cloud-Native ShardingSphere JDTX、京东云高并发实战 归档为架构选型手册,复用排障案例
CSDN 100万QPS短链系统、Mall Cloud微服务 检查源码,开源则补充链接
Reproduction RAGPerf、Docker Compose 多DB部署 在测试集群部署基线采集脚本

建议写入路径: - /shared/research-kb/inbox/jay/2026-08-13T1105-jay-five-category-briefing.md(本文)

本轮未写入其他文件。 全部内容为原创摘要,未执行 git commit / git push / gh pr。