Jay · 五分类技术简报 · 2026-08-13 上午
检索范围: Tavily 多轮搜索 × 9 queries(LLM Agent/RAG/multimodal 2026、分布式系统、Jepsen、GitHub Trending、arXiv RAG/Agent、Substack、PgVector/Milvus benchmark、HuggingFace datasets、CSDN 高并发)
📦 Database
1. Vector DB 全景测评:Milvus 领跑综合性能
- 来源: arXiv 2310.11703(Comprehensive Survey on Vector Database)
- 可信度: ⭐⭐⭐⭐⭐ 学术survey,测试条件可控(2核8G内存)
- 核心数据: 横向评测 Milvus / Pinecone / Weaviate / ZillizCloud / QdrantCloud / PgVector / ElasticCloud
- Milvus:综合排名第一,QPS 380,延迟 12.4ms,负载能力最强
- ZillizCloud:延迟最低(6ms),但负载容量受限
- ElasticCloud:垫底,QPS 仅 11.29,延迟高达 361ms
- 召回率:各系统均接近 1.0,差异极小
- 关键结论: QPS 与召回率存在典型 trade-off;Milvus 在 HNSW 索引实现和并行处理上效率领先
- 后续行动: 精读 benchmark 方法论,对比 RAGPerf 中的 DiskANN + GPU 场景;建议更新向量数据库主题页
2. FANNS:Filtered ANN Search 实战对比(FAISS vs Milvus vs pgvector)
- 来源: arXiv 2602.11443
- 可信度: ⭐⭐⭐⭐⭐ 学术 benchmark 论文
- 核心数据: 对比 HNSW 和 IVFFlat 在 Milvus/pgvector 中 pre-filtering vs post-filtering 策略表现
- 在 filter attribute 上建索引 vs 不建索引,QPS-Recall 曲线差异显著
- pgvector 在带条件过滤的场景中 post-filtering 性能衰减明显
- 后续行动: 工程选型时注意 filtered search 场景;RAG with metadata filtering 值得跟进
3. RAGPerf:端到端 RAG 基准测试框架
- 来源: arXiv 2603.10765
- 可信度: ⭐⭐⭐⭐⭐ MLsys benchmark 框架
- 核心数据:
- 支持 LanceDB / Milvus / Qdrant / Chroma / Elasticsearch + HNSW/IVF/DiskANN
- Milvus + LanceDB 开启 DiskANN(内存 32GB):吞吐量分别下降至 15.3% 和 37.6%(I/O 开销导致延迟 6.1×~12.5×)
- GPU 索引构建:Milvus + Qdrant 支持,Chroma 依赖纯内存 HNSW,128GB 以下直接失败
- HNSW 索引 QPS:1.68–1.81 vs FLAT 基线 0.69 QPS
- 后续行动: 生产部署 RAG pipeline 时关注内存 budget;建议写入 inference engineering 主题页
4. To GPU or Not to GPU:向量搜索在关系引擎中性能实测
- 来源: arXiv 2605.15957
- 可信度: ⭐⭐⭐⭐⭐ H100 + CUDA 12.8 实测,含 PCIe 5.0 / NVLink-C2C / DGX-Spark 多种互联
- 核心数据:
- cuVS-enabled FAISS + PostgreSQL 17 + pgvector 0.8.2
- GPU 向量搜索在 H100 NVLink 配置下性能显著领先,但受限于 GPU 显存和 PCIe 带宽
- 后续行动: GPU 选型参考;LLM 推理 + 向量搜索共卡场景值得关注
5. 时间序列基础模型论文数据集
- 来源: HuggingFace fineset-io/time-series-foundation-models-papers
- 可信度: ⭐⭐⭐⭐ 精选自 arXiv + Semantic Scholar,质量评分字段完整
- 内容: 2602.24238(交通运输预测)、2604.22077(电力系统预测)等最新时间序列 FM 论文
- 后续行动: 时间序列 + LLM 交叉方向可作为专题追踪
⚙️ Backend
1. LLM Model Comparison 2026:16模型 22字段权威对照
- 来源: HuggingFace salttechno/LLM-Model-Comparison-2026
- 可信度: ⭐⭐⭐⭐⭐ 企业级测评,CC BY 4.0 开源
- 核心数据(重点): | 模型 | 提供商 | 输入成本 | 输出成本 | Context | 开源 | |---|---|---|---|---|---| | GPT-4.1 | OpenAI | $2.00/M | $8.00/M | 1M | ❌ | | o4-mini | OpenAI | $1.10/M | $4.40/M | 200K | ❌ | | Claude Sonnet 4.5 | Anthropic | $3.00/M | $15.00/M | 200K | ❌ | | Gemini 2.5 Pro | Google | $1.25/M | $10.00/M | 1M | ❌ | | Llama 4 Scout | Meta | $0.11/M | $0.34/M | 10M | ✅ | | DeepSeek R1 | DeepSeek | $0.55/M | $2.19/M | 128K | ✅ | | DeepSeek V3 | DeepSeek | $0.25/M | $1.10/M | 128K | ✅ |
- Benchmark 亮点: DeepSeek R1:MMLU 90.8 / HumanEval 85.3 / MATH 97.3;Claude Opus 4.5:HumanEval 91.0 最高
- 后续行动: 更新 AI Stack 成本分析页;推荐用于性价比敏感的 RAG/Agent 生产场景
2. AI Model Benchmarks & Pricing Dataset 2026
- 来源: HuggingFace BenchGeckoAI/ai-model-benchmarks-2026
- 可信度: ⭐⭐⭐⭐ 每2小时更新,覆盖数千模型
- 亮点: 含 MCP Servers(Model Context Protocol)字段,20条记录;Arena ELO / MMMU / LiveCodeBench / Aider Polyglot 等 benchmark 元数据
- 后续行动: 追踪 MCP 生态演进
3. ICLR 2026 论文数据集
- 来源: HuggingFace ai-conferences/ICLR2026
- 可信度: ⭐⭐⭐⭐⭐ OpenReview 官方数据
- 精选论文:
- RL 缓解 LLM 任务冲突(Zixuan Ren et al.):强化学习在模型合并中的作用,Poster
- Micro-Macro Retrieval 减少长文本幻觉:提出检索-生成协同优化框架,705 stars
- GPT-4o 视觉理解系统性评测:多模态基础模型在标准 CV 任务上的全面基准
- 后续行动: 精读幻觉治理方向论文;更新 LLM systems 主题页
4. AI Agent Papers 精选列表(Awesome-Search-Agent-Papers)
- 来源: GitHub trending + Sebastian Raschka Substack
- 核心内容(来自摘要上下文): Sebastian Raschka 列出 2024–2026 必读 LLM 研究论文,覆盖 RAG、Agent、多模态、Long Context 等方向
- 可信度: ⭐⭐⭐⭐⭐ AI research 领域高影响力作者
- 后续行动: 对照 arXiv 最新 RAG/Agent 论文交叉验证;补充 reading list
☁️ Cloud-Native
1. ShardingSphere 分布式数据库工程实践
- 来源: ShardingSphere 官方博客
- 可信度: ⭐⭐⭐⭐⭐ 一线工程实践
- 核心内容:
- 2PC vs 柔性事务(BASE):XA 两阶段对业务侵入小但锁资源,高并发短事务场景不适用;柔性事务通过业务层锁换吞吐
- JDTX 架构:WAL + MVCC 引擎分离,活跃数据异步刷盘;KV 结构写入 < BTree 索引维护开销;支持跨 MySQL/PostgreSQL/MongoDB/Redis 异构分布式事务
- 配置动态化 + 高可用:SPI 机制对接 MySQL MGR;数据库实例熔断 / 接入端限流
- 后续行动: 生产分布式事务选型参考;ShardingSphere 已在大量国内大厂落地,纳入架构选型手册
2. 京东云:高并发数据密集型系统实战
- 来源: 京东云开发者社区
- 可信度: ⭐⭐⭐⭐ 规模化生产验证
- 核心内容:
- 分库分表:范围求模(避免扩容迁移)vs 哈希取模(均衡但扩缩困难)
- Redis Cluster 16384 slots 槽位定位:CRC16(key) mod 16384
- 主从延迟排障:row 模式下大表 DELETE 导致 binlog 同步延迟(2800W→1500W 数据丢失)
- 延迟复制读写策略:关键读主库,非关键读从库
- 后续行动: 排障案例归档;Redis 高可用集群设计参考
3. 高并发数据一致性保障
- 来源: 博客园 Hello-Brand
- 可信度: ⭐⭐⭐⭐ 图文详解,适合教学
- 核心内容:
- CAS 无锁模式:支付/下单并发扣减场景实战 go 代码示例
- 分布式锁三方案对比:数据库(低可靠)/ Redis(中可靠高性能)/ Zookeeper(高可靠)
- 跨行转账分布式事务:最终一致性方案
- 后续行动: 作为内部工程培训素材参考
💻 CSDN
1. Java突击队:12个企业级实战项目(高并发/微服务/分布式/AI Agent)
- 来源: susan.net.cn(苏三 / CSDN 博客专家)
- 可信度: ⭐⭐⭐⭐⭐ 工程实践导向,含完整业务链路
- 核心项目:
- 100万QPS短链系统:32库×256表,日写入2.6亿+;分库分表/多级缓存/布隆过滤器/Sentinel限流熔断/Prometheus监控
- SaaS点餐系统:DDD + 多租户 + PostgreSQL
- Mall Cloud微服务:网关/服务治理/链路监控/分库分表/任务调度全套
- 秒杀系统:完整高并发场景
- 后续行动: 可作为架构设计案例库;检查源码是否开源并记录链接
2. 高并发系统水平扩展方法论
- 来源: 博客园 Honnnnl(2018年经典文,仍有价值)
- 可信度: ⭐⭐⭐⭐ 系统性方法论
- 核心内容:
- 垂直扩展(Scale Up)vs 水平扩展(Scale Out):互联网终极方案是水平扩展
- 各层扩展机制:DNS → Nginx(反向代理)/ RPC连接池(服务层)/ 数据分片(缓存+DB)
- 数据层水平拆分:范围分片 vs 哈希分片各有权衡
- 后续行动: 归档为架构基础参考;新工程师 onboarding 材料
3. ShardingSphere 打造分布式数据库
- 来源: Apache ShardingSphere 官方 blog
- 可信度: ⭐⭐⭐⭐⭐ Apache 官方
- 内容同上 Database 章节,建议合并归档
🔬 Reproduction
1. RAGPerf Benchmark 复现指南
- 来源: arXiv 2603.10765 + 官方代码
- 可信度: ⭐⭐⭐⭐⭐ benchmark 框架,可复现
- 复现要点:
- Milvus + DiskANN 在 32GB 内存下性能骤降至 15.3%;环境变量 KNN_BUDGET 控制内存
- Docker Compose 一键部署:LanceDB / Milvus / Qdrant / Chroma / Elasticsearch
- 评测指标:QPS / Recall / Latency / 内存占用 / GPU 利用率
- 后续行动: 在 vLLM/SGLang 推理节点旁部署 RAGPerf 采集基线;更新 inference engineering 复现文档
2. pgvector GPU 性能实测(NVLink vs PCIe 5.0)
- 来源: arXiv 2605.15957
- 可信度: ⭐⭐⭐⭐⭐ H100 实测,含详细硬件配置表
- 复现要点:
- cuVS + FAISS v1.13.0 + PostgreSQL 17 + pgvector 0.8.2
- CUDA 12.8 / GCC 13 / Ubuntu 24.04
- NVLink-C2C 带宽优势在向量维度 > 512 时显著
- 后续行动: GPU 选型测试可参考此硬件配置;cuVS 已集成进主流向量数据库
3. FANNS 过滤最近邻 pgvector 实测
- 来源: arXiv 2602.11443
- 复现要点:
- pre-filtering(先过滤再向量搜索)vs post-filtering(先向量搜索再过滤)的选择
- 在 filter column 上建 B-tree 索引 vs 不建索引,pgvector 表现差异大
- Milvus 对过滤表达式的优化更成熟
- 后续行动: 生产 filtered RAG 场景选型参考
📋 汇总建议
| 分类 | 高价值条目 | 建议操作 |
|---|---|---|
| Database | Vector DB survey、RAGPerf、FANNS | 精读 benchmark 方法论,更新向量数据库主题页 |
| Backend | LLM Model Comparison 2026、ICLR 2026 数据集 | 更新 AI Stack 成本分析页,精读幻觉治理论文 |
| Cloud-Native | ShardingSphere JDTX、京东云高并发实战 | 归档为架构选型手册,复用排障案例 |
| CSDN | 100万QPS短链系统、Mall Cloud微服务 | 检查源码,开源则补充链接 |
| Reproduction | RAGPerf、Docker Compose 多DB部署 | 在测试集群部署基线采集脚本 |
建议写入路径:
- /shared/research-kb/inbox/jay/2026-08-13T1105-jay-five-category-briefing.md(本文)
本轮未写入其他文件。 全部内容为原创摘要,未执行 git commit / git push / gh pr。