RAG 与知识库文献总结 · 周二轻量版
生成时间: 2026-09-15 (周二) 实例: Tom 主题: RAG、向量检索、重排、查询改写、长文档知识库
📌 本周核心洞察(轻量摘要)
2026 年 RAG 生产现状(来源:sirishacherala.substack.com): - RAG 企业生产采纳率从 2024 Q1 的 8% 升至 2026 Q1 的 72% - 朴素 RAG 在生产环境中检索失败率约 40% ——瓶颈在检索,不在生成 - 建议 80% 优化精力投入检索侧,而非生成侧 - 双管道架构已成熟:离线索引(解析→分块→嵌入→存储)和在线查询(改写→检索→重排→生成)
2026 生产标准 RAG 架构(来源:ratkonikolic.substack.com): - 单一存储同时处理向量搜索 + 关键词搜索(Vespa/Elasticsearch 等) - Reciprocal Rank Fusion(RRF)合并多路检索结果 - Cross-Encoder 重排器(Cohere Rerank 4 或 Voyage rerank-2.5)将长候选列表压缩至紧密短列表 - 元数据过滤(时效性、访问控制) - Query rewriting 仅在查询/文档词汇存在明显差异时启用
重排与查询改写实战(来源:skandavivek.substack.com): - Query Rewriting 三策略:HyDE(假设文档嵌入)、Multi-Query(多查询扩展)、Sub-Query(子问题分解) - Reranking 核心价值:重新排序初检结果,确保最相关文档优先给 LLM 使用
2026 RAG Pipeline 最佳实践(来源:aishwaryasrinivasan.substack.com): - Hybrid Search 召回 Top-100 → Cross-Encoder 重排 → Top-5~10 送 LLM - Parent Document Retrieval:小块精准匹配 + 父文档整页上下文补充 - 分块策略从固定大小演进为语义分块和 Agentic Splitter
📚 候选文献(7 条)
| # | 类型 | 标题 | 来源 | 关键标签 |
|---|---|---|---|---|
| 1 | Substack | Production RAG Frameworks Compared: The 2026 Landscape | karbouch.substack.com | 框架对比、生产、Rerank 4 |
| 2 | Substack | Vector Database Design for Production RAG | sirishacherala.substack.com | 向量库设计、72%采纳率、Hybrid Search |
| 3 | Substack | Advanced RAG: what you actually run in production | ratkonikivek.substack.com | RRF、Cohere Rerank 4、Query rewriting |
| 4 | Substack | Optimizing RAG | skandavivek.substack.com | HyDE、多查询、reranking 策略 |
| 5 | Substack | Building a simple RAG pipeline in 2026: a local-first approach | dataheimer.substack.com | 实践教程、本地优先 |
| 6 | arxiv | ReMoMask-2: Latent Retrieval-Augmented Masked Motion Generation | arxiv.org/abs/2609.08365 | RAG-T2M、层次化双向检索 |
| 7 | HF策展 | ReactHuman / Occamy-1.0 等 | HF Daily 2026-09-08~09 | 多模态具身Agent、Co-work模型 |
⭐ 高价值条目(3 条)
-
karbouch.substack.com — Production RAG Frameworks Compared: The 2026 Landscape - 2026 年主流 RAG 框架(Hayashi、Verba、Canopy、Griptape、Maximize、AI Gateway)横向对比 - 涵盖 Vespa 向量+关键词混合检索、多向量嵌入文档、Cohere Rerank 支持、LLM 生成知识图谱 - 提供真实生产级评估维度:延迟、成本、组件可替换性
-
sirishacherala.substack.com — Vector Database Design for Production RAG - 72% vs 8% 采纳率数字来源;朴素 RAG 失败率 40% 的生产数据 - 双管道架构(离线索引 vs 在线查询)的优化压力分离原则 - Hybrid Search 的 MRR 提升量化数据(66.4% vs 56.7%)
-
ratkonikolic.substack.com — Advanced RAG: what you actually run in production - 收敛结论:单一向量+关键词存储 + RRF + Cross-Encoder 重排 + 元数据过滤 - 引用 Anthropic Contextual Retrieval(2024-09)、HyDE(2022-12)、Cohere Rerank 4(2025-12)等关键文献 - Query rewriting 的适用条件:查询/文档词汇确实存在差异时才启用
ℹ️ 备注
- arXiv 采集: 本轮 arxiv.org 查询(retrieval reranking / query rewriting / hybrid retrieval / long document RAG)因 429 限速和超时全部失败,归因于上游 API 限流,非本实例问题
- HF Daily 候选: 仅 ReMoMask-2(#6)与 RAG 直接相关,其余为多模态具身/Agent 方向策展
- Substack 使用: 是,共 5 条(#1-5),全部为工程实践与生产数据,无纯论文转发
- CSDN 使用: 否,本轮无含版本/环境/命令/源码分析/复现经验的内容
Generated by Tom · Research KB cron · 2026-09-15 candidates JSON: /shared/research-kb/inbox/tom/_candidates/2026-09-15-rag-retrieval-reranking-candidates.json