主题综述 · RAG(2026-07-24)
- 作者:spark
- 更新:2026-07-24
摘要
检索增强生成(RAG)自 2020 年 Lewis 等人正式提出以来,已经从「外挂向量库 + 单跳 prompt」演化为一个把检索、推理、规划、记忆与治理耦合在一起的复合 AI 系统范式。本综述以 /shared/research-kb/organized/paper_cards/ 中 114 篇与 RAG 直接相关的论文卡片、/shared/research-kb/inbox/ 近 7 天的雷达与 E1 简报(含 2026-07-22 至 2026-07-24 三轮 Tom 文献雷达)、以及 1 次 web_search 补充的最新综述索引为材料,按"脉络—贡献—多视角评估—趋势"四段结构,写出当前 RAG 研究的工程、研究、批判三重视角。综合论文 9 篇核心 + 6 篇邻接(共 arxiv 号 15 个)。
一、主题脉络:从 Naive 到 Agentic / Compound
1.1 三段范式演进
按 Gao et al. (arXiv:2312.10997,Semantic Scholar 被引 3715 次,OpenAlex 686 次) 给出的"三段范式"框架:
- Naive RAG:Indexing → Retrieval → Generation 线性管线,BM25 / DPR / Contriever 检索,提示拼接上下文。问题明显:召回漂移、上下文碎片化、生成不可控。
- Advanced RAG:在检索前后分别加 Query Rewriting / HyDE、Chunk Re-ranking / Cross-encoder、Refined Context Compression 与 Prompt Engineering。仍以单跳为主。
- Modular RAG:把检索、生成、改写、路由、评估拆成可替换模块,允许 skip / repeat / parallel;以 LangChain / LlamaIndex / DSPy 等框架为代表。
从 2025 年开始,"Modular RAG"被进一步推向 Agentic RAG 与 Compound AI Systems (CAIS):把 LLM Agent 作为编排者,按需调用检索、工具、记忆与评估子模块。代表性综述:
- Agentic RAG: A Survey on Agentic RAG (arXiv:2501.09136,S2: 360):按 agent cardinality / control structure / autonomy / knowledge representation 四维度提出分类法,覆盖单 agent / 多 agent / 图谱增强三类框架。
- From Standalone LLMs to Integrated Intelligence: Compound AI Systems (arXiv:2506.04565):把 RAG、LLM Agent、Multimodal LLMs、Orchestration 并列为 CAIS 的四大基础范式,明确"系统 > 模型"的转向。
- SoK: Agentic RAG (arXiv:2603.07379,ACL 2026):把检索-生成循环形式化为有限时域 POMDP,给出按 planning / retrieval orchestration / memory paradigms / tool invocation 的模块化分解,并归纳出 Decomposition / Recursive / HITL / SQL-like / Hypothetical DOC / Hybrid 六类设计模式。
1.2 2026 年的细分路线
根据 Tom 雷达 2026-07-22 ~ 24 三轮汇总(/shared/research-kb/inbox/tom/2026-07-22T1440-agent-rag-longcontext-radar.md、2026-07-23T1440、2026-07-23T2040、2026-07-24-agent-rag-longcontext-radar.md、2026-07-24T1440),以及 paper_cards 的近期增量,2026 年 RAG 实际呈现出以下五条并行路线,而非单一叙事:
| 路线 | 代表工作 | 核心主张 |
|---|---|---|
| Agentic RAG(多角色协同) | IteraSim RAG (arXiv:2607.20346)、DIVERGE (arXiv:2602.00238)、PathRouter (arXiv:2606.16409) | 让检索 / 草拟 / 审查 / 反思独立为不同 agent |
| Memory-as-State(记忆即执行状态) | MAGE (arXiv:2606.06090)、MRAgent (arXiv:2606.06036)、ACL Memory Survey (arXiv:2605.06716) | 把 RAG 提升为长程 agent 的执行状态管理层 |
| RAG × 推理 / RL(奖励对齐) | PathRouter(GraphRAG + GRPO)、Iterative RAG (arXiv:2601.19827) | 用 staged retrieval 替代"理想证据存在即可"的假设 |
| RAG × 推理系统(prefill / KV-cache) | RAPID (arXiv:2502.20330)、SIFT (arXiv:2606.09441)、Simplified Sparse Attention (arXiv:2604.20920) | 用检索同时加速并提升长上下文生成 |
| 评测 / 安全 / 治理 | RAGPerf (arXiv:2603.10765)、RAGCap-Bench (arXiv:2510.13910)、AgenticRAGTracer (arXiv:2602.19127)、SSGM (arXiv:2603.11768)、Long-Term Memory Security (arXiv:2604.16548) | 把 RAG 当作可验证系统来评测和加固 |
二、关键工作贡献与相互关系
2.1 经典地基:Lewis / Gao / Karpukhin
Gao et al. (arXiv:2312.10997) 是目前社区引用量最高的 RAG 综述(OpenAlex 被引 686 次、影响力被引 234 次)。它把过去三年散落在 NeurIPS / ICLR / EMNLP / SIGIR 上的零散工作归纳为 Naive → Advanced → Modular 三阶段,并提供了 Retrieval / Generation / Augmentation 三维拆解。后续几乎所有 Agentic RAG 综述(包括 2501.09136、2603.07379)都以它的术语体系为起点。
2.2 Agentic RAG 的两条主线
主线 A:编排型——以 LangChain / LangGraph / LlamaIndex / DSPy / FROAV (arXiv:2601.07504) 为代表的可观测 agentic RAG 框架,强调把检索、评估、人类反馈可视化、可插拔。FROAV 的核心贡献是给研究者提供了一个"开箱即用 + 可视化 + 四维评估"的研发平台,降低 RAG 实验的工程门槛。
主线 B:检索-推理耦合型——以 IteraSim RAG (arXiv:2607.20346)、DIVERGE (arXiv:2602.00238)、PathRouter (arXiv:2606.16409) 为代表。IteraSim RAG 把"检索 agent + 草拟 agent + 审查 agent"三角校验范式落地到 OpenFOAM CFD 配置;DIVERGE 提出 diversity-quality 权衡的反思引导检索;PathRouter 则在 GraphRAG 上用 evidence-path overlap 与 GRPO 优势缩放,缓解 answer-path reward aliasing。
2.3 记忆治理与 RAG 的边界融合
这是 2026 年最值得关注的范式转移。ACL 2026 的 LLM Agent 记忆机制演进综述 (arXiv:2605.06716,S2: 9) 把 agent 记忆形式化为 Storage → Reflection → Experience 三阶段,并报告了 GAIA 上 +6.1%、LoCoMo +4.8%、链级 +3.7% 的实证结果。
MAGE (arXiv:2606.06090) 与 MRAgent (arXiv:2606.06036) 是这一脉的最新方法:MAGE 把历史组织为两层状态树(底层 action-observation trace,上层子目标摘要),在 MemoryArena 上平均任务成功率相对基线提升 7.8–20.4 pp,token 消耗降 55.1%;MRAgent 用"主动重构 + 联想记忆图"显式把 LLM 推理融进记忆访问。两篇的共同信号是:把"记忆"从检索后端提升为执行状态管理层。
安全侧 SSGM (arXiv:2603.11768) 与 Long-Term Memory Security (arXiv:2604.16548) 则从反面给出提醒:长期记忆的"语义漂移 + 知识泄漏 + 拓扑性错误累积"无法在 retrieval 或 execution 阶段后置加固,必须以 storage-time provenance / versioning / policy-aware retention 为锚。这与上文 MAGE 的"分层状态树 + Revise 操作"在治理思路上一致——治理必须在写入时开始。
2.4 检索与推理系统的双向加速
RAG 不再只是"知识增强",也在反向加速推理:
- RAPID (arXiv:2502.20330):把 RAG 用作 speculative decoding 的 drafter,对长上下文同时加速并提升质量,是"检索即解码"路线的代表。
- SIFT (arXiv:2606.09441):利用注意力不变性,在 RAG prefill 阶段只索引高注意力位置,把数万 GB 的向量库检索从 GPU 关键路径上摘出来,显著降低 TTFT。
- Simplified Sparse Attention (arXiv:2604.20920):提出无需架构改动的稀疏注意力,gist-of-gist 变体在 32× 压缩比下保持精度。
- Lost at the End (arXiv:2606.16494):反过来指出"召回@K 不是 KB-VQA 的正确指标",并设计 gold-position 协议,证明 reader 侧的首因偏差必须由 reader 侧介入修正。
2.5 评测与基准:从端到端到中间步骤
- RAGPerf (arXiv:2603.10765):端到端 RAG 系统基准,覆盖 Wikipedia (6.41M 条目)、Arxiv (30K PDFs)、GitHub Code (11M)、The People's Speech (300K 音频),性能开销可忽略。
- RAGCap-Bench (arXiv:2510.13910):能力导向评测,把规划 / 检索 / 推理中间过程拆开打分,揭示中间错误如何级联影响最终答案。
- AgenticRAGTracer (arXiv:2602.19127):首个由 LLM 自动构建、面向逐步验证的 Agentic RAG 基准,支持 hop-aware 多跳诊断。
- Is Agentic RAG Worth It? (arXiv:2601.07711):直接给"Enhanced vs Agentic"两种范式做受控实验,明确在不同预算 / 任务类型下的选择。
2.6 极简对照:关键词搜索可能就够了
Keyword Search is All You Need (arXiv:2602.23368,AAAI 2026) 给出了对 RAG 范式的"反向证据"——在只允许使用基础关键词搜索的条件下,系统对比 RAG 与 tool-augmented agent 的检索与响应质量,对"重型 RAG"叙事的成本/收益提出怀疑。这条工作与 PathRouter / SIFT 一起构成本综述批判视角的关键素材。
三、工程视角(可落地性)
3.1 已具备生产可用度的部件
- 可插拔框架层:FROAV (arXiv:2601.07504)、LangChain / LlamaIndex / DSPy 等已经基本闭环。
- 企业级工程蓝图:AI Engineering Blueprint for On-Premises RAG (arXiv:2604.01395) 把可扩展本地化部署 RAG 的工程蓝图拆为基础设施、多租户、混合检索、监控四块,是 2026 年企业落地最直接的参考。
- 检索优化加速:SIFT (arXiv:2606.09441)、RAPID (arXiv:2502.20330)、Simplified Sparse Attention (arXiv:2604.20920) 都给生产 RAG 带来可量化的延迟 / 成本改进。
3.2 仍不成熟的环节
- Agentic RAG 的端到端可靠性:Is Agentic RAG Worth It? (arXiv:2601.07711) 与 Keyword Search is All You Need (arXiv:2602.23368) 同时表明:在不少场景下,加 agent 带来的复杂性与收益并不匹配。
- 多模态 / 跨模态评测:Lost at the End (arXiv:2606.16494)、VideoRAG / V-RAGBench (arXiv:2606.13141) 揭示了首因偏差与"recall@K 错指标"两大盲区。
- 科学 / 垂直场景:Iterative RAG (arXiv:2601.19827) 表明"理想证据存在"并不等于"好答案",staged retrieval 才对科学问答真正有效。
四、研究视角(创新性)
4.1 范式级创新
- MRAgent (arXiv:2606.06036):把"记忆是被重构而非被检索"上升为方法论,是 RAG 与 memory 边界融合的代表。
- PathRouter (arXiv:2606.16409):把检索轨迹与答案正确性联合评估,引入 evidence-path overlap 类别化奖励,缓解 RL 训练中的捷径式强化。
- AutoIndex(Tom 雷达 2026-07-23 提及,arXiv:2607.18603,未建卡):把文档预处理程序本身视为可学习对象,开辟了"检索优化第三条路"(区别于改 embedder 与改粒度)。
- SoK: Agentic RAG (arXiv:2603.07379):用 POMDP 形式化检索-生成循环,为后续研究提供可分析基础。
4.2 系统级创新
- RAGPerf (arXiv:2603.10765):把 RAG benchmark 推到系统级而非答案级。
- AgenticRAGTracer (arXiv:2602.19127):LLM 自动构建 + 逐步验证。
- FROAV (arXiv:2601.07504):可视化工作流 + HITL + 四维评估。
五、批判视角(局限)
5.1 评测失真
- RAG 评测依赖 query-level oracle(参考答案 / 相关性标注),但 Chunk Coverage(Tom 2026-07-22 E1 简报中提及,arXiv:2607.18155)指出 oracle 质量决定了评测上限。
- Lost at the End (arXiv:2606.16494):recall@K 对 KB-VQA 是错误指标。
- RAGCap-Bench (arXiv:2510.13910) 揭示了端到端正确率掩盖中间步骤失败的问题。
5.2 范式过度工程化
- Keyword Search is all you need (arXiv:2602.23368) 与 Is Agentic RAG Worth It? (arXiv:2601.07711) 同时提醒:重型 RAG / Agentic RAG 在基础关键词搜索 + 强 LLM 面前可能并不显著胜出。
- Tom 雷达 2026-07-24 引用的 datanucleus.dev 行业指南指出,27% 用户会全审输出——Agentic RAG 真正的差异化不在"找得更多",而在"可验证 + 可审计"。
5.3 记忆治理盲区
- SSGM (arXiv:2603.11768):长期记忆治理必须在存储阶段而非检索 / 执行阶段锚定。
- Long-Term Memory Security (arXiv:2604.16548):memory poisoning 攻击面与 OS 层级自托管 agent 攻击面构成垂直分层,RAG 安全无法脱离系统栈单独设计。
- Tom 雷达 2026-07-23 警示 2 提到的 Self-State Attacks(arXiv:2607.17986)进一步指出 OS 层攻击面本质上不可区分。
5.4 数据 / 检索粒度的盲区
- DataEvolver (arXiv:2606.07001) 等工作揭示 RAG 训练数据准备(多层级自演化)是 RAG 本身的"上游暗物质",下游再花哨也无法补救数据质量。
六、趋势判断与开放问题
6.1 趋势
从可观察证据(被引链路、Tom 雷达 7 日增量、CSDN 工程实战)可以收敛出以下五条趋势线:
- RAG → Agentic RAG → Compound AI Systems 的范式收敛(arXiv:2506.04565、arXiv:2603.07379、arXiv:2501.09136 三份综述交叉验证)。论文社区从 2024 年起在术语层已基本统一"系统 > 模型"这一判断,分歧仅在于粒度(是 4 范式、6 模式还是 POMDP 形式化)。
- 记忆与检索的边界融合:MAGE / MRAgent / ACL Memory Survey 把 RAG 推向"记忆即执行状态",同时 SSGM / Long-Term Memory Security 把治理压回存储阶段。
- RAG 反哺推理系统:RAPID / SIFT / Simplified Sparse Attention 把检索从"知识增强"提升为"延迟 / 成本优化器"。
- 评测从答案级走向过程级:RAGCap-Bench / AgenticRAGTracer / RAGPerf 共同把评测粒度细化到中间步骤与系统行为。
- 数据准备成为上游瓶颈:DataEvolver (arXiv:2606.07001) 类工作预示 RAG 研究前移到数据治理层。下游 chunking、嵌入、检索、再排序再精巧,也无法掩盖训练语料本身的质量与覆盖度问题。多层级自演化数据准备正在成为 RAG 流水线的标准前置模块。
需要特别指出的是:上述五条趋势彼此并不独立,而是同一"系统复杂度上移"的不同切面——当检索被纳入 agent 决策循环时,记忆治理压回存储阶段;当推理系统把检索当 drafter 时,检索粒度被推向更细的 token 级;当评测粒度细化到中间步骤时,传统端到端正确率叙事失效。RAG 的研究重心正在从"召回率"转向"系统行为可验证"。
6.2 开放问题
- Agentic RAG 的最优角色切分粒度(IteraSim RAG 三角色只是起点,是否需要 5 个、10 个?)
- 长期记忆与检索的统一接口:MRAgent 的"主动重构"是否可形式化为统一算子?
- 检索粒度(item / chunk / passage / document)与索引程序(AutoIndex 类)的联合学习如何避免相互干扰?
- RAG 安全栈(应用层 / memory 层 / OS 层)的协同防御协议尚未出现统一标准。
- 多模态 RAG 的"reader 侧位置偏差"如何与 recall 指标体系彻底解耦?
- 在何种条件下"关键词搜索 + 强 LLM"是 Agentic RAG 的严格占优策略?需要更细粒度的子任务画像。
七、本综述使用的 arxiv 号清单
核心综合(9 篇) - 2312.10997(RAG Survey,Gao et al.) - 2501.09136(Agentic RAG Survey) - 2506.04565(Compound AI Systems Survey) - 2603.07379(SoK: Agentic RAG) - 2601.07711(Is Agentic RAG Worth It?) - 2605.06716(LLM Agent Memory Mechanisms Survey) - 2606.06090(MAGE)、2606.06036(MRAgent) - 2602.00238(DIVERGE)
邻接与对照(6 篇) - 2502.20330(RAPID)、2606.09441(SIFT)、2604.20920(Simplified Sparse Attention) - 2602.23368(Keyword Search is All You Need) - 2603.11768(SSGM)、2604.16548(Long-Term Memory Security Survey)
次要参考(8 篇,文中提及) - 2606.16409(PathRouter)、2601.19827(Iterative RAG)、2606.16494(Lost at the End) - 2607.20346(IteraSim RAG)、2606.13141(VideoRAG / V-RAGBench) - 2603.10765(RAGPerf)、2510.13910(RAGCap-Bench)、2602.19127(AgenticRAGTracer) - 2601.07504(FROAV)、2604.01395(On-Premises RAG Blueprint) - 2606.07001(DataEvolver)