主题综述 · RAG(2026-08-01)

  • 作者:spark
  • 更新:2026-08-01

引子:为什么 2026 H2 还要重读 RAG

2026 年 H2 的 LLM 应用栈里,RAG 已经不再是 2023–2024 那种"向量检索 + 提示词拼接"的固定管线。围绕它的争论也从"RAG 还是长上下文"逐渐让位给更细的问题:在 agentic 循环里,检索该由谁调度?多模态证据要不要做图结构?知识图谱、向量、重排序器能不能拼成可量化的选型空间?2026 年 7 月以来一波新工作(DualG-MRAG、GLM-RAG、MisKnow-Agent、Filesystem-Based Memory、Metis 等)把这些工程取舍推到了一个新的张力点。本文综合 8 篇代表性工作,沿"主题脉络 → 各工作贡献与相互关系 → 工程 / 研究 / 批判三视角 → 趋势判断与开放问题"四个层次做深度综述。

参考的资料库包括 /shared/research-kb/organized/paper_cards/主分类=rag 的卡片、/shared/research-kb/organized/knowledge/rag.md 的 R50 活文档、/shared/research-kb/inbox/{tom,jay,flyp} 近 7 天的 radar 与 e1prep 笔记,并辅以 2 次 web_search 印证 2026 H2 最新动态。


一、主题脉络:从 Naive RAG 到"七元 Runtime Stack"

Naive → Advanced → Modular RAG(2312.10997,Gao et al.,2023-12,S2 引用 3763) 是 RAG 领域被引用最广的综述,奠定了今天讨论的范式骨架。论文把 RAG 演进划分为三段:

  1. Naive RAG:Indexing → Retrieval → Generation 线性管道。问题集中在检索质量(低精度、漏召回)、生成幻觉、chunk 边界粗糙。
  2. Advanced RAG:在检索前后加入 Pre-Retrieval(查询重写、HyDE、query 扩展)与 Post-Retrievel(重排序、上下文压缩、citation 注入)模块。
  3. Modular RAG:检索、生成、增强不再被视为串行管线,而是按需拼装的可替换模块,引入了 Routing、Scheduling、Reflection 等控制机制。

这一三段划分在 2026 年的新工作里仍然管用——但被进一步推进。

Compound AI Systems Survey(2506.04565,S2 引用 8) 把 RAG 放回更大的视野:CAIS 主张用 RAG、Agents、MLLM、Orchestration 四个基础范式的组合替代"独立大模型"。在 CAIS 的分类里,RAG 是"知识供给 + 上下文治理"层,agent 是"规划与工具调用"层,MLLM 是"多模态感知"层,orchestration 是"协调与监控"层。这一定位解释了 2026 H2 为什么 RAG 和 Agent 在论文里频繁合体:单独的 RAG 已经不够,必须挂到 agentic 循环里才能发挥价值。

SoK: Agentic RAG(2603.07379,ACL 2026 / Open MIND,S2 引用 5) 是更聚焦的一份 SoK。它把 agentic 检索-生成循环形式化为有限时域部分可观测马尔可夫决策过程(finite-horizon POMDP),显式建模控制策略与状态转移,并按"规划机制 × 检索编排 × 记忆范式 × 工具调用行为"四维给出分类学。六类典型设计模式是 Decomposition、Recursive、HITL、SQL-like、Hypothetical Document、Hybrid。它提出的核心挑战——Retrieval Drift 与 Query Misalignment——是后面若干工作的共同出发点。

Is Agentic RAG Worth It?(2601.07711,S2 引用 4) 给出了实证基准:在多组任务上同时跑 Enhanced RAG 和 Agentic RAG,结果是 agentic 范式并非在所有任务上都赢——任务可解构、检索预算可控时 Enhanced RAG 反而更省、更稳。这篇工作把"Agentic RAG 是默认"的神话泼了一盆冷水,明确指出选型必须按"任务可解构度 + 检索预算 + 延迟约束"三维做权衡。

把这些论文串起来,2026 H2 的 RAG 主题脉络可以概括为:

Naive → Advanced → Modular RAG(Gao 2023)
              ↓
       Compound AI Systems(CAIS 2025)
              ↓
    Agentic RAG SoK(2026,PomDP 形式化)
              ↓
   Enhanced vs Agentic 实证对比(2026,告诉我们:选型!)
              ↓
    2026 H2 的两大新轴:
      [A] 多模态 / KG-RAG 的"图结构 + 跨模态证据"深化
      [B] 记忆 / 文件系统 / 可靠性等"长期上下文治理"问题

知识库活文档 /shared/research-kb/organized/knowledge/rag.md R50 把这条主线归纳为"RAG 已演化为 Knowledge Runtime + Memory + RAG + Long-Context + Harness + Agentic-Search + Agent-Native Retrieval 七元 runtime stack"。


二、各工作贡献与相互关系

下面聚焦 4 篇 2026 H2 的 RAG-primary 新工作,按"它们分别回应哪一类问题"组织。

2.1 DualG-MRAG(2607.28580,paper_cards/674,ACM MM 2026 接收,12 pages)

问题:多模态 RAG 在多跳推理任务上长期被"粒度困境"卡住——细粒度视觉特征会让图迅速膨胀、引入检索噪声,粗粒度表示又会把关键局部证据丢掉。

方法:DualG-MRAG 提出双层(dual-tier)解耦框架,把知识表示拆成 Macro-Reasoning Graph(跨模态结构路由)和 Micro-Matching Graph(实例级视觉验证)。宏层负责多跳关系建模,微层负责实例级对齐,两层在训练和检索阶段彼此正交。web_search 印证:ACM MM 2026 已接收,作者团队为 Jiacheng Tao / Qingyun Sun / Haonan Yuan / Ziwei Zhang / Jianxin Li(arXiv 元数据)。

关系网络:DualG-MRAG 与 619(DeCoRAG,认知解耦 + 语义感知裁剪)、676(ConMem,贡献感知记忆)、674 自身构成 2026 年多模态 RAG "复杂文档 / 长周期日志 / 图结构化" 三条相近但侧重不同的路径。DualG-MRAG 是其中架构层面最系统的解耦方案。

2.2 GLM-RAG(2607.28397,paper_cards/675)

问题:基于知识图谱的 RAG 选型缺乏量化依据。GLM-based、GNN-based、Vector search 三类检索器在不同跳数(单跳 vs 多跳)的图问答任务上到底谁更强,一直没有大规模对比。

方法:GLM-RAG 系统性地对比了上述三类检索器,覆盖单跳与多跳 KG-RAG。这是 KG-RAG 领域第一份大规模量化对比。web_search 印证:作者 Maya Arseven / Anette Frank / Beni Egressy / Johann Higl / Moritz Plenz。

关系网络:GLM-RAG 与 675 自身在知识库 R50 综述 45 件中被立标为"综述第 45 件"——它既是方法,也是综述,承接着 GraphRAG、LightRAG、HippoRAG 2、MuRAG、MG²-RAG 等若干历史工作,并把它们放进同一对比口径。这是 RAG 选型从"经验拍脑袋"走向"实验选型"的关键节点。

2.3 RAPID(2502.20330,paper_cards/040,S2 引用 11)

问题:长上下文推理里,RAG 不只是"喂知识",也能反过来加速生成。现有 speculative decoding 用 draft model 走快、用 target model 验证,但 draft model 本身在长上下文里依然需要大量参数和显存。

方法:RAPID 用 RAG 作为 drafter——用一个轻量 RAG 模块直接生成候选 token,再由 target model 验证,形成 inference-time knowledge transfer:RAG 把目标分布"拉近"到 ground truth 分布。这一思路在 LLaMA-3.1 / Qwen2.5 系列上验证。

关系网络:RAPID 把"工程视角"拉回到 RAG。它和 KV Cache Transform Coding(ICLR 2026,2511.01815)、Harvest(2602.00328)等一起说明:2026 年 RAG 已经不止是"提示词增强",而是进入推理系统栈(KV Cache、Speculative Decoding、GPU Memory)的内部。R50 活文档把这层视为 RAG 的"runtime 与基础设施"面。

2.4 Knowledge Inconsistencies Across Text, Tables, and Knowledge Graphs(2607.25959,paper_cards/644)

问题:Wikipedia / Wikidata 等被广泛用于 LLM 预训练与 RAG 的数据源,文本、表格、知识图谱三种模态之间存在不一致。当三种模态"打架"时,RAG 系统如何检测并解释冲突?

方法:论文把问题形式化为 modality-level inconsistency detection,先构造对比基准,再用结构化方法识别冲突并给出可解释的证据链。

关系网络:和 MisKnow-Agent(2607.20891,paper_cards/687,agent-primary 但 R50 归入 RAG 评测)一起,构成 2026 H2 的 RAG 可靠性轴——前者关注"知识源内部不一致",后者关注"外部误导知识通过 Deep Research Agent 的传播"。两条线都把 RAG 评测从"答案正确率"推向"证据可信度"。

2.5 横向对比

工作 主要问题 形态 关键贡献
2312.10997 RAG 综述空白 survey Naive/Advanced/Modular 三段范式
2506.04565 CAIS 范式分散 survey RAG + Agent + MLLM + Orchestration
2603.07379 Agentic RAG 无形式化 position/SoK PomDP 形式化 + 六类设计模式
2601.07711 Agentic RAG 被默认 benchmark Enhanced vs Agentic 实证对比
2607.28580 MM-RAG 粒度困境 method 宏-微双层解耦图(ACM MM 2026)
2607.28397 KG-RAG 选型无依据 survey+method GLM/GNN/vector 大规模对比
2502.20330 RAG 与推理加速脱节 method RAG-as-Drafter for Speculative Decoding
2607.25959 RAG 源不一致 method 三模态冲突检测与可解释

相互关系上:2312.10997 和 2506.04565 是上层叙事;2603.07379 与 2601.07711 互补界定 agentic 维度的形式化 vs 实证;2607.28580 / 2607.28397 / 2607.25959 是 2026 H2 三大新方法支柱,分别覆盖多模态、KG、可靠性;2502.20330 把 RAG 拉进推理栈底层。R50 活文档把这 8 件与 Metis / Filesystem Memory / MisKnow-Agent 等共同归入"六联协同"——当下 RAG 主题的最大颗粒度。


三、工程视角:可落地性

工程视角关注"真能部署吗、值多少钱"。

1) 三路融合检索已在生产中验证。 APS-RAG(2607.24663,paper_cards/618)在阿贡国家实验室先进光子源(APS)部署:dense + sparse + KG 三通道 query-type 自适应 RRF 融合 + corrective agent 修正层。处理电子日志、技术文档、wiki、聊天记录、维护记录、实时控制系统六类异构源——典型"异构企业知识库"。其 operations-grounded 评估值得借鉴:用真实运维数据替代学术基准

2) Enhanced RAG vs Agentic RAG 的成本曲线非常不同。 2601.07711 的实测显示,agentic 范式在可解构任务上需要更多 LLM 调用次数、更长延迟,而 Enhanced RAG(query rewriting + reranker + simple RAG)往往能用不到一半的 token 预算达到相近质量。工程选型的实操建议:

  • 任务简单、检索预算可控、延迟敏感 → Enhanced RAG(重排器 + 查询改写)
  • 任务需多步推理、需要工具调用、需要自检 → Agentic RAG(但要规划 token budget)

3) 多模态复杂文档需要"裁剪 + 解耦"。 DeCoRAG(2607.24554,paper_cards/619)的 cognitive decoupling + semantic-aware cropping 直接对应图表密集版面的工程痛点:VLM 解析稀疏语义常常失准、token 开销高,所以要把语义层和视觉层分开处理,再用语义相关性而非固定窗口裁剪。

4) 长期记忆正在走向文件系统化。 Filesystem-Based Memory(2607.26637,paper_cards/686)首次系统评估"agent 用文件系统(markdown 目录树 + 通用文件工具)当记忆方案"。三个假设——组织保持、冲突与过期处理、净收益——被一起验证。这条路径对中小团队特别友好:不需要造专用记忆数据结构就能起步。

5) 推理系统栈整合。 RAPID(2502.20330)让 RAG 模块进入 speculative decoding 内部,与 KV Cache Transform Coding(ICLR 2026)、Harvest P2P GPU Cache 共享等一起,把"是否启用 RAG"从应用层选择推向系统层强制。这一变化意味着 2026 年下半年的推理框架(SGLang、vLLM、TensorRT-LLM)很可能内建 RAG-as-drafter 选项。

6) 评估与治理工具链成型。 R50 活文档记录 RAG 评测 39 件、RAG 安全 36 面、选型 v3.15 32 维、归因 19 层、五层质量矩阵。工程团队在选型阶段已经可以套用这套结构化清单,而不是凭直觉。

工程视角的总体判断:2026 H2 的 RAG 已具备企业级部署条件,但前提是要做"任务画像 → 选型 → 评估 → 监控"四步闭环,而不是直接把 Naive RAG 套到所有场景。


四、研究视角:创新性

研究视角关注"是不是新问题、新方法、新可观测的现象"。

1) 多模态图结构的解耦表示(DualG-MRAG,2607.28580)。宏层与微层解耦不是简单地把两个模型并联——它的关键洞察是"图膨胀由细粒度视觉特征驱动",所以要把细粒度特征放到局部子图(Micro-Matching Graph)里,结构关系留给粗粒度的全局图(Macro-Reasoning Graph)。这是对 MM-RAG 失败模式的精准对应。ACM MM 2026 接收说明该贡献已被多媒体社区视为多模态 RAG 的里程碑。

2) KG-RAG 大规模对比基准(GLM-RAG,2607.28397)。把 GLM-based、GNN-based、vector search 三类检索器放进同一实验口径,并覆盖单跳与多跳,这本身就是贡献——它把"经验选型"问题变成了"可量化选型"问题。后续工作可以在此基础上加入 GraphRAG、LightRAG、HippoRAG 2 等扩展版本,做真正的 KG-RAG benchmark。

3) Agentic RAG 的形式化与实证二分(2603.07379 + 2601.07711)。形式化(POMDP + 分类学)告诉我们"agentic 循环的结构长什么样",实证告诉我们"在哪些条件下它真的更划算"。两篇工作同时存在意味着社区已经过了"agentic 万岁"阶段,进入精细化建模期。

4) RAG 与推理栈融合(RAPID,2502.20330)。RAG-as-Drafter 是把"知识注入"和"推理加速"耦合到一起的新视角,论文实证在 LLaMA-3.1 / Qwen2.5 上的生成质量与延迟权衡。这条思路后续可能与 KV Cache 压缩、speculative decoding 的 tree attention 等进一步融合。

5) 可靠性量化的两套机制(2607.25959 + 2607.20891)。前者量化"知识源内部不一致"(text/table/KG 之间的冲突),后者量化"误导知识通过 Deep Research Agent 的传播"。二者一起,把 RAG 评估从"答案正确率"推向"证据可信度 + 错误传播可追踪",是评测层面的重要创新。

6) 记忆内化 vs 外化(Metis 2607.26760 + MemGPT/Mem0/Zep/Graph-Native Bitemporal,R50 第 18 条腿候选 J)。Metis 把记忆编译进模型权重(Memory-as-Native-Primitive),与传统 RAG 外部模块路线正交,可能定义未来 1-2 年的研究分叉。

研究视角的判断:2026 H2 RAG 研究处于"分化期"——一边是工程化、量化选型(GLM-RAG、APS-RAG、DualG-MRAG),另一边是范式突破(Metis 内化、Filesystem Memory、MisKnow-Agent 可靠性)。与 R50 八角张力 ㉚ 一致。


五、批判视角:局限

1) 评估的可比性问题。 几乎所有 RAG 论文都在不同 benchmark 上做实验:HotpotQA、2WikiMultiHopQA、Natural Questions、WebQSP、CRUD-RAG、RGB、RECALL、APS-RAG operations-grounded 等。不同数据集的难度、口径、可量化指标不一致,导致"Agentic RAG 是否更好"在不同论文里得出相反结论。2601.07711 的价值就是给出 Enhanced vs Agentic 的对照实证,但样本任务仍有限。

2) RAG-as-Drafter 的适用边界。 RAPID(2502.20330)依赖 RAG 模块能给出"高质量候选 token",但 RAG 本身在事实密集型、知识更新快的任务上常常产生噪声。若 drafter 错误率太高,target model 的验证开销反而更大。当前论文在 LLaMA-3.1 / Qwen2.5 上验证,未必能推广到所有模型族。

3) DualG-MRAG 双层解耦的推理开销。 宏层 + 微层意味着两套图检索、两套编码,检索阶段延迟和显存压力都比单层图高。论文在 ACM MM 2026 实验里给出了准确率提升,但没有公开与 MuRAG、MG²-RAG、HippoRAG 2 等现有方案的端到端延迟对照。R50 活文档明确把它列为开放问题 111。

4) GLM-RAG 的 GLM 推理硬件门槛。 Graph Language Model 需要 GPU 大显存支持,推理延迟高于纯向量检索。GLM-RAG 的量化对比告诉了我们"质量上 GLM-based 通常更好",但没回答"在 8B / 32B 模型规模下还成立吗"、"在生产 GPU 上的 TCO 是什么"。这同样是 R50 开放问题 112。

5) 误导知识传播的可控性。 MisKnow-Agent(2607.20891)框架可生成误导知识用于测试,但反过来也说明真实生产环境里没有任何现成防护机制能完全阻断误导传播。论文给出 KG 校验 + 引用图谱作为缓解手段,但"长期累积错误"和"跨 agent 协同污染"仍未量化(R50 开放问题 113)。

6) 综述与方法的边界模糊。 GLM-RAG 既是综述也是方法,而 R50 活文档里又有"综述 45 件"清单。当一份工作既是 survey 又是 method 时,其与传统 survey 的可比性受限——读者容易把作者实测当作独立基准,而忽略数据集选择与超参设定的潜在偏差。

7) 工程化与学术化的张力。 APS-RAG(2607.24663)部署于先进光子源的真实生产环境,但论文侧重"我们做了什么",对失败案例、消融实验、ROI 测算相对薄弱。学术读者难以直接复现其评估口径,企业读者则难以判断迁移到自有场景的可行性。

批判视角的总体判断:2026 H2 的 RAG 研究在快速扩张,但评估口径、推理开销、可靠性量化三大问题仍是公认的痛点。这与 R50 开放问题 110-114 的判断一致。


六、趋势判断与开放问题

6.1 五条明确趋势

  1. RAG 与 Agent 的边界消融:SoK 把 agentic RAG 形式化为 POMDP,CAIS 把 RAG 与 agent 视为同一 runtime stack 的两层。短期内,几乎所有生产级 RAG 系统都将带 agentic 控制循环。
  2. 多模态 + 图结构成主流范式:DualG-MRAG、GLM-RAG、DeCoRAG、APS-RAG 等在 2026 H2 集中出现,表明"图结构 + 跨模态证据"是未来 12 个月的多模态 RAG 标配。
  3. 选型从经验走向量化:GLM-RAG、2601.07711、2603.07379 一起把"选哪类 RAG"从经验判断推向可量化决策。RAG 选型 v3.15 32 维(详见 R50)是这一趋势的工程化沉淀。
  4. 可靠性评测成为独立维度:MisKnow-Agent、2607.25959 等推动 RAG 评测从"答案正确率"扩展到"证据可信度 + 错误传播追踪"。R50 把 RAG 评测从 38 件扩到 39 件、RAG 安全从 35 面扩到 36 面,正是这一趋势的体现。
  5. RAG 进入推理系统栈:RAPID 让 RAG 成为 speculative decoding 内部组件;RAG-as-Drafter 与 KV Cache 压缩、GPU Memory 共享等系统级优化一起,构成"RAG-runtime" 这一新研究子方向。

6.2 四个开放问题

  1. Memory 内化 vs 外化的取舍(Metis 路线 vs RAG 经典路线):把记忆编译进模型权重,是否真正优于外部 RAG 模块?跨任务迁移、训练成本、MemoryAgentBench 适配、工业部署路径都是未知数(R50 开放 110)。
  2. KG-RAG 选型的可推广性:GLM-RAG 的对比在限定任务集上有效,但能否推广到医疗、法律、金融等强结构化领域仍未验证(R50 开放 112)。
  3. RAG 可靠性的工程治理:误导知识传播(MisKnow-Agent)与知识源内部不一致(2607.25959)的组合治理路径不明。KG 校验 + 引用图谱是否能成为通用治理框架,需要跨场景实证(R50 开放 113)。
  4. Agent 上下文治理的标准化:Filesystem-Based Memory(2607.26637)的三个假设(组织保持 / 冲突与过期处理 / 净收益)刚被系统评估,但与 Graph-Native Bitemporal 等成熟方案的对比、与多 Agent 共享存储的边界定义,仍需社区统一规范(R50 开放 114)。

6.3 方法论提醒

R50 活文档反复强调"OpenClaw 8 角色"作为方法论脚手架。这套"8 实例协同可消解"机制能把多个开放问题映射到具体可操作的实验上——这是把综述从"罗列文献"提升为"指导行动"的关键。


结语

2026 H2 的 RAG 已经不是"一个检索 + 一个生成"的简单组件,而是一个跨越知识供给、记忆工程、长期上下文、agentic 控制、多模态理解、推理栈、可靠性治理的多层体系。本文综合的 8 篇工作覆盖上层范式综述、agentic 形式化与实证、多模态与 KG-RAG 新支柱、推理系统融合、可靠性评测等关键节点。综述有边界——R50 活文档里大量 RAG-primary 工作(ConMem、OptGraph、BeyondUncertainty、APS-RAG、DeCoRAG、Regulatory RAG、LAMAR、AutoIndex、Chunk Coverage Testing、CVE→ATT&CK Mapping 等)及 agent-primary 但与 RAG 强邻接的工作(Metis、Filesystem-Based Memory、MisKnow-Agent)共同构成完整图景。下次综述可聚焦"Agentic RAG 实证 vs 形式的更精细对照"或"多模态 RAG 的 token 削减路径"。


综合论文清单(arXiv 号列表)

  • 2312.10997 — Retrieval-Augmented Generation for Large Language Models: A Survey(Gao et al., S2 引用 3763)
  • 2506.04565 — From Standalone LLMs to Integrated Intelligence — Compound AI Systems 综述
  • 2603.07379 — SoK: Agentic RAG(ACL 2026 / Open MIND)
  • 2601.07711 — Is Agentic RAG Worth It? An Experimental Comparison of RAG Approaches
  • 2607.28580 — DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal RAG(ACM MM 2026,12 pages)
  • 2607.28397 — GLM-RAG: Graph Language Models for Graph-Based Retrieval-Augmented Generation
  • 2502.20330 — RAPID: Long-Context Inference with Retrieval-Augmented Speculative Decoding
  • 2607.25959 — Detecting Knowledge Inconsistencies Across Text, Tables, and Knowledge Graphs