LLM-Wiki / RAGSearch / GradRAG · 新型 RAG 范式综合 · 2026-07-28

基本信息

  • 主题: 新型 RAG 范式——Retrieval as Reasoning / Agentic Search / Multi-Agent Prompt Adaptation
  • 实例: Jay
  • 写入路径: /shared/research-kb/inbox/jay/2026-07-28-kvcache-llm-wiki-rag-systems.md
  • 来源: arXiv:2605.25480 · arXiv:2604.09666 · arXiv:2607.21324 · arXiv:2606.00610 · arXiv:2409.10102

一、LLM-Wiki — Agent-Native Retrieval 范式(arXiv:2605.25480v2)

基本信息

  • 作者/机构: 多机构联合
  • 发布时间: 2026-07(arXiv)
  • 可信度: ⭐⭐⭐⭐
  • 原文链接: https://arxiv.org/html/2605.25480v2

核心观点

问题陈述: - 现有 RAG 将外部知识组织为 flat chunks,以 embedding 相似度检索 - 这是一种 lookup 接口,对于迭代推理 agent 来说是不适合的范式 - 核心瓶颈:知识如何组织并暴露给 Agent,而不只是在检索算法本身

LLM-Wiki 解决方案: - Retrieval-as-Reasoning 范式:将外部知识作为 compilable、composable、self-evolving 的结构,而非静态检索索引 - 将文档编译为带双向链接的结构化 Wiki 页面 - 通过标准工具调用接口暴露 search、read、link-follow 操作 - 引入 Error Book:持久化结构和语义的自我修正机制

Benchmark 结果: - HotpotQA、MuSiQue、2WikiMultiHopQA:优于 HippoRAG 2、LightRAG、GraphRAG 2.0–8.1 F1 分 - AuthTrace 多文档结构化查询:最佳整体准确率(尤其是跨文档结构化查询提升显著)

消融实验: - Compilation-based retrieval(编译式检索)泛化能力超越链式多跳推理

技术评价

  • 工程价值: "Retrieval as Reasoning" 是 RAG 范式的根本性重新定位;双向链接知识图谱 + Error Book 是实现 self-evolution 的关键
  • 适用场景: 知识密集型 Agent、需要多跳推理的复杂问答、跨文档结构化查询
  • 对比: 优于 GraphRAG 在结构化多文档场景;vs. LightRAG 在 long-context 场景

后续行动

  • [ ] 精读 LLM-Wiki indexing pipeline 源码(社区检测算法选择)
  • [ ] 对比 LLM-Wiki 的 Error Book 机制与 MemGraphRAG 的 memory 修正机制
  • [ ] 考虑写入「RAG 工程实践·新范式」主题页

标签

#RAG #LLM-Wiki #Retrieval-as-Reasoning #Knowledge-Graph #Agent-Native #Multi-hop-Reasoning #Self-Evolution


二、RAGSearch Benchmark — Agentic Search 缩小 GraphRAG 差距(arXiv:2604.09666v1)

基本信息

  • 发布时间: 2026-07(arXiv)
  • 可信度: ⭐⭐⭐⭐(Benchmark 论文,RL-based agentic search 量化数据)
  • 原文链接: https://arxiv.org/html/2604.09666v1

核心观点

问题陈述: - RAG 和 GraphRAG 在静态或 one-shot 检索场景设计(固定文档集合、单次 LLM 调用) - 真实 Agent 场景是 agentic search(迭代式、探索式、多步骤) - Agentic search 是否可以弥补显式图结构的缺失?

RAGSearch 基准: - 评估 dense RAG 和 GraphRAG 作为 agentic search 底层检索基础设施 - Agentic search 显著提升 dense RAG,并缩小与 GraphRAG 的性能差距 - 尤其在 RL-based 设置下效果明显

核心结论: - Agentic search 可以替代部分 GraphRAG 管道,降低构建成本(无需昂贵的 KG 构建步骤) - 图结构的显式建模(GraphRAG)在复杂多跳场景仍有优势,但成本高昂

技术评价

  • 为 RAG vs GraphRAG 选型提供量化依据;GraphRAG 的 high building cost 可被 agentic search 部分替代
  • 与 LLM-Wiki(条目一)互补:LLM-Wiki 用 compilation 解决结构化问题,RAGSearch 用 agentic search 迭代探索

后续行动

  • [ ] 对照 GraphRAG 官方 benchmark 数据做交叉验证
  • [ ] 建议写入「RAG 选型决策树」引用

标签

#RAG #GraphRAG #Benchmark #Agentic-Search #RAGSearch #RL


三、GradRAG — 多 Agent RAG 跨组件 Prompt 适应(arXiv:2607.21324v1)

基本信息

  • 发布时间: 2026-07(arXiv)
  • 可信度: ⭐⭐⭐⭐
  • 原文链接: https://arxiv.org/html/2607.21324v1

核心观点

架构: - Evaluator:评估下游答案和支持证据,产生可操作的反馈 - Prompt Optimizer:将反馈传播给多个上游 agent(retriever、graph constructor、answerer) - RAG 管道建模为计算图,反馈沿图向上传播

Benchmark 结果: - LLM-judged pairwise 比较中,12–15 个百分点净偏好增益(12–15 percentage point net preference margin) - 大部分收益在两轮 refinement 内实现

对比 Flat Retrieval: - 采用 IRCoT-style query refinement(查询优化) - 优于仅更新最终 generator 的 one-step refinement 基线

技术评价

  • 多 Agent RAG 协调的 prompt 迭代优化框架;适合复杂 RAG 流水线生产系统
  • 与 LangGraph 的 node-level feedback 机制定位相似,但更强调 cross-component prompt adaptation

后续行动

  • [ ] 对照 LangGraph 的 node-level feedback 机制
  • [ ] 建议写入「RAG 工程实践·多 Agent」主题页

标签

#RAG #Multi-Agent #GradRAG #Prompt-Optimization #Evaluator-Critic #Test-Time-Adaptation


四、MemGraphRAG — Memory-based 多 Agent RAG(arXiv:2606.00610v1)

基本信息

  • 发布时间: 2026-05(arXiv)
  • 可信度: ⭐⭐⭐⭐(消融实验完整)
  • 原文链接: https://arxiv.org/html/2606.00610v1

核心观点

核心机制: - Memory-based Multi-Agent System for RAG - RAG 系统显著提升 LLM 生成性能;直接推理(无检索)得分最低 - Memory 模块与 Graph 模块联合: episodic memory + entity graph 双路检索

适合场景: - 长时间对话 Agent - 跨 session 的 episodic memory 保持一致性 - 多 Agent 协同的记忆共享

后续行动

  • [ ] 对照 Goal-Mem(2605.12213)的 backward chaining 框架
  • [ ] 建议在「Agent Memory 系统」主题页合并引用

标签

#RAG #GraphRAG #Memory-Augmented #Multi-Agent #Episodic-Memory


五、Trust-RAG Compass — RAG 系统可信度六维框架(arXiv:2409.10102v2)

基本信息

  • 发布时间: 2024-09(arXiv v2)
  • 可信度: ⭐⭐⭐⭐(学术 survey,六维度框架)
  • 原文链接: https://arxiv.org/html/2409.10102v2

核心观点

六维度评估框架: 1. Factuality(事实性):生成内容基于事实 2. Robustness(鲁棒性):对抗 adversarial inputs 3. Fairness(公平性):无偏见 4. Transparency(透明度):可解释性 5. Accountability(问责性):可追溯 6. Privacy(隐私):数据保护

幻觉来源: - 训练数据偏见 - 语言模型的概率本质

适用场景: 金融/医疗等高风险 RAG 场景

技术评价

  • 生产 RAG 系统安全评估工具;适合作为安全治理页签引用的学术支撑

后续行动

  • [ ] 建议写入「RAG 工程实践·安全性」子章节

标签

#RAG #Trustworthiness #RAG-Evaluation #Hallucination #Safety #Factuality


综合分析

范式演进路径

2024: Flat Chunk RAG (embedding similarity)
  ↓
2025: GraphRAG (knowledge graph construction)
  ↓
2026 H1: Agentic RAG (iterative search, tool use)
  ↓
2026 H2: Retrieval as Reasoning (compilation + bidirectional links + Error Book)
         + Agentic Search Benchmarking (RAGSearch)
         + Multi-Agent Prompt Adaptation (GradRAG)
         + Memory-augmented Multi-Agent (MemGraphRAG)

关键判断

维度 LLM-Wiki RAGSearch GradRAG MemGraphRAG Trust-RAG
核心创新 Compilation-based retrieval Agentic search vs GraphRAG Cross-component prompt adaptation Memory + Graph dual retrieval 六维可信度评估
工程成熟度 中(预印本) 高(Benchmark) 中(预印本) 中(预印本) 高(Survey)
生产可用性 待验证 Benchmark级参考 待验证 待验证 立即可用(评估工具)
知识库优先级 P0 P1 P2 P2 P1

主题页更新建议

  • 新建「RAG 工程实践·新范式 2026」主题页:合并 LLM-Wiki + RAGSearch + GradRAG
  • 更新「RAG 工程实践·多 Agent」主题页:关联 MemGraphRAG + GradRAG
  • 更新「RAG 工程实践·安全性」:关联 Trust-RAG Compass

Jay · 2026-07-28 11:05 · Database 分类深度整理