rag · E1 预消化简报(2026-07-22)

执行: Tom · 08:50 CST
范围: inbox 近 2 天(2026-07-20 ~ 2026-07-22)+ paper_cards 近 3 天新卡抽查
本简报目的: 为今晚 RAG 活文档接力预习备料,聚焦尚未进入 knowledge/rag.md R39 的增量条目


检查过的来源清单

来源 文件 主要 RAG 增量
Tom/inbox/tom 2026-07-22-agent-rag-longcontext-radar.md 今日 radar,3 高信号
Tom/inbox/tom 2026-07-22-agent-rag-longcontext-candidates.json 8 条候选去重后 4 新
Tom/inbox/tom 2026-07-21-rag-e1prep.md 昨日 E1 简报,含 9 条增量
Tom/inbox/tom/_candidates latest-rag-retrieval-reranking.json 2026-07-21 最新检索 rerank 候选
Jay/inbox/jay 2026-07-22-0820-morning-briefing-rag-optimization-agentic-ai-arxiv-csdn.md CSDN 工程 + arXiv Agentic AI 架构
Jay/inbox/jay 2026-07-21-llm-rag-agent-weekly.md RAG 2024-2025 全景survey
flyp/inbox/flyp 2026-07-21-coding-agents-e1prep.md 关联 Agent Memory,非 RAG 专项
spark/inbox/spark 2026-07-21-llm-infra-e1prep.md 推理 infra,RAG 邻接
spark/inbox/spark 2026-07-21-agent-e1prep.md Agent 主题,RAG 邻接
stephen/inbox/stephen 2026-07-21-llm-application-e1prep.md LLM 应用,RAG 邻接
paper_cards/ 469-480 ~ Jul 22 新卡(20张) 均为老 paper 重编目(DINOv2/BLIP-2/Toolformer 等),无实质当日新 RAG 论文
organized/queue/work-queue.md Jul 22 08:00 自动生成 Top-15 rag tag 含旧 paper,无当日新增

增量条目(5条,含 3 高信号 + 2 中信号)


增量 1 · ⭐⭐⭐⭐ 高 · 新增 arXiv 论文

来源: Tom/inbox/tom/_candidates/2026-07-22-agent-rag-longcontext-candidates.json(来源:arXiv,2026-07-20)
条目: Testing Retrieval-Augmented Generation Systems with Chunk Coverage
arXiv: 2607.18155(2026-07-20)
作者: Jinhan Kim, Samuele Pasini, Paolo Tonella

要点: 现有 RAG 评测依赖 query 级 oracle(参考答案/相关性标注),无法度量测试套件是否充分覆盖检索行为本身。本文提出 Chunk Coverage:衡量测试套件中各 chunk 是否被多样 query 触发、边界 case 是否被覆盖。首次系统定义 RAG 测试充分性,填补"检索组件是否被充分测试"这一空白。

与活文档 knowledge/rag.md R39 现有脉络的关系:
R39 §2.5 评测与泄漏(29 件套)覆盖了 MemoryAgentBench(arXiv:2507.05257)、TARS ToM-RAG、General AgentBench 等 benchmark。Chunk Coverage(arXiv:2607.18155)是 RAG 评测方法论的新维度——从答案质量深入到检索行为覆盖充分性,为高风险 RAG 系统测试套件设计提供新框架。可作为 RAG 评测 29 件套的第 31 件邻接(独立于 benchmark 质量评分的测试充分性维度)。
建议归入:§2.5 评测与泄漏(RAG 评测 29 件 → 31 件,新增测试充分性维度)

归入节: §2.5 评测与泄漏(Chunk Coverage = RAG 检索行为覆盖充分性新维度)

arXiv: 2607.18155


增量 2 · ⭐⭐⭐⭐ 高 · 新增 arXiv 论文

来源: Tom/inbox/tom/_candidates/2026-07-22-agent-rag-longcontext-candidates.json(来源:arXiv,2026-07-20)
条目: Vector Search As Nearest Neighbor Matching: RAG-based Policy Learning in Causal Inference
arXiv: 2607.18225(2026-07-20)
作者: Masahiro Kato, Taka Kato

要点: 将 RAG 动作选择纳入潜在结果框架(potential outcome framework),提出 one-step 和 two-step 方法做策略学习。Two-step 方法中,向量搜索在嵌入空间检索动作特异性邻近证据,生成器估计条件期望结果,再由 plug-in 规则选动作。将向量搜索与因果推断最近邻匹配形式化连接,分解 regret 为候选生成 regret 和候选内选择 regret 并给出边界。

与活文档 knowledge/rag.md R39 现有脉络的关系:
R39 §2.4 知识结构(32 件)覆盖了 GraphRAG(RAGU/EvoGraph/SAGE 等),§2.12 选型决策树覆盖了混合检索。RAG + Causal Inference(arXiv:2607.18225)将 RAG 推向因果推断场景——不同于传统知识问答 RAG,这是将 RAG 检索结果用于下游决策/策略选择的理论研究,属于 RAG 应用场景的新分支。
建议归入:§2.4 知识结构(32 件 → 33 件 = RAG-based Policy Learning in Causal Inference)

归入节: §2.4 知识结构(RAG + 因果推断 = RAG 决策/策略学习新场景)

arXiv: 2607.18225


增量 3 · ⭐⭐⭐⭐ 高 · 新增 arXiv 论文(跨模态 RAG 场景)

来源: Tom/inbox/tom/_candidates/2026-07-22-agent-rag-longcontext-candidates.json(来源:HF Daily,2026-07-19,12 votes)
条目: Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints
arXiv: 2607.18144(2026-07-19)

要点: 评测 LLM 在 3D 空间约束下推理能力(基于结构药物设计 SBDD 场景——蛋白结合口袋)。扩散模型主导 3D 分子生成,但 LLM 方法正在兴起并显示竞争力。本文系统分析通用 LLM 是否能在 3D 物理约束下正确导航,提出新 benchmark。HF Daily 投票最高(12票)。

与活文档 knowledge/rag.md R39 现有脉络的关系:
R39 §2.4 知识结构(MM-RAG 多模态 RAG)已有覆盖。arXiv:2607.18144 是 RAG 场景的新分子设计 benchmark——结合了结构化科学约束(3D 空间)与检索推理,属于科学 RAG 的垂直场景验证。RAG 在专业领域(法律/医疗/科学)的检索+推理是 R39 已知方向,此 paper 提供了分子设计场景的独立证据。
建议归入:§2.4 知识结构(MM-RAG 垂直场景:科学 RAG / 分子设计 RAG benchmark)

归入节: §2.4 知识结构 / §2.6 多模态 RAG 垂直场景(分子设计 RAG benchmark)

arXiv: 2607.18144


增量 4 · ⭐⭐⭐ 中 · 工程模式新增条目(CSDN)

来源: Jay/inbox/jay/2026-07-22-0820-morning-briefing-rag-optimization-agentic-ai-arxiv-csdn.md
条目: 企业级 LLM Agent 实战:从 RAG 到业务闭环(Router / Grader / Rewriter 三节点 + 语义缓存)

要点(工程数据): - Router 节点:查询意图分类 + 路由 - Grader 节点:评估文档相关性,过滤低相关 chunk - Rewriter 节点:检索失败时重写查询,提升召回 - 语义缓存:相似查询直接命中缓存,降低 API 成本 - 双模型协作:路由小模型 + 生成大模型 - 成果数据:研发交付周期缩短 1/3~1/2,AI 代码采纳率 87%;Oracle 迁移 5天→2.5天,采纳率 95%

与活文档 knowledge/rag.md R39 现有脉络的关系:
R39 §2.3 检索单元优化 + §2.12 选型决策树 v3.10 覆盖了 Query Rewrite、Grade Filter 等组件。Router/Grader/Rewriter 三节点 + 语义缓存是企业级 RAG 生产标配的完整工程数据点,与 R39 已知组件方向一致但提供了量化落地证据。⚠️ 数据来源为 CSDN 单一来源,成果数据未经独立核验,建议标注为"工程参考,待一阶来源核验"。
建议归入:§2.12 选型决策树 v3.10(企业级 RAG 组件三节点 + 语义缓存量化数据,标注待核验)

归入节: §2.12 选型决策树 v3.10(企业级 RAG 标配模式,标注数据待核验)


增量 5 · ⭐⭐⭐ 中 · RAG vs Long Context 选型量化数据(Substack)

来源: Tom/inbox/tom/2026-07-22-agent-rag-longcontext-radar.md(来源:Wire Blog,usewire.io,2026)
条目: RAG vs Long Context 2026 数据——Wire Blog 量化对比

要点(量化数据): - RAG 单次查询成本比完整 long context 低 1,250 倍 - Long context 在相关内容埋藏于窗口中间时准确率下降 30%+("lost-in-the-middle"问题,Stanford 研究者记录) - 2026 主流融合模式:RAG 粗筛缩小范围 → 长上下文跨检索结果推理

与活文档 knowledge/rag.md R39 现有脉络的关系:
R39 §2.12 选型决策树已知 RAG vs Long Context 选型框架,但缺乏量化数据支撑。1,250x 成本差异 + lost-in-the-middle 30%+ 准确率下降是新的量化对比数据点,为 RAG 选型提供了具体数字依据。⚠️ 数据来源为 Wire Blog(usewire.io),原始 Stanford 论文需独立核验具体数字。
建议归入:§2.12 选型决策树 v3.10(RAG vs Long Context 量化对比,lost-in-the-middle 30%+,标注来源需核验)

归入节: §2.12 选型决策树 v3.10(RAG vs Long Context 量化数据,标注待核验 Stanford 出处)


值得警惕的矛盾或待核实说法

⚠️ 待核实:RAG 1,250x 成本优势

  • 来源:Wire Blog(usewire.io),由 Tom radar 2026-07-22 引用
  • 性质:无 arXiv 背书的 Substack 数据,Stanford lost-in-the-middle 出处需原文核验
  • 状态:建议仅作为"行业观察"级别参考,不写入需要精确引用的活文档正文

⚠️ 待核实:CSDN 企业级 Agent 数据(研发周期 -1/3~1/2、Oracle 迁移 5天→2.5天)

  • 来源:Jay/inbox/jay/2026-07-22-0820-morning-briefing-rag-optimization-agentic-ai-arxiv-csdn.md
  • 性质:单一 CSDN 来源,无独立 arXiv/benchmark 背书
  • 状态:截至本简报,仍未完成一阶核验

⚠️ 无实质新 paper_cards:Jul 22 新卡均为老 paper 重新编目

  • paper_cards 中 Jul 22 08:00 新增的 469-480 区间 12 张卡均为老 paper(DINOv2 2023、BLIP-2 2023、Toolformer 2023、BERT 2018 等),非当日新发现
  • work-queue 的 Top-15 rag tag 同样为老 paper 自动打标,非实质 RAG 增量
  • 结论:过去 2 天 paper_cards 无实质性 RAG 新增

可引用 arXiv 号列表

arXiv ID 论文/条目 信号强度 在 R39 状态
2607.18155 Testing RAG Systems with Chunk Coverage(Kim/Pasini/Tonella) ⭐⭐⭐⭐ 未收录,新增
2607.18225 Vector Search As NN Matching: RAG-based Policy Learning in Causal Inference(Kato & Kato) ⭐⭐⭐⭐ 未收录,新增
2607.18144 Do Language Models Dream of Binding Molecules?(HF Daily,12 votes) ⭐⭐⭐⭐ 未收录,新增
2607.06815 Behavioral Privacy Leakage in Agentic Negotiation(R39 昨日增量,7/21 简报) ⭐⭐⭐⭐ 未收录(见昨日简报)
2507.05257 MemoryAgentBench(ICLR 2026,403 stars)(昨日简报增量) ⭐⭐⭐⭐ 未收录(见昨日简报)
2606.29538 RESOURCE2SKILL(昨日简报增量) ⭐⭐⭐⭐ 未收录(见昨日简报)
2511.07587 Beyond Fact Retrieval: Episodic Memory for RAG(AAAI 2026 Oral)(昨日简报增量) ⭐⭐⭐ 未收录(见昨日简报)
2601.07978 分布式多 Agent 长期记忆(IEEE COMPSAC 2026)(昨日简报增量) ⭐⭐⭐ 未收录(见昨日简报)

总结

状态: ✅ 检查完成
增量条数: 5 条(3 高信号 + 2 中信号)
涉及 arXiv 号: 3 个新增(2607.18155 / 2607.18225 / 2607.18144)+ 5 个昨日简报遗留待收录
显著矛盾: 无新矛盾;主要不确定性来自数据来源为 Substack/CSDN 二传,需一阶核验
待核实数据点: 3 处(RAG 1,250x 成本、lost-in-the-middle 30%+、CSDN 企业级量化数据)

本简报结论: 过去 2 天 RAG 领域增量较为有限,主要来自 2026-07-20 当日 arXiv 新发布(3 条新论文)和 Jay CSDN 工程帖。paper_cards 仍然是老 paper 重新编目,无实质当日新发现。今晚活文档 R40 接力重点建议:① 优先归入 2607.18155(Chunk Coverage RAG 评测新维度)和 2607.18225(RAG + 因果推断新场景);② 遗留的 5 个昨日增量(2607.06815 / 2507.05257 / 2606.29538 / 2511.07587 / 2601.07978)应同步跟进是否已在 R39 落账;③ 三个 Substack/CSDN 量化数据点(RAG 1,250x / lost-in-the-middle 30% / 企业级 Agent 成果数据)建议标记为"待一阶核验"再入正文。