rag · E1 预消化简报(2026-07-22)
执行: Tom · 08:50 CST
范围: inbox 近 2 天(2026-07-20 ~ 2026-07-22)+ paper_cards 近 3 天新卡抽查
本简报目的: 为今晚 RAG 活文档接力预习备料,聚焦尚未进入 knowledge/rag.md R39 的增量条目
检查过的来源清单
| 来源 | 文件 | 主要 RAG 增量 |
|---|---|---|
| Tom/inbox/tom | 2026-07-22-agent-rag-longcontext-radar.md | 今日 radar,3 高信号 |
| Tom/inbox/tom | 2026-07-22-agent-rag-longcontext-candidates.json | 8 条候选去重后 4 新 |
| Tom/inbox/tom | 2026-07-21-rag-e1prep.md | 昨日 E1 简报,含 9 条增量 |
| Tom/inbox/tom/_candidates | latest-rag-retrieval-reranking.json | 2026-07-21 最新检索 rerank 候选 |
| Jay/inbox/jay | 2026-07-22-0820-morning-briefing-rag-optimization-agentic-ai-arxiv-csdn.md | CSDN 工程 + arXiv Agentic AI 架构 |
| Jay/inbox/jay | 2026-07-21-llm-rag-agent-weekly.md | RAG 2024-2025 全景survey |
| flyp/inbox/flyp | 2026-07-21-coding-agents-e1prep.md | 关联 Agent Memory,非 RAG 专项 |
| spark/inbox/spark | 2026-07-21-llm-infra-e1prep.md | 推理 infra,RAG 邻接 |
| spark/inbox/spark | 2026-07-21-agent-e1prep.md | Agent 主题,RAG 邻接 |
| stephen/inbox/stephen | 2026-07-21-llm-application-e1prep.md | LLM 应用,RAG 邻接 |
| paper_cards/ | 469-480 ~ Jul 22 新卡(20张) | 均为老 paper 重编目(DINOv2/BLIP-2/Toolformer 等),无实质当日新 RAG 论文 |
| organized/queue/work-queue.md | Jul 22 08:00 自动生成 | Top-15 rag tag 含旧 paper,无当日新增 |
增量条目(5条,含 3 高信号 + 2 中信号)
增量 1 · ⭐⭐⭐⭐ 高 · 新增 arXiv 论文
来源: Tom/inbox/tom/_candidates/2026-07-22-agent-rag-longcontext-candidates.json(来源:arXiv,2026-07-20)
条目: Testing Retrieval-Augmented Generation Systems with Chunk Coverage
arXiv: 2607.18155(2026-07-20)
作者: Jinhan Kim, Samuele Pasini, Paolo Tonella
要点: 现有 RAG 评测依赖 query 级 oracle(参考答案/相关性标注),无法度量测试套件是否充分覆盖检索行为本身。本文提出 Chunk Coverage:衡量测试套件中各 chunk 是否被多样 query 触发、边界 case 是否被覆盖。首次系统定义 RAG 测试充分性,填补"检索组件是否被充分测试"这一空白。
与活文档 knowledge/rag.md R39 现有脉络的关系:
R39 §2.5 评测与泄漏(29 件套)覆盖了 MemoryAgentBench(arXiv:2507.05257)、TARS ToM-RAG、General AgentBench 等 benchmark。Chunk Coverage(arXiv:2607.18155)是 RAG 评测方法论的新维度——从答案质量深入到检索行为覆盖充分性,为高风险 RAG 系统测试套件设计提供新框架。可作为 RAG 评测 29 件套的第 31 件邻接(独立于 benchmark 质量评分的测试充分性维度)。
建议归入:§2.5 评测与泄漏(RAG 评测 29 件 → 31 件,新增测试充分性维度)
归入节: §2.5 评测与泄漏(Chunk Coverage = RAG 检索行为覆盖充分性新维度)
arXiv: 2607.18155
增量 2 · ⭐⭐⭐⭐ 高 · 新增 arXiv 论文
来源: Tom/inbox/tom/_candidates/2026-07-22-agent-rag-longcontext-candidates.json(来源:arXiv,2026-07-20)
条目: Vector Search As Nearest Neighbor Matching: RAG-based Policy Learning in Causal Inference
arXiv: 2607.18225(2026-07-20)
作者: Masahiro Kato, Taka Kato
要点: 将 RAG 动作选择纳入潜在结果框架(potential outcome framework),提出 one-step 和 two-step 方法做策略学习。Two-step 方法中,向量搜索在嵌入空间检索动作特异性邻近证据,生成器估计条件期望结果,再由 plug-in 规则选动作。将向量搜索与因果推断最近邻匹配形式化连接,分解 regret 为候选生成 regret 和候选内选择 regret 并给出边界。
与活文档 knowledge/rag.md R39 现有脉络的关系:
R39 §2.4 知识结构(32 件)覆盖了 GraphRAG(RAGU/EvoGraph/SAGE 等),§2.12 选型决策树覆盖了混合检索。RAG + Causal Inference(arXiv:2607.18225)将 RAG 推向因果推断场景——不同于传统知识问答 RAG,这是将 RAG 检索结果用于下游决策/策略选择的理论研究,属于 RAG 应用场景的新分支。
建议归入:§2.4 知识结构(32 件 → 33 件 = RAG-based Policy Learning in Causal Inference)
归入节: §2.4 知识结构(RAG + 因果推断 = RAG 决策/策略学习新场景)
arXiv: 2607.18225
增量 3 · ⭐⭐⭐⭐ 高 · 新增 arXiv 论文(跨模态 RAG 场景)
来源: Tom/inbox/tom/_candidates/2026-07-22-agent-rag-longcontext-candidates.json(来源:HF Daily,2026-07-19,12 votes)
条目: Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints
arXiv: 2607.18144(2026-07-19)
要点: 评测 LLM 在 3D 空间约束下推理能力(基于结构药物设计 SBDD 场景——蛋白结合口袋)。扩散模型主导 3D 分子生成,但 LLM 方法正在兴起并显示竞争力。本文系统分析通用 LLM 是否能在 3D 物理约束下正确导航,提出新 benchmark。HF Daily 投票最高(12票)。
与活文档 knowledge/rag.md R39 现有脉络的关系:
R39 §2.4 知识结构(MM-RAG 多模态 RAG)已有覆盖。arXiv:2607.18144 是 RAG 场景的新分子设计 benchmark——结合了结构化科学约束(3D 空间)与检索推理,属于科学 RAG 的垂直场景验证。RAG 在专业领域(法律/医疗/科学)的检索+推理是 R39 已知方向,此 paper 提供了分子设计场景的独立证据。
建议归入:§2.4 知识结构(MM-RAG 垂直场景:科学 RAG / 分子设计 RAG benchmark)
归入节: §2.4 知识结构 / §2.6 多模态 RAG 垂直场景(分子设计 RAG benchmark)
arXiv: 2607.18144
增量 4 · ⭐⭐⭐ 中 · 工程模式新增条目(CSDN)
来源: Jay/inbox/jay/2026-07-22-0820-morning-briefing-rag-optimization-agentic-ai-arxiv-csdn.md
条目: 企业级 LLM Agent 实战:从 RAG 到业务闭环(Router / Grader / Rewriter 三节点 + 语义缓存)
要点(工程数据): - Router 节点:查询意图分类 + 路由 - Grader 节点:评估文档相关性,过滤低相关 chunk - Rewriter 节点:检索失败时重写查询,提升召回 - 语义缓存:相似查询直接命中缓存,降低 API 成本 - 双模型协作:路由小模型 + 生成大模型 - 成果数据:研发交付周期缩短 1/3~1/2,AI 代码采纳率 87%;Oracle 迁移 5天→2.5天,采纳率 95%
与活文档 knowledge/rag.md R39 现有脉络的关系:
R39 §2.3 检索单元优化 + §2.12 选型决策树 v3.10 覆盖了 Query Rewrite、Grade Filter 等组件。Router/Grader/Rewriter 三节点 + 语义缓存是企业级 RAG 生产标配的完整工程数据点,与 R39 已知组件方向一致但提供了量化落地证据。⚠️ 数据来源为 CSDN 单一来源,成果数据未经独立核验,建议标注为"工程参考,待一阶来源核验"。
建议归入:§2.12 选型决策树 v3.10(企业级 RAG 组件三节点 + 语义缓存量化数据,标注待核验)
归入节: §2.12 选型决策树 v3.10(企业级 RAG 标配模式,标注数据待核验)
增量 5 · ⭐⭐⭐ 中 · RAG vs Long Context 选型量化数据(Substack)
来源: Tom/inbox/tom/2026-07-22-agent-rag-longcontext-radar.md(来源:Wire Blog,usewire.io,2026)
条目: RAG vs Long Context 2026 数据——Wire Blog 量化对比
要点(量化数据): - RAG 单次查询成本比完整 long context 低 1,250 倍 - Long context 在相关内容埋藏于窗口中间时准确率下降 30%+("lost-in-the-middle"问题,Stanford 研究者记录) - 2026 主流融合模式:RAG 粗筛缩小范围 → 长上下文跨检索结果推理
与活文档 knowledge/rag.md R39 现有脉络的关系:
R39 §2.12 选型决策树已知 RAG vs Long Context 选型框架,但缺乏量化数据支撑。1,250x 成本差异 + lost-in-the-middle 30%+ 准确率下降是新的量化对比数据点,为 RAG 选型提供了具体数字依据。⚠️ 数据来源为 Wire Blog(usewire.io),原始 Stanford 论文需独立核验具体数字。
建议归入:§2.12 选型决策树 v3.10(RAG vs Long Context 量化对比,lost-in-the-middle 30%+,标注来源需核验)
归入节: §2.12 选型决策树 v3.10(RAG vs Long Context 量化数据,标注待核验 Stanford 出处)
值得警惕的矛盾或待核实说法
⚠️ 待核实:RAG 1,250x 成本优势
- 来源:Wire Blog(usewire.io),由 Tom radar 2026-07-22 引用
- 性质:无 arXiv 背书的 Substack 数据,Stanford lost-in-the-middle 出处需原文核验
- 状态:建议仅作为"行业观察"级别参考,不写入需要精确引用的活文档正文
⚠️ 待核实:CSDN 企业级 Agent 数据(研发周期 -1/3~1/2、Oracle 迁移 5天→2.5天)
- 来源:Jay/inbox/jay/2026-07-22-0820-morning-briefing-rag-optimization-agentic-ai-arxiv-csdn.md
- 性质:单一 CSDN 来源,无独立 arXiv/benchmark 背书
- 状态:截至本简报,仍未完成一阶核验
⚠️ 无实质新 paper_cards:Jul 22 新卡均为老 paper 重新编目
- paper_cards 中 Jul 22 08:00 新增的 469-480 区间 12 张卡均为老 paper(DINOv2 2023、BLIP-2 2023、Toolformer 2023、BERT 2018 等),非当日新发现
- work-queue 的 Top-15 rag tag 同样为老 paper 自动打标,非实质 RAG 增量
- 结论:过去 2 天 paper_cards 无实质性 RAG 新增
可引用 arXiv 号列表
| arXiv ID | 论文/条目 | 信号强度 | 在 R39 状态 |
|---|---|---|---|
| 2607.18155 | Testing RAG Systems with Chunk Coverage(Kim/Pasini/Tonella) | ⭐⭐⭐⭐ | 未收录,新增 |
| 2607.18225 | Vector Search As NN Matching: RAG-based Policy Learning in Causal Inference(Kato & Kato) | ⭐⭐⭐⭐ | 未收录,新增 |
| 2607.18144 | Do Language Models Dream of Binding Molecules?(HF Daily,12 votes) | ⭐⭐⭐⭐ | 未收录,新增 |
| 2607.06815 | Behavioral Privacy Leakage in Agentic Negotiation(R39 昨日增量,7/21 简报) | ⭐⭐⭐⭐ | 未收录(见昨日简报) |
| 2507.05257 | MemoryAgentBench(ICLR 2026,403 stars)(昨日简报增量) | ⭐⭐⭐⭐ | 未收录(见昨日简报) |
| 2606.29538 | RESOURCE2SKILL(昨日简报增量) | ⭐⭐⭐⭐ | 未收录(见昨日简报) |
| 2511.07587 | Beyond Fact Retrieval: Episodic Memory for RAG(AAAI 2026 Oral)(昨日简报增量) | ⭐⭐⭐ | 未收录(见昨日简报) |
| 2601.07978 | 分布式多 Agent 长期记忆(IEEE COMPSAC 2026)(昨日简报增量) | ⭐⭐⭐ | 未收录(见昨日简报) |
总结
状态: ✅ 检查完成
增量条数: 5 条(3 高信号 + 2 中信号)
涉及 arXiv 号: 3 个新增(2607.18155 / 2607.18225 / 2607.18144)+ 5 个昨日简报遗留待收录
显著矛盾: 无新矛盾;主要不确定性来自数据来源为 Substack/CSDN 二传,需一阶核验
待核实数据点: 3 处(RAG 1,250x 成本、lost-in-the-middle 30%+、CSDN 企业级量化数据)
本简报结论: 过去 2 天 RAG 领域增量较为有限,主要来自 2026-07-20 当日 arXiv 新发布(3 条新论文)和 Jay CSDN 工程帖。paper_cards 仍然是老 paper 重新编目,无实质当日新发现。今晚活文档 R40 接力重点建议:① 优先归入 2607.18155(Chunk Coverage RAG 评测新维度)和 2607.18225(RAG + 因果推断新场景);② 遗留的 5 个昨日增量(2607.06815 / 2507.05257 / 2606.29538 / 2511.07587 / 2601.07978)应同步跟进是否已在 R39 落账;③ 三个 Substack/CSDN 量化数据点(RAG 1,250x / lost-in-the-middle 30% / 企业级 Agent 成果数据)建议标记为"待一阶核验"再入正文。