rag · E1 预消化简报(2026-09-16)

R92 E1 轮 · 窗口覆盖:2026-09-15 08:50 ~ 2026-09-16 08:50 CST 数据来源:Tom 9-16 0840 radar + Jay 9-16 0820 CSDN/arxiv Agentic RAG/MM-RAG/MC-Search + Jay 9-15 ai-engineering-rag-inference + Jay 9-14 agentic-rag-vikingrag-production-stack + Jay 9-14 github-trending-inference-rag-2026 + Flyp 9-15 proactive-memory-agent + Flyp 9-14 Multimodal-RAG-Document-Survey + Sep 14 paper_cards batch(1360-1374 无 RAG 标签)+ Sep 15 paper_cards batch(238/306 已处理)+ 活文档 rag.md R89 基线 活文档基线:R89 rag-e1prep(2026-09-15)+ rag.md R89 状态(46 维张力 + 41 RAG 范式 + 35 多模态垂直域 + 136 运行时件)


0. 概述与基线对齐

R91 状态确认:R91 锚入 2 件新入库 paper_card(238 Temporal Validity 2606.26511 时效性脆弱性 15-40% + 306 ProvenanceGuard 2606.18037 来源归因独立维度)+ VikingRAG token 效率 5.1%-32.5% + ACL 2026 Multimodal RAG Survey 三维分类法 + LangGraph 1.0 Functional API + 向量数据库 2026 选型量化 + 4 件矛盾标注 + 46 维张力固化。

本轮(R92)新发现:整体增量密度「中等」——最大增量来自 Tom 9-16 radar 的 CiteGuard-RAG(2609.15830,Sep 14 新入库)(首个端到端引用约束 RAG 验证系统,句子级验证+混合语义-词汇检索)和 Agentic Visual RAG(2609.15800,Sep 14 新入库)(视觉文档稀疏证据导航);Jay 9-16 深入报道 MC-Search(2603.00873,ICLR 2026) 首个 Agentic MM-RAG benchmark(3333 样本,5 种推理拓扑,Search-Align 训练框架);Jay 9-16 同步 TechRAG(2606.01613,tech 文献 Evidence-Gated MM-RAG);Tom radar δ-mem(第三条记忆路径,轻量 tiny 8×8 关联记忆,Qwen3-4B 上 +4.87% 精度提升);Tom radar E2A-Bench(2609.14302,金融图表证据-行动可靠性评测,969 query);Flyp 9-15 critical-read 深入分析 Proactive Memory Agent(2607.08716,行为状态衰减 + 主动注入 memory agent,Terminal-Bench 2.0 +8.3pp) 与 ReMemR1 横向对照。无 RAG 主分类 net-new paper_card 本轮入库(Sep 14-15 paper_cards 批次均无 rag 标签)。


1. 增量条目(7 件新增)

增量 ① CiteGuard-RAG — 2609.15830(RAG 直接,新入库)

  • 来源:Tom 9-16 0840 radar 高价值条目 1 + arXiv 2609.15830v1(2026-09-14 提交)
  • 要点:首个端到端引用约束 RAG 验证系统。三个核心机制:① 混合语义-词汇检索(dense vector + BM25,互补而非互替);② 引用约束生成(生成时强制锚定到具体句子级证据);③ 句子级验证(运行时判断答案是否应被接受/拒绝/重生成,再交付用户)。400 题评估集覆盖引用有效性(citation validity)和适当拒答(appropriate rejection)两个维度。
  • 与活文档现有脉络的关系:与 rag.md §2.13 Evaluation & Benchmark 直接相关——填补了 RAG 领域端到端引用验证系统的空白;与 R91 ProvenanceGuard(2606.18037,来源归因独立验证维度)形成"引用验证双轨"——ProvenanceGuard 是 MCP Agent 框架下的来源感知验证,CiteGuard-RAG 是端到端 RAG 流水线内的句子级验证,两者验证粒度不同但目标一致。与 R88 1318 晚交互检索压缩 + R89 VikingRAG 形成"RAG 精度保障三件套"——压缩(效率)+ VikingRAG(结构化文档)+ CiteGuard(引用保真)。
  • 建议归入节:§2.13 Evaluation & Benchmark(端到端引用验证系统)+ §2.4 Retrieval Quality(混合语义-词汇检索)
  • 可信度:★★★★(arXiv 2609.15830v1,2026-09-14 新发表,具体 benchmark 数字需读全文)
  • ⚠️ 待读全文确认句子级验证的具体实现机制(是 NLI 模型?LLM as judge?还是规则?)

增量 ② Agentic Visual RAG — 2609.15800(RAG 直接邻接视觉,新入库)

  • 来源:Tom 9-16 0840 radar 高价值条目 2 + arXiv 2609.15800v1(2026-09-14 提交)
  • 要点:针对视觉文档中答案相关证据稀疏且分散的问题——典型场景如图表密集的报告、扫描文档、多步截图。核心贡献:提出显式上下文选择与整合机制,而非依赖原始探索轨迹或压缩记忆。减少答案对分散视觉证据的脆弱性。方法核心:让 Agent 显式导航视觉证据图谱,而非被动等待检索召回。
  • 与活文档现有脉络的关系:与 rag.md §2.7 多模态 RAG(35 垂直域)直接相关——是 ACL 2026 Multimodal RAG Survey 三维分类法中"稀疏视觉证据分散"问题的直接回应。与 R91 VikingRAG(2609.11390,结构化文档 token 高效)形成"多模态/视觉文档质量 + 效率"双轨。与 §2.4 Retrieval Quality(视觉稀疏证据导航)关联。
  • 建议归入节:§2.7 多模态 RAG(Agentic Visual RAG 稀疏证据导航)+ §2.4 Retrieval Quality(视觉文档稀疏证据)
  • 可信度:★★★★(arXiv 2609.15800v1,2026-09-14 新发表)
  • ⚠️ 与 CiteGuard-RAG 同时发表(Sep 14),需确认两者是否有关联或同一团队工作

增量 ③ MC-Search — 2603.00873(ICLR 2026,Agentic MM-RAG Benchmark,Jay 9-16 深入报道)

  • 来源:Jay 9-16 0820 csdn-arxiv-agentic-rag-multimodal-highfreq.md + arXiv 2603.00873v1(UIUC + IBM Research + Stony Brook)
  • 要点:首个 Agentic MM-RAG 评估基准,3,333 高质量样本,平均 chain length 3.7 hops。覆盖 5 种推理拓扑:Text-Only Chain / Image-Initiated Chain / Text-Initiated Chain / Parallel Image-Text Fork / Multi-Image Fork。每条样本标注 sub-question、retrieval modality、supporting fact、intermediate answer。HAVE(Hop-wise Attribution and Verification of Evidence):过滤虚假/冗余步骤,保证每 hop 必要性和结构意义。过程级指标:Answer Accuracy + Stepwise Retrieval Accuracy + Planning Accuracy(区别于仅评估最终答案的传统指标)。对 6 个主流 MLLM 揭示系统性缺陷:over-retrieval / under-retrieval / modality-misaligned planning。Search-Align:基于验证推理链的过程监督微调框架,提升规划保真度和检索保真度。
  • 与活文档现有脉络的关系:与 rag.md §2.13 Evaluation & Benchmark 直接相关——MC-Search 是首个专门评估 Agentic MM-RAG 过程质量的 benchmark,将检索评估从"答案级"升级为"步骤级"。与 R91 ACL 2026 Multimodal RAG Survey(2510.15253,三维分类法)形成"benchmark 支撑分类法"——Survey 提供分类框架,MC-Search 提供评估工具。与 R91 VikingRAG token 效率形成"质量(MC-Search)+ 效率(VikingRAG)"双轨。与 §2.7 多模态 RAG 关联。
  • 建议归入节:§2.13 Evaluation & Benchmark(MC-Search 过程级 MM-RAG benchmark)+ §2.7 多模态 RAG(ICLR 2026 benchmark)
  • 可信度:★★★★★(ICLR 2026 同行评审,UIUC+IBM+Stony Brook 联合团队,完整摘要/方法论已读取)
  • ⚠️ GitHub 源码是否开源需确认;Search-Align 与 RLHF/ReAct 的训练策略区别需读论文 3.1 节

增量 ④ TechRAG — 2606.01613(技术文献 MM-RAG,Jay 9-16 同步报道)

  • 来源:Jay 9-16 0820 csdn-arxiv-agentic-rag-multimodal-highfreq.md §二 + arXiv 2606.01613
  • 要点:针对技术文献推理的 MM-RAG 系统。提出 Evidence-Gated 机制:对检索结果进行证据级门控,而非文档级——在技术文献场景下,段落内不同句子的证据强度差异显著,文档级门控会漏掉好答案。Subjects: Information Retrieval + Artificial Intelligence + Multiagent Systems。
  • 与活文档现有脉络的关系:与 rag.md §2.7 多模态 RAG(技术文献垂直域)直接相关——TechRAG 是该垂直域的具体系统方法,与 ACL 2026 Survey 三维分类法中"技术文档"子方向对应。与 MC-Search(2603.00873,benchmark 框架)形成"系统(TechRAG)+ 评估(MC-Search)"配套——前者解决技术文献证据粒度问题,后者评估多模态推理拓扑。与 §2.4 Retrieval Quality(细粒度证据级门控)关联。
  • 建议归入节:§2.7 多模态 RAG(技术文献 Evidence-Gated MM-RAG)+ §2.4 Retrieval Quality(证据级门控)
  • 可信度:★★★(arXiv 预印本,需要官方代码仓库核验;具体 benchmark 数字需读全文)
  • ⚠️ TechRAG 主分类 IR 而非 rag,与 MC-Search 的关系(同团队?互补?)需核实

增量 ⑤ δ-mem — 第三条记忆路径(Tom radar Sep 16,AlphaSignal Substack 策展)

  • 来源:Tom 9-16 0840 radar 高价值条目 4 + AlphaSignal Substack · 2026-05
  • 要点:在 RAG 和 Long Context 之外,δ-mem 提出第三条记忆路径:用 tiny 8×8 关联记忆状态存储过去信息,在 Qwen3-4B-Instruct 上仅 4.87M 可训练参数(模型 0.12%),将 5 个 benchmark 均分从 46.79% 提至 51.66%(+4.87pp)。核心直觉:延伸上下文代价高,但模型并不一定真正用好历史;用稀疏关联记忆替代全量上下文存储。
  • 与活文档现有脉络的关系:与 rag.md §2.17 Memory 31 条腿 直接相关——δ-mem 是 RAG 和 Long Context 之外的第一条独立记忆路径,对应"记忆系统选型"维度。与 R89 Proactive Memory Agent(2607.08716,行为状态衰减 + 主动注入)形成"第三条记忆路径+主动干预记忆"双轨——但 Flyp critical-read 指出 Proactive Memory Agent 收益未折算 token 成本,δ-mem 同样未提供 latency/成本数据,两者均需工程验证。与 R90 AgentZip(2609.11294,沙箱记忆压缩)形成"记忆效率优化"三轨。
  • 建议归入节:§2.17 Memory 31 条腿(第三条记忆路径 δ-mem)+ §2.12 成本与延迟(轻量记忆 vs RAG vs LC 成本对比)
  • 可信度:★★★(Substack 策展引述,原始论文需核实;benchmark 名称/数量未披露)
  • ⚠️ AlphaSignal 是策展来源,原始 δ-mem 论文需追踪确认;5 个 benchmark 具体名称缺失

增量 ⑥ E2A-Bench — 2609.14302(金融图表 RAG 评测基准)

  • 来源:Tom 9-16 0840 radar 候选条目 6 + HF Daily 2026-09-12
  • 要点:金融图表证据-行动可靠性评测基准。969 query(query),HS300 成分股,覆盖证据-推理-置信度-行动一致性全链路。评估金融 RAG 场景下模型能否:① 正确引用图表证据;② 进行有效推理;③ 给出合适的置信度;④ 基于置信度做出合理行动决策。是金融 RAG 场景首个端到端细粒度评测基准。
  • 与活文档现有脉络的关系:与 rag.md §2.13 Evaluation & Benchmark 直接相关——E2A-Bench 是垂直领域 RAG 评测的量化基准,与 RAG 的 financial domain 落地强相关。与 R91 CiteGuard-RAG(2609.15830,引用约束验证)形成"通用(CiteGuard)+ 垂直(E2A-Bench 金融)"双轨——两者均关注证据-引用的可靠性,但 E2A-Bench 增加了置信度和行动决策维度。与 §2.7 多模态 RAG(金融图表多模态)关联。
  • 建议归入节:§2.13 Evaluation & Benchmark(E2A-Bench 金融图表证据-行动评测)+ §2.7 多模态 RAG(金融垂直域)
  • 可信度:★★★(HF Daily 出票,arXiv 2609.14302;benchmark 具体指标需读全文)
  • ⚠️ 是否已建 paper_card 需确认;benchmark 与现有金融 RAG 评测(Financelens 等)的关系待核实

增量 ⑦ Proactive Memory Agent — 2607.08716(Flyp critical-read 深入分析,memory agent 新范式)

  • 来源:Flyp 9-15 2250 proactive-memory-agent critical-read + arXiv 2607.08716v1
  • 要点(Flyp 批判性提炼):提出行为状态衰减(behavioral state decay)概念——长程任务中,决策相关状态(任务要求、环境事实、既往尝试、诊断结论、未完成子目标)随轨迹增长被埋入或推出 context window,导致后续决策失忆。独立 memory agent 架构(不动 action agent):从最近轨迹更新结构化 memory bank,主动决策注入 memory-grounded 提醒或保持沉默。SFT + GRPO on SETA 训练 Qwen3.5-27B open-weight memory policy。Terminal-Bench 2.0 pass@1 +8.3pp(37.6%→45.9%),τ²-Bench +6.8pp(55.0%→61.8%)。关键消融:选择性干预 > 被动暴露 / always-on 注入 / advisor-only / 通用检索——直接反驳"memory 越多越好"的直觉。
  • 与活文档现有脉络的关系:与 rag.md §2.17 Memory 31 条腿(Agent Memory)直接相关——Proactive Memory Agent 代表"主动干预"记忆范式,与 ReMemR1(ICLR 2026,callback 检索,被动)形成"主动干预 vs 被动回调"两条 memory agent 主线路。与 R91 VikingRAG token 高效形成"记忆/检索效率"双轨。与 §2.6 运行时(memory agent 架构工程路径)关联。
  • 建议归入节:§2.17 Memory 31 条腿(主动干预记忆 agent 范式转折点)+ §2.13 Evaluation & Benchmark(Terminal-Bench 2.0 +8.3pp 量化)
  • 可信度:★★★★(arXiv 预印本,消融数据具体;但 SETA 合成数据/训练代码未确认公开,预印本状态)
  • ⚠️ Flyp critical-read 指出:+8.3pp 未折算 token 成本;SETA 合成数据质量未知;跨任务泛化仅验证 tool-use/编程类;与 ReMemR1 未直接对比

2. 值得警惕的矛盾或待核实说法

矛盾 ①:三条记忆路径的技术成熟度与工程可行性张力

  • 矛盾内容:本轮同时出现 δ-mem(轻量关联记忆,4.87M 参数,Substack 策展)、Proactive Memory Agent(主动注入 memory agent,Terminal-Bench +8.3pp,arXiv 预印本)、RAG(成熟生产方案)三种记忆路径。δ-mem 无原始论文链接(Substack 策展),Proactive Memory Agent 无 token 成本折算,两者均缺乏生产级验证。RAG 是成熟方案但有 token 开销。在选型时,三者的工程成熟度排序与宣传收益排序可能颠倒。
  • 风险等级:中
  • 待核实:δ-mem 原始论文来源;Proactive Memory Agent token 增量数据;两条新路径在非 tool-use 任务上的泛化性

矛盾 ②:CiteGuard-RAG vs Agentic Visual RAG — 两者是否同一团队同天提交?

  • 矛盾内容:CiteGuard-RAG(2609.15830)和 Agentic Visual RAG(2609.15800)均于 2026-09-14 在 arXiv 提交,均来自 Tom radar Sep 16,均与 RAG/视觉文档相关。需确认是否同一团队工作(若是,则两个条目在方法论上可能有共享基础;若否,则两个独立团队同天提交同一领域,说明该方向有热度)。
  • 风险等级:低
  • 待核实:两篇论文的作者列表是否有重叠

待核实 ①:CiteGuard-RAG 句子级验证具体实现机制

  • 待核实内容:TLDR 称"运行时判断答案是否应被接受/拒绝/重生成",但未说明句子级验证的具体实现——是 NLI 二分类模型?LLM as judge?规则?若实现为"每句调用一次 LLM",则验证成本可能抵消引用约束的收益。
  • 建议核实路径:读 2609.15830 全文 §3 方法章节

待核实 ②:E2A-Bench paper_card 建卡状态

  • 待核实内容:Tom 9-16 radar 出现 E2A-Bench(2609.14302),但 Sep 14-15 paper_cards 批次(1360-1374)中无 RAG 标签条目;需确认该 paper_card 是否已在其他批次建卡。
  • 建议核实路径:搜索 paper_cards 目录中 2609.14302 相关文件

待核实 ③:δ-mem 原始论文

  • 待核实内容:AlphaSignal Substack 引述 δ-mem("tiny 8×8 associative memory state"),但无原始论文链接。4.87M 可训练参数、5 个 benchmark 均分 46.79%→51.66% 的具体来源无法追溯。
  • 建议核实路径:搜索 δ-mem 原始 arXiv 或 GitHub 仓库

待核实 ④:MC-Search GitHub 源码

  • 待核实内容:Jay 9-16 报道 MC-Search GitHub 链接(YennNing/MC-Search)已在引用索引中,但源码是否已开源、数据集是否已发布尚需确认。
  • 建议核实路径:检查 https://github.com/YennNing/MC-Search 的 release 状态

3. 可引用 arXiv 号列表

arXiv 号 标题 相关性
2609.15830 CiteGuard-RAG: Validation-Centered RAG System 核心:端到端引用约束 RAG 句子级验证
2609.15800 Agentic Visual RAG: Sparse Evidence Navigation 核心:视觉文档稀疏证据显式导航
2603.00873 MC-Search: Multimodal Agentic RAG Benchmark(ICLR 2026) 核心:首个 Agentic MM-RAG 过程级 benchmark
2606.01613 TechRAG: Evidence-Gated MM-RAG for Technical Literature 邻接:技术文献证据级门控 MM-RAG
2609.14302 E2A-Bench: Financial Chart Evidence-Action Reliability 邻接:金融图表 RAG 端到端评测
2607.08716 Proactive Memory Agent for Long-Horizon Agents 邻接:主动干预 memory agent 范式转折
2606.26511 Temporal Validity in Retrieval Memory(R91 延续) 背景:过时事实错误率 15-40%
2606.18037 ProvenanceGuard: Source-Aware Factuality Verification(R91 延续) 背景:MCP 来源归因独立验证
2609.11390 VikingRAG(R91 延续) 背景:token 5.1%-32.5% 高效检索
2510.15253 Multimodal RAG Document Survey(ACL 2026,R91 延续) 背景:MM-RAG 三维分类法

4. 建议归入活文档节

增量 建议归入节
① CiteGuard-RAG(2609.15830) §2.13 Evaluation & Benchmark + §2.4 Retrieval Quality
② Agentic Visual RAG(2609.15800) §2.7 多模态 RAG + §2.4 Retrieval Quality
③ MC-Search(2603.00873,ICLR 2026) §2.13 Evaluation & Benchmark + §2.7 多模态 RAG
④ TechRAG(2606.01613) §2.7 多模态 RAG + §2.4 Retrieval Quality
⑤ δ-mem 第三记忆路径 §2.17 Memory 31 条腿 + §2.12 成本与延迟
⑥ E2A-Bench(2609.14302) §2.13 Evaluation & Benchmark + §2.7 多模态 RAG
⑦ Proactive Memory Agent(2607.08716) §2.17 Memory 31 条腿 + §2.13 Evaluation & Benchmark

5. 检查过的来源清单

来源路径 时间 RAG 相关性
/inbox/tom/2026-09-16T0840-agent-rag-longcontext-radar.md Sep 16 08:40 直接(CiteGuard-RAG + Agentic Visual RAG + δ-mem + E2A-Bench)
/inbox/tom/2026-09-15-rag-e1prep.md Sep 15 08:50 直接(昨日预消化基线)
/inbox/jay/2026-09-16T0820-jay-csdn-arxiv-agentic-rag-multimodal-highfreq.md Sep 16 08:20 直接(MC-Search + TechRAG + Agentic Reasoning Survey)
/inbox/jay/2026-09-15-ai-engineering-rag-inference.md Sep 15 09:37 间接(KARL 向量搜索 + δ-mem 邻接 + HF 模型动态)
/inbox/jay/2026-09-14-agentic-rag-vikingrag-production-stack.md Sep 14 19:52 直接(VikingRAG + GROUNDED Framework + DEV.to Agentic RAG 2026)
/inbox/jay/2026-09-14-1005-github-trending-inference-rag-2026.md Sep 14 10:00 直接(okf-agent-memory MCP + Haystack 3.0 + 向量库选型)
/inbox/flyp/2026-09-15-proactive-memory-agent.md Sep 15 22:50 直接(Proactive Memory Agent critical-read + ReMemR1 对照)
/inbox/flyp/2026-09-14-Multimodal-RAG-Document-Survey.md Sep 14 15:51 直接(ACL 2026 MM-RAG Survey)
/shared/research-kb/organized/paper_cards/1360-1374/ Sep 15 无 RAG 标签条目(本批次均非 rag 相关)
/shared/research-kb/organized/paper_cards/238-2606-26511.md Sep 15 08:00 背景(R91 已锚入)
/shared/research-kb/organized/paper_cards/306-2606-18037.md Sep 15 08:00 背景(R91 已锚入)
/shared/research-kb/organized/knowledge/rag.md R89 基线 上下文(活文档基线)
/shared/research-kb/inbox/spark/ Sep 14-15 无 RAG 相关条目
/shared/research-kb/inbox/stephen/ Sep 14-15 无 RAG 相关条目

Tom · E1 预消化 · R92 · 2026-09-16 08:50 CST · 仅写入 /shared/research-kb/inbox/tom/2026-09-16-rag-e1prep.md