rag · E1 预消化简报(2026-10-09)

执行体:Tom · E1 日间预消化轮(rag) · 2026-10-09 08:50 CST 底本:organized/knowledge/rag.md v114(R114 基线 · Oct 8)+ inbox/{tom,jay} 近 2 天 + paper_cards 近 3 天新卡 诚实度声明:本轮 RAG 主轴增量密度为「中低」——今日(Oct 9)radar 无 RAG 主分类 net-new;增量来自 Jay CSDN 工程视角新条目 + 2 件 paper_cards RAG 主分类条目(Memory Portability + SMELT)。另有 1 件安全轴邻接值得重点标记(Authorization Laundering · EAL-Bench)。


〇、检查范围与依据

inbox 来源(近 2 天 · RAG 相关筛选)

来源 文件 RAG 相关度
inbox/tom 2026-10-09-agent-rag-longcontext-radar.md(Oct 9 08:40 · 8 条候选,高价值 4 条) 高(radar 来源)
inbox/tom 2026-10-08-rag-e1prep.md(R114 基线 · Oct 8) 高(基线)
inbox/jay 2026-10-09T0820-jay-csdn-rag-agentic-multimodal-substack.md(Agentic RAG·多模态 RAG·12-Factor Agents·MCP/A2A) 高(RAG 工程实践新增)
inbox/jay 2026-10-08T0820-jay-csdn-inference-agent-rag-highvalue.md(推理引擎选型·RAG 可观测性·TurboQuant) 中(RAG 邻接,非主轴)
inbox/jay 2026-10-07-0820-jay-csdn-inference-rag-highvalue-oct.md(Agentic RAG / RAG 4.0 / GraphRAG) 中(工业视角;部分与 R114 重复)
inbox/flyp Oct 7-9 多文件 低(Agentic RL / Long Context;无 RAG 主轴内容)
inbox/spark Oct 7-9 多文件 低(coding agents / llm-infra;无 RAG 主轴内容)
inbox/stephen Oct 7-9 多文件 低(AI industry;无 RAG 主轴内容)

paper_cards 来源(近 3 天新卡 · RAG 主分类筛选)

编号 arXiv 标题 主分类 状态
1238 2609.05339v1 Does Your Agent's Memory Survive a Model Upgrade? rag ✅ RAG 主分类 net-new(Oct 9 确认入库)
1177 2609.01343v1 SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers rag ✅ RAG 主分类(邻接级,S2被引 13)
1187 2609.01836 Agent Memory Is a Surface for Endogenous Authorization Laundering agent ⚠️ 安全轴邻接(EAL-Bench;建议入 Defense 轴)
1201 2608.29607v1 SnapBench: Snap-and-Ask Multimodal Retrieval rag 已在 radar,覆盖
1216 2608.29669v1 Portfolio Risk Bounds(Distributional Fields) rag 邻接级(finance;低优先级)
1236 2609.03199v1 RoboTok: Internet-Scale Data Engine for Human Demonstration Retrieval rag 邻接级(robotics retrieval;低优先级)

一、今日该主题最重要的增量(6 条)

增量 1 · RECAST:面向自适应证据路由的可学习框架(arXiv:2610.10507)— RAG 从"检索文档"到"推导证据"的范式跃迁

  • 来源:inbox/tom/2026-10-09-agent-rag-longcontext-radar.md 高价值 #1(Oct 9 radar);paper_cards/ 建卡中
  • arXiv:2610.10507v1
  • 链接:http://arxiv.org/abs/2610.10507v1
  • 标签:rag agent benchmark systems
  • 主分类:rag ✅(RAG 主分类 net-new;今日 radar 新增)
  • 副分类:agent
  • 形态:method
  • 发布:2026-10-07(arXiv 提交)
  • 作者:Google DeepMind(Yilun Hao, Craig Boutilier 等)
  • TLDR:传统 RAG 依赖固定相似度检索,但很多证据不能从单一文档获取,需要跨多文档过滤/聚合/计算才能导出。RECAST——学习式框架,将证据路由建模为可学习的策略,结合计算、访问和合成工具。
  • 要点: 1. 问题:传统 RAG 假设目标答案存在于单一相关文档中,但实际很多问题需要跨多文档聚合计算才能导出答案(如统计趋势、比较分析、时序推导) 2. 方案:RECAST——证据路由建模为可学习策略,联合优化"计算工具、访问顺序、合成方式"三要素;Google DM 出品 3. 意义:从"检索文档"升级到"推导证据"——RAG 范式的重要扩展方向;与 EnSI-RAG(实体结构索引)、MatRAG(多跳 QA)同属 Reasoning 轴结构化推理方向 4. 与现有脉络关系:落在 Reasoning 轴(多跳/结构化推理);与 R114 EC-RAG(事件链)共同构成"证据路由+事件链"双节点结构化推理;CLIMB(置信度引导)+ RECAST(策略路由)+ EC-RAG(事件链)形成推理轴三路径
  • 建议归入节:§2.6 多跳/结构化推理(Reasoning 轴新增)+ §2.14 范式(RECAST 范式贡献)
  • 可信度:⭐⭐⭐⭐(Google DM 出品;arXiv v1 新鲜;策略学习框架有学术贡献)
  • ⚠️ 限制:benchmark 具体数字、与现有 multi-doc RAG 方法的详细对比需读原文确认

增量 2 · ExperienceIndex:基于 Artifact 经验记忆的索引框架(arXiv:2610.10091)— Agent 跨任务检索经验积累

  • 来源:inbox/tom/2026-10-09-agent-rag-longcontext-radar.md 高价值 #2(Oct 9 radar)
  • arXiv:2610.10091v1
  • 链接:http://arxiv.org/abs/2610.10091v1
  • 标签:agent memory
  • 主分类:agent(rag 强邻接;artifact-grounded memory 与 RAG 检索经验直接相关)
  • 副分类:rag
  • 形态:method
  • 发布:2026-10-07(arXiv 提交)
  • 作者:Peter Baile Chen, Jacob Andreas, Samuel Madden 等(MIT / Microsoft / UPenn)
  • TLDR:人类通过经验积累对 artifact 的感知(哪些判例/论文值得检索),现有 AI agent 缺少这种 artifact-grounded experience。ExperienceIndex——让 agent 从历史任务中学习哪些 artifact 值得检索,在线质量提升 + 成本下降。
  • 要点: 1. 问题:知识密集型任务中,人类通过经验积累对 artifact 的感知能力——哪些论文/判例/文档值得检索;现有 AI agent 缺乏这种跨任务经验积累机制 2. 方案:ExperienceIndex——从历史任务中学习 artifact 检索价值;在线质量提升 + 成本下降;Jacob Andreas 团队出品 3. 意义:首个系统解决"agent 跨任务 artifact 经验积累"的工作;与 Memanto(知识图谱复杂度)形成"结构化记忆 vs 经验驱动检索"两条路径;与 δ-mem(固定大小状态矩阵)同属 Memory 优化方向 4. 与现有脉络关系:落在 Memory 轴(RAG 记忆层);与 R114 δ-mem(第三条路)+ R114 UNREAL(统一 RAG/Long-Context 表征)形成"经验积累+固定矩阵+模型内部统一"三节点
  • 建议归入节:§2.9 Memory(RAG 记忆层新增)+ §2.14 范式(ExperienceIndex 经验驱动检索)
  • 可信度:⭐⭐⭐⭐(Jacob Andreas 团队;MIT/Microsoft/UPenn 联合;具体质量提升数字有学术支撑)
  • ⚠️ 限制:具体 benchmark 数字、与 Memanto 边界互补性需读原文确认

增量 3 · Agent Memory Is a Surface for Endogenous Authorization Laundering + EAL-Bench(arXiv:2609.01836)— RAG/记忆系统安全新维度

  • 来源:paper_cards/1187-2609-01836.md(主分类 agent;Oct 9 确认为 RAG 邻接安全轴)
  • arXiv:2609.01836
  • 链接:https://arxiv.org/abs/2609.01836
  • 标签:agent security benchmark
  • 主分类:agent(⚠️ 建议入 Defense 轴;RAG 邻接安全)
  • 副分类:rag
  • 形态:benchmark
  • 发布:2026-09(arXiv 提交);S2被引 3;OpenAlex 更新 2026-09-05
  • TLDR:本工作在采购、网络安全与金融场景下评估了 5 个 LLM 作为记忆写入者、2 个 LLM 作为执行者,并提出 EAL-Bench,用于衡量持久记忆在多大程度上准确保留不断演化的授权状态,以及错误是否会向下游传播为未授权操作。
  • 要点: 1. 问题:Agent 的持久记忆系统是否会成为"内生授权洗钱"的载体——当记忆写入者与执行者分离时,授权状态的错误是否会被记忆系统静默传播,最终导致未授权操作 2. 方案:EAL-Bench——在采购/网络安全/金融三场景下评估 5 种 LLM 记忆写入者 + 2 种执行者;测量持久记忆保留授权状态演化的准确性 3. 关键发现(TLDR 推断):记忆层的授权状态错误会级联传播至下游未授权操作;persistent memory 是授权安全的关键薄弱点 4. 与 RAG 关系:RAG 系统本质是"检索增强生成",检索内容即知识——若检索内容中携带伪造的授权状态,RAG 生成结果同样面临授权漂移风险;与 RAG-PIBench(提示注入检测)同属 RAG 安全轴 5. 与现有脉络关系:落在 Defense 轴(安全性/鲁棒性);与 R114 RAG-PIBench(提示注入检测)+ R113 Bounded Provisional + R113 RAGScope + R113 Agentic-ZTA 共同构成"提示注入检测+授权状态保全+零信任嵌入"四层 RAG 安全栈;EAL-Bench 新增"记忆层授权状态完整性"维度
  • 建议归入节:§2.8 安全(Defense 轴授权状态安全新增)+ §2.14 范式(RAG 安全评测体系新维度)
  • 可信度:⭐⭐⭐⭐(benchmark 形态;EAL-Bench 具体场景+量化方法;S2被引 3)
  • ⚠️ 限制:具体 F1/AUC 数字、实验规模需读原文确认

增量 4 · Memory Portability:Agent 记忆在模型升级后能否幸存?(arXiv:2609.05339)— RAG 记忆系统可移植性新维度

  • 来源:paper_cards/1238-2609-05339.md(主分类 rag;Oct 9 确认为 RAG 主分类 net-new)
  • arXiv:2609.05339v1
  • 链接:http://arxiv.org/abs/2609.05339v1
  • 标签:rag agent
  • 主分类:rag ✅(RAG 主分类 net-new;Oct 9 确认入库)
  • 副分类:agent
  • 形态:method
  • 发布:2026-09(arXiv 提交);S2被引 1
  • TLDR:研究结果强调了方向特定的迁移测试、严格的 embedding space 隔离,以及在 memory migrations 中为 memory repair 保留源历史的必要性。
  • 要点: 1. 问题:当基础模型升级时,Agent 的记忆系统(embedding-based memory)能否保持有效?记忆迁移后检索质量是否崩溃? 2. 关键发现(TLDR):方向特定的迁移测试是必须的;embedding space 必须严格隔离;源历史必须保留用于 memory repair 3. 工程意义:RAG 生产系统升级模型时,不能假设记忆向量索引自动有效;需要专门的记忆迁移评估流程 4. 与现有脉络关系:落在 Memory 轴(RAG 记忆层);与 R114 δ-mem(在线记忆状态矩阵)+ ExperienceIndex(artifact 经验积累)形成"记忆持久化+迁移可靠性+经验积累"三节点 Memory 轴
  • 建议归入节:§2.9 Memory(Memory 轴迁移可靠性新增)+ §2.14 范式(RAG 生产运维维度)
  • 可信度:⭐⭐⭐⭐(受控研究;具体迁移测试方法论)
  • ⚠️ 限制:具体 benchmark 数字、embedding space 隔离具体方法需读原文确认

增量 5 · Jay CSDN Oct 9 工程视角:Agentic RAG + 多模态 RAG + 企业 RAG + MCP/A2A 协议(工业实践汇总)

  • 来源:inbox/jay/2026-10-09T0820-jay-csdn-rag-agentic-multimodal-substack.md
  • 主轴条目: 1. Agentic RAG 完整流水线(ADK 框架):查询重写→智能检索→质量评估→条件分支(SerpAPI 补救)。多路召回(BGE-M3 + jieba BM25 + RRF 融合 + Cross-Encoder 重排)。4 维度质量评估(相关性/完整性/准确性/覆盖面,80% 阈值 PASS/FAIL) 2. 多模态 RAG 工程化 Pipeline(Dify + CLIP + Whisper + Qwen-VL):CLIP ViT-B/16 轻量化(参数量↓37%,延迟↓28%)。Whisper 流式接入(3-5 秒窗口+1.5 秒重叠)。A/B 测试:Top-1 准确率 58.3%→82.5%(+24.2pp);跨模态召回率 61.7%→89.2%(+27.5pp) 3. 企业知识库 RAG(Milvus 2.3 + bge-large-zh-v1.5):P95 延迟 <50ms,生成速度 350 token/s;5TB 知识库日均 1 万次查询月成本 6305→4200 元(↓33%) 4. 12-Factor Agents:上下文窗口变大并没有消灭 memory 需求,而是改变了"什么放 context、什么放检索"的权衡 5. MCP+A2A 协议:MCP 统一管理跨组件上下文(USB-C 之于 AI 工具生态);A2A 定义 Agent 间通信规范(1对多/多对多协同)
  • 与现有脉络关系:
  • Agentic RAG 流水线 → 与 R114 §2.14 Agentic RAG 工业实践印证(Jay 工业 vs 学术双轨)
  • 多模态 RAG A/B 数据 → 与 R114 EC-RAG(视频事件链)+ EC-RAG(EC-RAG 2610.08674)形成"学术方法+工程实测"双轨印证
  • MCP/A2A → 与 R114 §2.11 协议级门控(Memory 轴三层 + MCP 协议)印证
  • 建议归入节:§2.14 范式(工业实践印证)+ §2.5 多模态 RAG(工程化 Pipeline 数据补充)
  • 可信度:⭐⭐⭐(工业实践;A/B 数据有数字支撑;CSDN 高价值条目)
  • ⚠️ 注意:部分条目(混合检索召回率+17%、通义灵码准确率+23%)已在 R114 标记为"⚠️ 需核实出处";本轮再次出现,建议在活文档中标注"待原论文核验"

增量 6 · AI Engineers Stack 2026:Memory 三层架构演进 + LongMemEval 新基准

  • 来源:inbox/tom/2026-10-09-agent-rag-longcontext-radar.md Substack 线索(theaiengineer)
  • 核心洞察: 1. Memory 架构演进:2026 年 memory 已从"RAG+向量库"演化为三层架构——in-context memory(上下文窗口内)+ agentic memory management(Agent 驱动管理)+ shared memory infrastructure(共享记忆基础设施) 2. 核心玩家:Mem0 / Letta / Zep 已成 agent memory 赛道核心玩家 3. 新基准:LongMemEval 成为 memory 评测新基准(替代旧有的 Memorybank 等基准) 4. 关键洞察:上下文窗口变大并没有消灭 memory 需求,而是改变了"什么放 context、什么放检索"的权衡——与 R114 δ-mem 论文结论一致
  • 与现有脉络关系:
  • 三层架构 → 与 R114 Memory 轴(δ-mem 2605.12357 + UNREAL 2610.08463)形成"学术定义+工业架构"双轨印证
  • Mem0/Letta/Zep → 与 R114 §2.9 Memory 活文档对齐(已有 Letta/Zep 覆盖)
  • 建议归入节:§2.9 Memory(三层架构工业定义补充)+ §2.14 范式(Memory 赛道格局)
  • 可信度:⭐⭐⭐(Substack 技术专栏;行业趋势判断)
  • ⚠️ 限制:LongMemEval 具体 benchmark 数字、Mem0/Letta/Zep 市场份额数据需读原文确认

二、值得警惕的矛盾与待核实说法(2 项)

矛盾 A · RAG 企业部署失败率数字存在多版本矛盾

来源 失败率 时间
Ragaboutit / Blits.ai 2026(R114 续立) ~70% 2026
dev.to Gabriel Anhaia(R114 续立) 70-80% 2026
Towards AI Divy Yadav 2026-01-03(R114 续立) 90% Agentic RAG 2026-01
Digital Applied 2026-03-14(R114 续立) 88% AI Agent 2026-03

矛盾描述:R114 标注"70-80% 失败率"与"90% Agentic RAG 失败"存在数字矛盾;后者聚焦 Agentic RAG 子类(更复杂),前者覆盖所有 RAG 部署(更宽泛),可能解释数字差异,但也可能反映样本来源不同。

建议:在活文档 rag.md §3 争议区建立"企业 RAG 失败率口径矛盾"条目,引用原始来源链接,标注"⚠️ 待系统性 meta-analysis 核实"。

涉及来源: - inbox/tom/2026-10-08-agent-rag-longcontext-radar.md(R113-R114 续立) - inbox/jay/2026-10-07-0820-jay-csdn-inference-rag-highvalue-oct.md(Jay CSDN 工业视角) - inbox/jay/2026-10-09T0820-jay-csdn-rag-agentic-multimodal-substack.md(本轮再次出现)


矛盾 B · 混合检索召回率+17% 和通义灵码准确率+23% 来源存疑

矛盾描述:Jay Oct 7 CSDN 条目引用"混合检索比单一方式召回率高 17%"和"通义灵码在中文企业语境下比开源模型准确率高 23%",标注为"⚠️ 需核实具体论文/数据集来源";本轮(Oct 9)Jay 再次引用相同数字。

建议:在活文档 rag.md 建立"存疑数据追踪"条目,标注这两个数字为"⚠️ 待原论文核验;禁止在活文档中引用为事实"。

涉及来源: - inbox/jay/2026-10-07-0820-jay-csdn-inference-rag-highvalue-oct.md - inbox/jay/2026-10-09T0820-jay-csdn-rag-agentic-multimodal-substack.md(本轮再次出现)


三、值得关注的邻接条目(3 条)

# arXiv 标题 主分类 要点 建议
A 2609.01343 SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers(S2被引 13) rag looping 提升 Transformer;与 RAG 推理效率优化邻接 关注,MoE 架构对 RAG 检索速度影响
B 2608.29607 SnapBench: Snap-and-Ask Multimodal Retrieval(主分类 rag) rag 移动端 snap-and-ask 多模态检索基准;MOOR 方法 归档多模态 RAG 评测
C 2609.01836 Agent Memory Is a Surface for Endogenous Authorization Laundering(EAL-Bench) agent 记忆层授权状态完整性;⚠️ RAG 安全轴重要邻接 入 Defense 轴;见增量 3

四、可引用的 arXiv 号列表

# arXiv 标题 分类 可信度
1 2610.10507 RECAST: Adaptive Evidence Routing rag · agent ⭐⭐⭐⭐
2 2610.10091 ExperienceIndex: Artifact-Grounded Memory agent · rag 邻接 ⭐⭐⭐⭐
3 2609.01836 EAL-Bench: Endogenous Authorization Laundering agent · rag 安全邻接 ⭐⭐⭐⭐
4 2609.05339 Memory Portability Across Model Upgrades rag · agent ⭐⭐⭐⭐
5 2610.08674 EC-RAG: Event Chain RAG for Long Video(已知;R114 已锚) rag · multimodal ⭐⭐⭐⭐
6 2610.08571 RAG-PIBench: Prompt Injection Detection(已知;R114 已锚) rag · benchmark ⭐⭐⭐⭐
7 2610.08463 UNREAL: Unified Retrieval and Long-Context(已知;R114 已锚) rag · long-context ⭐⭐⭐⭐
8 2610.08452 Agentic AutoRAG: Hyperparameter Optimization(已知;R114 已锚) rag · agent ⭐⭐⭐⭐
9 2605.12357 δ-mem: Efficient Online Memory for LLMs(已知;R114 强邻接) agent · rag 邻接 ⭐⭐⭐⭐
10 2609.01343 SMELT: Scaling Laws for MoE Looped Transformers(rag 主分类) rag ⭐⭐⭐
11 2312.10997 RAG Foundation Survey(Gao et al. · S2被引 4207;已知;R114 已锚) rag · survey ⭐⭐⭐⭐⭐

五、本轮摘要

本轮 RAG 主轴增量密度「中低」——今日(Oct 9)radar 无 RAG 主分类 net-new(4 条高价值均在 agent 主分类),增量来自工业视角(CSDN 工程实践)和 2 件 paper_cards RAG 主分类条目(Memory Portability + SMELT)。最重要发现是 RECAST(证据路由学习)和 ExperienceIndex(artifact 经验积累)两件 Google DM / MIT 联合工作,与 R114 现有脉络形成有效衔接。

R115 预备议题: 1. RECAST 论文精读,提取 benchmark 数字 2. ExperienceIndex 论文精读,提取质量提升数据 3. EAL-Bench 与 RAG-PIBench 联合归档至 Defense 轴 4. Memory Portability 对 RAG 生产模型升级流程的影响

无 GitHub 写入。


六、本轮元数据

  • 执行时间:2026-10-09 08:50 CST
  • 增量条数:6 条(1 RECAST + 2 ExperienceIndex + 3 EAL-Bench/MemoryPortability + 5 CSDN工业 + 6 Substack三层架构)
  • RAG 主分类 net-new:2 条(2609.05339 Memory Portability + 2610.10507 RECAST)
  • RAG 主分类已锚(本轮续立):4 条(UNREAL + EC-RAG + RAG-PIBench + Agentic AutoRAG)
  • 邻接安全轴新条目:1 条(2609.01836 EAL-Bench)
  • 涉及 arXiv 号:11 个(见上方列表)
  • 提供方:tom radar + jay csdn + paper_cards