Tom 文献雷达 · Agent + RAG + Long-Context · 2026-06-27(第三次/3x)
本期关键词
AI Agent | RAG | 检索记忆 | 长上下文 | 评测基准 | 安全
高价值条目(4条)
1. MemStrata:RAG 时效记忆 / 陈旧事实检测
- 来源:arXiv 2606.26511
- 核心:RAG 无时间模型——当事实变化时(如函数重命名、API 重构),新旧值 embedding 相似度几乎相同,系统无法区分矛盾与重复。 cosine AUROC 仅 0.59(接近随机)。提出 MemStrata,为检索记忆维护时效分层。
- 价值:直击生产 RAG 的隐性陷阱;为 Agent 记忆的时效验证提供新思路。
- 标签:
agentragmemorybenchmark
2. MIRROR:Agentic RAG 红队 / 跨表面统一攻击框架
- 来源:arXiv 2606.26793
- 核心:多模态 Agentic RAG 攻击面从 prompt injection 扩展到文本投毒、图像注入、直接查询攻击、编排器工具操纵。现有红队模板重复率 73–84%。MIRROR 用 Memory-guided MCTS + Novelty Gate 拒绝已知攻击模板,在文本投毒基准上显著降低重复率。
- 价值:目前最系统的 Agentic RAG 安全评估框架。
- 标签:
agentragmemorybenchmark
3. OpenRCA 2.0:根因分析评测 / PAVE 因果传播路径标注
- 来源:arXiv 2606.27154
- 核心:现有 RCA 数据集只标根因、不标传播路径,导致任务退化为模式匹配。PAVE 用已知干预从故障注入重建因果传播路径,要求模型正向推理(从因到果)而非逆向推断。测试 LLM Agent 的长上下文理解、多步推理、工具调用能力。
- 价值:首个含传播路径的 RCA 评测基准;直接关联 Agent 能力评测。
- 标签:
agentraglong-contextbenchmark
4. Erase-then-Delta Attention(EDA):解耦擦写的线性注意力
- 来源:arXiv 2606.26560
- 核心:Delta-rule 线性注意力的主动纠错仍锚定在同一写地址,导致存放在其他地址的过时信息无法被主动清除。EDA 将"擦除地址"与"写入地址"解耦,实现选择性抑制过时记忆。
- 价值:对需要长期记忆的 Agent 架构有直接参考价值;比 full attention 更高效。
- 标签:
memory
补充条目(4条)
5. Agents That Know Too Much:LLM Agent 隐私全景调查
- 来源:arXiv 2606.26627 | 无新 arXiv ID(与 radar 旧条可能重叠)
- 核心:Agent 接触多数据源、跨会话保持状态、凭委托权限行动——敏感信息可从查询、中间结果、内存、消息交换等多环节泄露。系统梳理 LLM Agent 隐私风险。
- 注意:该主题今日已出现,可能与此前 radar 重叠。
- 标签:
agentmemory
6. Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection
- 来源:arXiv 2606.26479
- 核心:梳理 2024–2026 年 Agent 防护路线:CaMeL、FIDES、Progent、RTBAS、FORGE 等 out-of-band 防御在 AgentDojo 基准接近消除攻击。将这些防御归类为经典完整性保护(Biba)与引用监控。
- 价值:系统梳理 Agent 安全防御现状。
- 标签:
agentbenchmarksystems
7. PhysRAG:物理感知视频生成的 RAG 管道
- 来源:arXiv 2606.26916
- 核心:两阶段数据过滤(基于 WISA-80K)构建 7K 高质量视频库;物理视频数据库 + 物理知识注入机制,提升视频生成的物理一致性。
- 价值:RAG 在多模态视频生成中的具体应用示例。
- 标签:
ragbenchmarkmultimodal
8. LCAi:生命周期评估的视角融合 RAG 框架
- 来源:arXiv 2606.26857
- 核心:多视角检索 + 受控合成;为 LCA 解释提供结构化 RAG 方案。
- 价值:垂直领域 RAG 应用示例(环境评估)。
- 标签:
ragbenchmark
Substack / 技术博客线索
Memory Layer 格局(2026):Turing Post 梳理 20 种高级 RAG 类型;DEV Community 评测 MinnsDB( temporal graph + 6 种存储模态 + 49 个连接器)。关键趋势:RAG 与 Agent Memory 的边界正在模糊,混合架构在 1M 交互量级维持 90%+ 准确率。
本期小结
本期核心主题:RAG 时效验证(MemStrata)与 Agentic RAG 安全(MIRROR、out-of-band defenses)并行推进;评测基准持续丰富(OpenRCA 2.0 新增因果传播路径标注);记忆机制从向量检索向结构化时效管理演进(MinnsDB、EDA 解耦擦写)。
采集自 arXiv metadata + Tavily 补充 | 2026-06-27 12:40 UTC | Tom radar v3