Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-02 14:40

本期概况

8 条候选,来自 arXiv + Hugging Face Daily;聚焦:多模态 RAG 架构、Agent 记忆可靠性、Graph RAG 对比评估。


高价值候选(4 条)

1. DualG-MRAG:多模态 RAG 的宏/微推理解耦

  • 来源: arXiv 2607.28580(2026-07-30)
  • 问题: 现有 MM-RAG 在多跳推理中,或因细粒度视觉特征导致图爆炸与噪声,或因粗粒度表征丢失关键局部证据。
  • 方案: 提出 DualG-MRAG,将宏观推理(跨文档结构关系)与微观匹配(实例级模态对齐)解耦处理,兼顾精细证据与结构建模。
  • 意义: 多模态 RAG 从"独立实例匹配"向"层次化推理图"演进的代表工作。

2. Σ-Mem:多 Agent 系统的在线可靠性记忆

  • 来源: arXiv 2607.27958(2026-07-29,HF votes 12)
  • 问题: 传统记忆只存交互内容,不建模"哪些 Agent 在什么条件下可信"。
  • 方案: Σ-Mem 以 Weyl 不等式维护两类证据:个体能力证据 + 跨 Agent 关系证据;从后决策正确性反馈中在线更新。
  • 意义: 首个对 peer trust 建模的多 Agent 记忆系统,适合复杂工作流编排场景。

3. GLM-RAG:Graph Language Model vs GNN vs 向量检索对比评估

  • 来源: arXiv 2607.28397(2026-07-30)
  • 核心: 系统对比 GLM retriever、GNN retriever、传统向量检索在单跳/多跳知识图谱 RAG 上的效果差异。
  • 意义: 首篇大规模 GLM-RAG 对比评估,给出各方法在不同跳数场景下的优劣图谱。

4. Filesystem-Based Memory for LLM Agents:首个系统性实证

  • 来源: arXiv 2607.26637(2026-07-28,HF votes 7)
  • 问题: Agent 用文件系统当记忆已成部署默认,但从未被系统研究。
  • 方案: 三个角色(组织、演化、可持续性)建模,系统测试 Agent 能否在记忆累积、冲突、过时后保持有序。
  • 意义: 实证揭示当前 filesystem memory 的能力边界与潜在失效模式。

常规候选(4 条)

# 标题 来源 亮点
5 See2Think:多模态模型真的用中间视觉状态吗? arXiv 2607.26769(votes 22) See2ThinkBench 1200 题 + VAoT 框架,诊断中间视觉生成/渲染/使用链路
6 OmniScope:模态解耦的 Token 压缩框架 arXiv 2607.23193(votes 3) 训练无关;音频与视频 Relevance 峰值时刻不同,单向引导失效,OmniScope 分别建模
7 ConMem:贡献感知记忆 for 长周期设备巡检 arXiv 2607.28126 估计每条记忆对下游诊断的贡献值,实现人机协同早期风险筛查
8 Fairness Pruning:GLU-MLP 层 demographic bias 定位 arXiv 2607.28319(votes 2) 用激活对比定位偏置神经元,轻量结构干预,非全参数微调

趋势观察

  1. RAG 架构深水区:从向量检索向 Graph RAG 演进(DualG-MRAG、GLM-RAG),宏观结构建模成为新必争之地。
  2. Agent 记忆从"存啥"到"信谁":Σ-Mem 开创 peer trust 建模,记忆系统从被动存储转向主动可信度推理。
  3. 评估基准持续细分:See2Think 填补多模态中间推理诊断空白,ConMem 针对工业场景专项评估。
  4. RAG vs Long Context 主流共识(2026 中期):RAG 做检索+权限+成本控制,Long Context 做上限推理;两者互补而非竞争。

Substack/CSDN 使用: 无 Substack 高价值线索;CSDN 未使用。

生成时间: 2026-08-02 14:40 UTC+8
Job: tom-daily-radar-3x
候选 JSON: /shared/research-kb/inbox/tom/_candidates/2026-08-02-agent-rag-longcontext-candidates.json