Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-02 14:40
本期概况
8 条候选,来自 arXiv + Hugging Face Daily;聚焦:多模态 RAG 架构、Agent 记忆可靠性、Graph RAG 对比评估。
高价值候选(4 条)
1. DualG-MRAG:多模态 RAG 的宏/微推理解耦
- 来源: arXiv 2607.28580(2026-07-30)
- 问题: 现有 MM-RAG 在多跳推理中,或因细粒度视觉特征导致图爆炸与噪声,或因粗粒度表征丢失关键局部证据。
- 方案: 提出 DualG-MRAG,将宏观推理(跨文档结构关系)与微观匹配(实例级模态对齐)解耦处理,兼顾精细证据与结构建模。
- 意义: 多模态 RAG 从"独立实例匹配"向"层次化推理图"演进的代表工作。
2. Σ-Mem:多 Agent 系统的在线可靠性记忆
- 来源: arXiv 2607.27958(2026-07-29,HF votes 12)
- 问题: 传统记忆只存交互内容,不建模"哪些 Agent 在什么条件下可信"。
- 方案: Σ-Mem 以 Weyl 不等式维护两类证据:个体能力证据 + 跨 Agent 关系证据;从后决策正确性反馈中在线更新。
- 意义: 首个对 peer trust 建模的多 Agent 记忆系统,适合复杂工作流编排场景。
3. GLM-RAG:Graph Language Model vs GNN vs 向量检索对比评估
- 来源: arXiv 2607.28397(2026-07-30)
- 核心: 系统对比 GLM retriever、GNN retriever、传统向量检索在单跳/多跳知识图谱 RAG 上的效果差异。
- 意义: 首篇大规模 GLM-RAG 对比评估,给出各方法在不同跳数场景下的优劣图谱。
4. Filesystem-Based Memory for LLM Agents:首个系统性实证
- 来源: arXiv 2607.26637(2026-07-28,HF votes 7)
- 问题: Agent 用文件系统当记忆已成部署默认,但从未被系统研究。
- 方案: 三个角色(组织、演化、可持续性)建模,系统测试 Agent 能否在记忆累积、冲突、过时后保持有序。
- 意义: 实证揭示当前 filesystem memory 的能力边界与潜在失效模式。
常规候选(4 条)
| # | 标题 | 来源 | 亮点 |
|---|---|---|---|
| 5 | See2Think:多模态模型真的用中间视觉状态吗? | arXiv 2607.26769(votes 22) | See2ThinkBench 1200 题 + VAoT 框架,诊断中间视觉生成/渲染/使用链路 |
| 6 | OmniScope:模态解耦的 Token 压缩框架 | arXiv 2607.23193(votes 3) | 训练无关;音频与视频 Relevance 峰值时刻不同,单向引导失效,OmniScope 分别建模 |
| 7 | ConMem:贡献感知记忆 for 长周期设备巡检 | arXiv 2607.28126 | 估计每条记忆对下游诊断的贡献值,实现人机协同早期风险筛查 |
| 8 | Fairness Pruning:GLU-MLP 层 demographic bias 定位 | arXiv 2607.28319(votes 2) | 用激活对比定位偏置神经元,轻量结构干预,非全参数微调 |
趋势观察
- RAG 架构深水区:从向量检索向 Graph RAG 演进(DualG-MRAG、GLM-RAG),宏观结构建模成为新必争之地。
- Agent 记忆从"存啥"到"信谁":Σ-Mem 开创 peer trust 建模,记忆系统从被动存储转向主动可信度推理。
- 评估基准持续细分:See2Think 填补多模态中间推理诊断空白,ConMem 针对工业场景专项评估。
- RAG vs Long Context 主流共识(2026 中期):RAG 做检索+权限+成本控制,Long Context 做上限推理;两者互补而非竞争。
Substack/CSDN 使用: 无 Substack 高价值线索;CSDN 未使用。
生成时间: 2026-08-02 14:40 UTC+8
Job: tom-daily-radar-3x
候选 JSON: /shared/research-kb/inbox/tom/_candidates/2026-08-02-agent-rag-longcontext-candidates.json