Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-01 晚间

本期关键词

AI Agent · RAG · 检索增强 · 长上下文 · 多模态 · 评测基准


🔬 本期新论文(8条候选)

高价值(4条)

1. Σ-Mem:多Agent系统的在线可靠性记忆 - 论文:Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems - 来源:arXiv · 2026-07-29 - 摘要:提出用对称矩阵建模Agent历史胜任力证据和关系证据,解决多Agent中中心模型无法直接验证对等响应的核心问题——这对生产级Agent系统至关重要。 - 标签:agent memory systems - 链接:https://arxiv.org/abs/2607.27958

2. DualG-MRAG:多模态RAG的宏/微解耦推理 - 论文:DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal RAG - 来源:arXiv · 2026-07-30 - 摘要:现有MM-RAG在多跳推理时因图像特征细粒度导致图膨胀与噪声。DualG将宏推理与微匹配解耦,对多文档多模态场景有直接工程价值。 - 标签:rag multimodal benchmark - 链接:http://arxiv.org/abs/2607.28580v1

3. GLM-RAG:知识图谱RAG中GLM vs GNN vs 向量检索对比 - 论文:GLM-RAG: Graph Language Models for Graph-Based RAG - 来源:arXiv · 2026-07-30 - 摘要:首次系统对比GLM、GNN和传统向量检索在单跳/多跳知识图谱RAG任务上的表现,揭示各自适用场景边界。 - 标签:rag benchmark - 链接:http://arxiv.org/abs/2607.28397v1

4. ConMem:工业巡检日志中贡献感知记忆框架 - 论文:ConMem: Contribution-Aware Memory for Long-Horizon Manufacturing Inspection Logs - 来源:arXiv · 2026-07-30 - 摘要:针对长周期钢铁设备巡检,提出估计每条记忆单元对下游诊断贡献度的方法,解决静态语料库无法主动预警的痛点——工业Agent应用方向值得关注。 - 标签:rag memory systems benchmark - 链接:http://arxiv.org/abs/2607.28126v1


普通候选(4条)

5. See2Think:多模态大模型是否真正使用中间视觉状态? - 来源:HF Daily · 2026-07-28 · votes: 21 - 提出See2ThinkBench基准(1200题,12类),诊断多模态推理中中间图像/sketch的实际使用程度,对理解VLM推理过程有价值。 - 标签:rag benchmark multimodal

6. Filesystem-Based Memory:Agent文件系统记忆的系统性研究 - 来源:HF Daily · 2026-07-28 · votes: 6 - 首个系统性测试"Agent能否在记忆累积、冲突、过时后保持文件系统记忆有序"的研究,填补了该方向的实证空白。 - 标签:agent rag memory benchmark

7. OmniScope:模态解耦的Token压缩 - 来源:HF Daily · 2026-07-27 · votes: 3 - 音频与视频的跨模态显著度不匹配会导致关键线索在压缩中被丢弃,OmniScope提出训练无关的解耦预算分配方案。 - 标签:multimodal

8. Fairness Pruning:GLU-MLP层中的 demographic bias 定位 - 来源:HF Daily · 2026-07-29 · votes: 2 - 通过对比prompt对+激活捕获定位LLM中的神经元bias,可作为LLM公平性审计的工具化参考。 - 标签:benchmark systems


📮 Substack 线索(1条)

GradientFlow · RAG Reimagined: 5 Breakthroughs

Douwe Kiela(Contextual AI CEO)强调:LLM只是系统架构的一部分,端到端效果由整体系统决定。文档解析(表格、图表、复杂布局的信息抽取)不是预处理工作,而是关键基础。

Nvidia研究指出:超长上下文反而会稀释关键信息,提出OP-RAG机制。实验显示,16000个精选Tokens + Order-Preserve RAG 在Llama3.1-70B上达44.43 F1,远超全部128K Tokens无RAG的34.32。

核心结论:RAG + 长上下文组合使用效果最优,而非二选一。RAG负责精准召回数据,长上下文负责整合召回的精炼集合。


💡 本期小结

  • Agent记忆方向两篇均来自7月28-29日,Σ-Mem(多Agent可靠性)与Filesystem Memory(文件系统记忆)形成互补,前者偏信任建模,后者偏组织能力。
  • Graph RAG三条路线(GLM/GNN/向量)首次有了系统性对比,工业知识图谱RAG选型有参考依据。
  • 多模态RAG(DualG-MRAG)解决了细粒度视觉特征与图结构膨胀的核心矛盾,工程可落地性较强。
  • Substack线索进一步验证:长上下文 ≠ 取代RAG,二者组合是当前最优实践。

Tom 文献雷达 · 每日3次(08:40 / 14:40 / 20:40 UTC+8) Candidates来源:arXiv metadata + HF Daily · 8条/期 · 高价值3-4条