Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-01 晚间
本期关键词
AI Agent · RAG · 检索增强 · 长上下文 · 多模态 · 评测基准
🔬 本期新论文(8条候选)
高价值(4条)
1. Σ-Mem:多Agent系统的在线可靠性记忆
- 论文:Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems
- 来源:arXiv · 2026-07-29
- 摘要:提出用对称矩阵建模Agent历史胜任力证据和关系证据,解决多Agent中中心模型无法直接验证对等响应的核心问题——这对生产级Agent系统至关重要。
- 标签:agent memory systems
- 链接:https://arxiv.org/abs/2607.27958
2. DualG-MRAG:多模态RAG的宏/微解耦推理
- 论文:DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal RAG
- 来源:arXiv · 2026-07-30
- 摘要:现有MM-RAG在多跳推理时因图像特征细粒度导致图膨胀与噪声。DualG将宏推理与微匹配解耦,对多文档多模态场景有直接工程价值。
- 标签:rag multimodal benchmark
- 链接:http://arxiv.org/abs/2607.28580v1
3. GLM-RAG:知识图谱RAG中GLM vs GNN vs 向量检索对比
- 论文:GLM-RAG: Graph Language Models for Graph-Based RAG
- 来源:arXiv · 2026-07-30
- 摘要:首次系统对比GLM、GNN和传统向量检索在单跳/多跳知识图谱RAG任务上的表现,揭示各自适用场景边界。
- 标签:rag benchmark
- 链接:http://arxiv.org/abs/2607.28397v1
4. ConMem:工业巡检日志中贡献感知记忆框架
- 论文:ConMem: Contribution-Aware Memory for Long-Horizon Manufacturing Inspection Logs
- 来源:arXiv · 2026-07-30
- 摘要:针对长周期钢铁设备巡检,提出估计每条记忆单元对下游诊断贡献度的方法,解决静态语料库无法主动预警的痛点——工业Agent应用方向值得关注。
- 标签:rag memory systems benchmark
- 链接:http://arxiv.org/abs/2607.28126v1
普通候选(4条)
5. See2Think:多模态大模型是否真正使用中间视觉状态?
- 来源:HF Daily · 2026-07-28 · votes: 21
- 提出See2ThinkBench基准(1200题,12类),诊断多模态推理中中间图像/sketch的实际使用程度,对理解VLM推理过程有价值。
- 标签:rag benchmark multimodal
6. Filesystem-Based Memory:Agent文件系统记忆的系统性研究
- 来源:HF Daily · 2026-07-28 · votes: 6
- 首个系统性测试"Agent能否在记忆累积、冲突、过时后保持文件系统记忆有序"的研究,填补了该方向的实证空白。
- 标签:agent rag memory benchmark
7. OmniScope:模态解耦的Token压缩
- 来源:HF Daily · 2026-07-27 · votes: 3
- 音频与视频的跨模态显著度不匹配会导致关键线索在压缩中被丢弃,OmniScope提出训练无关的解耦预算分配方案。
- 标签:multimodal
8. Fairness Pruning:GLU-MLP层中的 demographic bias 定位
- 来源:HF Daily · 2026-07-29 · votes: 2
- 通过对比prompt对+激活捕获定位LLM中的神经元bias,可作为LLM公平性审计的工具化参考。
- 标签:benchmark systems
📮 Substack 线索(1条)
GradientFlow · RAG Reimagined: 5 Breakthroughs
Douwe Kiela(Contextual AI CEO)强调:LLM只是系统架构的一部分,端到端效果由整体系统决定。文档解析(表格、图表、复杂布局的信息抽取)不是预处理工作,而是关键基础。
Nvidia研究指出:超长上下文反而会稀释关键信息,提出OP-RAG机制。实验显示,16000个精选Tokens + Order-Preserve RAG 在Llama3.1-70B上达44.43 F1,远超全部128K Tokens无RAG的34.32。
核心结论:RAG + 长上下文组合使用效果最优,而非二选一。RAG负责精准召回数据,长上下文负责整合召回的精炼集合。
💡 本期小结
- Agent记忆方向两篇均来自7月28-29日,Σ-Mem(多Agent可靠性)与Filesystem Memory(文件系统记忆)形成互补,前者偏信任建模,后者偏组织能力。
- Graph RAG三条路线(GLM/GNN/向量)首次有了系统性对比,工业知识图谱RAG选型有参考依据。
- 多模态RAG(DualG-MRAG)解决了细粒度视觉特征与图结构膨胀的核心矛盾,工程可落地性较强。
- Substack线索进一步验证:长上下文 ≠ 取代RAG,二者组合是当前最优实践。
Tom 文献雷达 · 每日3次(08:40 / 14:40 / 20:40 UTC+8) Candidates来源:arXiv metadata + HF Daily · 8条/期 · 高价值3-4条