Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-07-31 晚场

主题覆盖:AI Agent · RAG · 检索增强 · 长上下文 · 评测 · 新论文
数据来源:arXiv metadata · Hugging Face Daily(2026-07-31 12:40 UTC)
本次候选:8 条 | 高价值:4 条 | Substack:0 | CSDN:0


🔴 高价值

1. DualG-MRAG:解耦宏/微推理的多模态 RAG

  • 论文http://arxiv.org/abs/2607.28580v1
  • 机构:Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li
  • 发布日期:2026-07-30
  • 核心:MM-RAG 在多跳推理任务中,现有方法要么粒度太粗丢失关键证据,要么粒度太细导致图爆炸。DualG-MRAG 将宏推理(跨模态关系建模)与微匹配(实例级对齐)解耦,双路驱动。
  • 标签rag benchmark multimodal
  • 意义:多模态 RAG 的核心难题终于有了结构化解法,对工程落地有直接价值。

2. GLM-RAG:知识图谱上 Graph Language Model 与传统检索的对比

  • 论文http://arxiv.org/abs/2607.28397v1
  • 机构:Maya Arseven, Anette Frank, Beni Egressy, Johann Higl, Moritz Plenz
  • 发布日期:2026-07-30
  • 核心:系统对比 GLM-based、GNN-based、vector-search 三类 retriever 在单跳/多跳 KG-RAG 上的表现。这是 KG-RAG 领域的首个大规模对比研究。
  • 标签rag benchmark
  • 意义:知识图谱 RAG 选型必备基准,结论对架构决策有直接影响。

3. Is Deep Research Reliable? 误导知识在 Deep Research Agent 中的传播

  • 论文http://arxiv.org/abs/2607.20891
  • 发布日期:2026-07-22
  • 核心:MisKnow-Agent 框架——构造并验证误导性知识,研究其如何通过规划→检索→合成的 Deep Research 工作流传播为假结论。
  • 标签agent rag benchmark
  • 意义:RAG 系统的真实可靠性问题被正式量化。生产级系统必读。

4. Filesystem-Based Memory for LLM Agents:文件系统记忆的系统性评估

  • 论文http://arxiv.org/abs/2607.26637
  • 发布日期:2026-07-28
  • 核心:首个对"代理用文件系统当记忆"这一默认方案的系统性研究。测试三个假设:能否保持组织、能否处理冲突和过期、能否产生净收益。
  • 标签agent rag memory benchmark
  • 意义:很多生产 Agent 在用这个范式,但从未被系统评估过。基准研究价值高。

🟡 中等价值

5. See2Think:多模态模型是否真正使用中间视觉状态?

  • 来源:HF Daily | arXiv 2607.26769 | votes: 16
  • 核心:See2ThinkBench(1200 题,12 类)+ Visual Action-of-Thought(VAoT)。诊断 MLLM 是否真的依赖中间视觉表征,还是只靠文本推理。
  • 标签rag benchmark multimodal

6. Σ-Mem:多 Agent 系统的在线可靠性记忆

  • 来源:HF Daily | arXiv 2607.27958 | votes: 3
  • 核心:记录每个 peer 的能力证据和关系证据,用 Weyl 不等式更新。解决中心模型无法直接验证 peer 回复可信度的问题。
  • 标签agent memory systems

7. ShadowDancer:任意动作控制的视频世界模型

  • 来源:HF Daily | arXiv 2607.28362 | votes: 16
  • 核心:帧级控制的视频生成模型,展示视频只展示 dynamics 的一个"影子"。与 Agent 工具调用/规划有交叉。
  • 标签multimodal

8. Fairness Pruning:GLU-MLP 层中定位人口统计偏置

  • 来源:HF Daily | arXiv 2607.28319 | votes: 1
  • 核心:通过对比提示对在 down_proj 输入端的差分激活定位偏置神经元。LLM 可解释性方向。
  • 标签benchmark systems

📡 行业动态摘要

RAG vs Long Context 2026 格局(综合 Wire / Glasp / Zylos 研究): - RAG 框架用量 2024-2026 增长 400%,60% 生产 LLM 应用仍用 RAG - Long context 单次查询约 $0.10 / 45 秒;RAG 约 $0.00008 / 1 秒,差距 1250 倍 - Long context 在相关信息埋在中后段时准确率下降 30%+ - 2026 主流模式:混合——检索先收窄到 bounded context,再用长窗口跨文档推理 - 上下文窗口大小竞争趋稳(2026 预测窗口不再指数增长),优化焦点转向上下文利用率


输出文件/shared/research-kb/inbox/tom/2026-07-31-agent-rag-longcontext-radar.md
生成时间:2026-07-31 12:40 UTC
Lock 已释放tom-daily-radar-3x