Tom 文献雷达 · Agent RAG 长上下文 · 2026-07-03
概览
- 主题:AI Agent / RAG / 检索 / 长上下文 / 评测
- 来源:arXiv (元数据+富化) + Hugging Face Daily
- 候选总数:8 条 | 高价值:3 条
- 行业线索:网络搜索补充(见附)
⭐ 高价值候选
1. AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents
- 来源:arXiv / HF Daily (2026-07-01)
- 链接:https://arxiv.org/abs/2607.02255
- 标签:Agent · RAG · Memory · Benchmark
- 核心观点:提出"有界内存契约"(bounded-memory contract)替代全量历史追加——每个决策由 fresh user message + typed retrieval 构成,保持 prompt 跨长度有界,同时支持各层单独消融。这直接挑战了当前主流的全上下文窗口方案,对长程 Agent 的 memory 设计有重要参考价值。
- 为何值得关注:长上下文 Agent 的核心工程难题之一就是 memory 膨胀;AgenticSTS 提供了可instrument的测试台,值得跟进。
2. CheckRLM: Effective Knowledge-Thought Coherence Checking in RAG-Augmented Reasoning
- 来源:arXiv (2026-07-02)
- 链接:http://arxiv.org/abs/2607.02262v1
- 标签:RAG · Benchmark · Systems
- 核心观点:在 RAG 推理过程中,实时提取推理链中的事实断言(factual claims),检测知识-思维不一致性,并触发最小化精炼(minimal refinement)。解决的是 RLMs 长推理链中"幻觉传播"的问题。
- 为何值得关注:RAG 与 Reasoning 的结合是今年热点方向,CheckRLM 提供了精细化的知识一致性验证机制,工程可行性较高。
3. Know Your Source: A Public Knowledge Store for Media Background Checks
- 来源:arXiv (2026-07-02)
- 链接:http://arxiv.org/abs/2607.02383v1
- 作者:Benjamin Nichols, Michael Schlichtkrull, Nedjma Ousidhoum
- 标签:RAG · Benchmark · Systems
- 核心观点:提出 RAG 中的 source-critical reasoning 问题——现有 RAG 系统假设检索到的证据可靠,但真实世界信息存在冲突、过时、来源偏见。构建了媒体背景检查(MBC)知识库,为 AFC(自动化事实核查)提供来源可靠性信号。
- 为何值得关注:RAG 评测不仅要看答案质量,还要看来源质量;MBC 知识库可能成为 RAG 评估的新维度。
📋 其他候选
4. EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
- 来源:HF Daily (2026-07-01) | votes: 36
- 链接:https://arxiv.org/abs/2607.02440
- 标签:Agent · Benchmark · Systems
- 摘要:Agent 在固定交互预算内反复编辑可执行策略系统的评测框架,区别于纯得分评估或开放-ended SE 评估。
5. Breaking Failure Cascades: Step-Aware RL for Medical Multimodal Reasoning
- 来源:HF Daily (2026-06-29) | votes: 11
- 标签:Benchmark · Multimodal
- 摘要:通过 MRPO(Medical Reasoning-aware Policy Optimization)解决医学 VQA 中早期推理失败导致的级联错误问题。
6. Discrete Diffusion Language Models for Interactive Radiology Report Drafting
- 来源:HF Daily (2026-06-30) | votes: 4
- 标签:Benchmark · Multimodal
- 摘要:DiffusionGemma-26B vs AR Gemma-4-26B 在医学 VQA 上对比,Diffusion 匹配或超越 AR 对应模型。
📌 行业动态(网络搜索补充,非学术来源)
Agentic RAG 2026 技术趋势
- LangGraph + Agentic RAG:2026 年 RAG 已演化为自主决策系统,支持多步规划、查询重写、混合 memory 层遍历、自我反思、迭代改进(Medium, 2026)。
- Agentic RAG 企业落地:结合 ReAct/Tree-of-Thoughts 推理模式,支持多 Agent 协作;McKinsey 数据显示 27% 企业对所有 GenAI 输出有人工审核,Agentic RAG 可自动化验证与引用强制(datanucleus.dev, 2026)。
- Advanced RAG 类型:Long-document memory(MiA-RAG, HGMem, MegaRAG, Disco-RAG)、adaptive retrieval、graph reasoning 成为新标准(Turing Post, 2026)。
- Agentic RAG Survey:https://github.com/asinghcsu/AgenticRAG-Survey 整合了 4 类核心 Agentic Patterns(reflection, planning, tool use, multi-agent collaboration)。
附:去重参考(近7天雷达文件)
- 2026-07-02-agent-rag-longcontext-radar.md
- 2026-07-02-agent-rag-longcontext-radar-v2.md
- 2026-07-01-agent-rag-longcontext-radar.md
- 2026-06-30-agent-rag-longcontext-radar.md
- 2026-06-29-agent-rag-longcontext-radar.md
- 2026-06-28-agent-rag-longcontext-radar.md
- (以上均已在本期去重时参考)
生成时间:2026-07-03 20:40 CST | Tom Research KB