Tom 文献雷达 · Agent RAG LongContext · 2026-07-22 14:40 UTC

雷达摘要

本期候选 8 条,去重后 4 条新论文 + 1 条 Substack 线索。


🔴 高价值(4 条)

① Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning

  • 来源: arXiv 2607.19345 | 2026-07-21
  • 作者: Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang (PKU)
  • 标签: long-context
  • 摘要: 长上下文 LLM 在推理时大量"重复复制"输入文本而非真正解决问题,且随 context 长度增加而加剧。本文将 prompt 拆分为任务相关关键证据和无关干扰上下文,证明根因在于 evidence grounding 不足。提出 Evidence-Aware RL 方法,在训练和推理阶段显式建模证据引用,有效抑制重复复制。
  • 价值: 首个系统定义并解决长上下文推理中"重复复制"failure mode 的工作,对长上下文评测和优化有直接意义。

② HACO: Hedged Agent Computing for Reliable LLM Systems

  • 来源: arXiv 2607.19215 | 2026-07-21
  • 作者: Enhan Li, Hongyang Du
  • 标签: agent systems
  • 摘要: 现有 agent 研究假设固定稳定的执行环境,但生产环境中同一 role request 在不同 agent 实例上的延迟、失败率和输出质量存在差异。HACO 提出在 role-to-instance 绑定边界引入"对冲"机制,根据实时服务、网络、查询条件动态分配请求到最优实例,提升部署可靠性。
  • 价值: 将 agent 系统可靠性从假设性固定环境推向真实生产条件,填补了多实例 agent 负载均衡和韧性研究的空白。

③ Graph-Based Agentic AI with LangGraph: Workflow Pathways for Long-Running Stateful Business Processes

  • 来源: arXiv 2607.19297 | 2026-07-21
  • 作者: Daniel Pearson et al.
  • 标签: agent rag systems
  • 摘要: 面向实践者的 LangGraph 指南,提供三个可执行 recipe:SQL 分析 + 修复循环、agentic RAG + evidence gating、人机协同策略审查 + interrupt/checkpoint recovery。展示 typed state、conditional routing、retries、interrupts、checkpoints 和 traces 如何协同。
  • 价值: LangGraph 生产落地实战指南,超越 benchmark 视角,直面状态管理、断点恢复和可观测性工程挑战。

④ AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

  • 来源: HF Daily | arXiv 2607.18754 | 2026-07-20 | votes: 9
  • 标签: agent benchmark
  • 摘要: LLM agent 失败往往在错误表面化步骤的下游才被发现。AgentDebugX 提出 Detect-Attribute-Recover-Rerun 闭环调试框架,DeepDebug 通过全局轨迹理解、结构化调查和交叉质询进行多轮根因诊断。在 Who & When 基准上达到最优 strict attribution 准确率。
  • 价值: 开源 agent 调试工具链,填补了"可观测性有,但根因定位能力弱"的工程缺口。

🟡 中等价值(4 条)

⑤ ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

  • 来源: HF Daily | arXiv 2607.19191 | 2026-07-21 | votes: 5
  • 标签: agent multimodal
  • 视频世界模型,支持长时闭环交互,多源数据基础设施(3A 游戏 + 仿真引擎 + 互联网视频),LongForcing 对齐长时序 action 因果性。
  • 来源: arXiv 2607.18825 | 2026-07-21
  • 标签: rag benchmark systems
  • 印度法律 QA 的 RAG 评测研究,融合 lexical 和 semantic 指标 + 专家反馈,验证检索增强对法律文本问答的有效性。

⑦ EduPanel: A Three-Agent LLM Judge for Teaching Videos

  • 来源: HF Daily | arXiv 2607.18529 | 2026-07-19 | votes: 1
  • 标签: agent benchmark multimodal
  • 三 agent LLM judge 对教学视频进行 rubric-grounded、learner-conditioned 评测,多维度可解释评估。

⑧ RF-Agent: A Practical Framework for Building Language Agents for RFIC Design

  • 来源: arXiv 2607.18772 | 2026-07-21
  • 标签: agent benchmark
  • 多 agent QTSA pipeline 将 RF 教材转化为 11000+ 推理样本,首个 RF 领域 agent 评测基准。

📡 Substack 线索(1 条)

δ-mem: RAG and Long Context Aren't Enough for Agent Memory — A Third Path - 来源: AlphaSignal AI (Substack) | 2026-05-20 - 摘要: δ-mem 将 LLM 对话历史存储在 8×8 小矩阵中,用它来引导注意力,Qwen3-4B-Instruct 在 5 个 benchmark 上平均提升 4.87%(仅 0.12% 可训练参数)。作者认为对大多数 agent 工作负载 RAG 过重、长上下文浪费,δ-mem 提供了第三条路。 - 价值判断: 方法轻量、值得关注复现,适合 agent 记忆层的架构选型参考。


去重备注

  • 08:40 UTC 雷达已覆盖:Chunk Coverage RAG 评测 (2607.18155)、Spatial Constraints benchmark (2607.18144)
  • 本期新候选聚焦:long-context reasoning 失败模式、HACO 生产可靠性、LangGraph 实战、AgentDebugX 调试框架