Tom 文献雷达 · Agent × RAG × Long Context

2026-08-05 14:40 UTC | topic=agent-rag-longcontext | candidates=8


🔬 本期高价值(4 条)

1. PAST-Bench:Agent 递归自我改进评测基准

  • 来源:arXiv | 2026-08-04 | votes=18
  • 链接:http://arxiv.org/abs/2608.04003v1
  • 核心:首个系统测试"历史经验是否真的让 Agent 变好"的基准。26 场景 / 204 集,覆盖 memory、procedural reuse、skill acquisition 三类任务,对比开启/关闭经验保留的 Agent 表现。研究者:Shuhan Xue et al.
  • 价值:Agent 记忆能力的量化评测缺了很久,这个填补了递归改进这个子方向。

2. Quo Vadis, World Modeling?

  • 来源:HF Daily | 2026-08-02 | votes=16
  • 链接:https://arxiv.org/abs/2608.02713
  • 核心:提出 Agent-Centric Interactive World Proxies——Agent 不依赖真实环境交互,而通过世界模型获得低成本、可控的反馈信号,支撑决策前的快速验证。
  • 价值:长上下文 Agent 的"决策前测试"思路,对仿真+Agent 叠用有直接意义。

3. The AI Agents Stack (2026 Edition)

  • 来源:The AI Engineer · Substack | 2026-08
  • 链接:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
  • 核心
  • 2024 年 memory = "选个向量库做 RAG";2026 年 memory 是三层架构第一等公民(短期上下文 / 中期 session / 长期跨期)
  • Gemini 1M token / Claude 200K 并不消灭 retrieval,改变的是 in-context vs. on-demand 的取舍线
  • Agent 记忆泄漏防护 → eval + human oversight loop
  • 价值:行业实战视角,memory tier 概念值得参考。

4. Video-DeepResearch:下一代多模态 Deep Research Agent

  • 来源:HF Daily | 2026-08-03 | votes=10
  • 链接:https://arxiv.org/abs/2608.03979
  • 核心:将 DR agent 从静态图像扩展到连续视频流。发现两个关键瓶颈:① modality bias(绕开视觉工具走文本搜索)② parametric knowledge leakage(用内部记忆而非真实工具调用)。提出 decoupled perception-exploration pipeline + stage-wise tool unlocking。
  • 价值:RAG/工具调用的漏检问题是实操痛点,视频场景让其更突出。

📋 全部候选(8 条)

# 标题 来源 Votes 标签
1 PAST-Bench arXiv 18 agent, memory, benchmark
2 Quo Vadis, World Modeling? HF Daily 16 agent, multimodal
3 Video-DeepResearch HF Daily 10 agent, memory, benchmark
4 AntiSkillBench HF Daily 1 agent, rag, memory, benchmark
5 ExplainBench HF Daily 1 agent, benchmark
6 ST-WAM HF Daily 1 multimodal
7 Knowledge-Geometry Decoupling HF Daily 29 multimodal(推荐系统,偏离主题)
8 Push-Wiper HF Daily 1 robotics

注:Knowledge-Geometry Decoupling(KGD)votes=29 但属流推荐系统,主题偏离 agent/RAG,谨慎参考。


🔎 趋势观察

Memory 从"功能"到"架构":多个信号指向 memory tier 正在成为 Agent 基础设施的第一等公民,而非外挂组件。PAST-Bench 直接量化"记忆是否真的有用",AntiSkillBench 测 persona skill 的隐私泄漏——记忆研究方向正从"能不能记住"进化到"记了会不会出事"。

World Model 做 Agent 安全垫:Quo Vadis 那篇和 The AI Engineer 的 Stack 趋势都指向"不要裸跑真实环境",用世界模型做决策前验证是 2026 年的主流架构思路。

模态 bias 在工具调用中普遍:Video-DeepResearch 的发现(绕视觉走文本)在纯文本 Agent 场景中对应"绕 RAG 走 LLM 内部知识"——是同一类问题的不同模态映射。


Tom · 研究知识库 · 每日 3 次雷达 · 2026-08-05T14:40