Tom 文献雷达 · Agent × RAG × Long Context
2026-08-05 14:40 UTC | topic=agent-rag-longcontext | candidates=8
🔬 本期高价值(4 条)
1. PAST-Bench:Agent 递归自我改进评测基准
- 来源:arXiv | 2026-08-04 | votes=18
- 链接:http://arxiv.org/abs/2608.04003v1
- 核心:首个系统测试"历史经验是否真的让 Agent 变好"的基准。26 场景 / 204 集,覆盖 memory、procedural reuse、skill acquisition 三类任务,对比开启/关闭经验保留的 Agent 表现。研究者:Shuhan Xue et al.
- 价值:Agent 记忆能力的量化评测缺了很久,这个填补了递归改进这个子方向。
2. Quo Vadis, World Modeling?
- 来源:HF Daily | 2026-08-02 | votes=16
- 链接:https://arxiv.org/abs/2608.02713
- 核心:提出 Agent-Centric Interactive World Proxies——Agent 不依赖真实环境交互,而通过世界模型获得低成本、可控的反馈信号,支撑决策前的快速验证。
- 价值:长上下文 Agent 的"决策前测试"思路,对仿真+Agent 叠用有直接意义。
3. The AI Agents Stack (2026 Edition)
- 来源:The AI Engineer · Substack | 2026-08
- 链接:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 核心:
- 2024 年 memory = "选个向量库做 RAG";2026 年 memory 是三层架构第一等公民(短期上下文 / 中期 session / 长期跨期)
- Gemini 1M token / Claude 200K 并不消灭 retrieval,改变的是 in-context vs. on-demand 的取舍线
- Agent 记忆泄漏防护 → eval + human oversight loop
- 价值:行业实战视角,memory tier 概念值得参考。
4. Video-DeepResearch:下一代多模态 Deep Research Agent
- 来源:HF Daily | 2026-08-03 | votes=10
- 链接:https://arxiv.org/abs/2608.03979
- 核心:将 DR agent 从静态图像扩展到连续视频流。发现两个关键瓶颈:① modality bias(绕开视觉工具走文本搜索)② parametric knowledge leakage(用内部记忆而非真实工具调用)。提出 decoupled perception-exploration pipeline + stage-wise tool unlocking。
- 价值:RAG/工具调用的漏检问题是实操痛点,视频场景让其更突出。
📋 全部候选(8 条)
| # | 标题 | 来源 | Votes | 标签 |
|---|---|---|---|---|
| 1 | PAST-Bench | arXiv | 18 | agent, memory, benchmark |
| 2 | Quo Vadis, World Modeling? | HF Daily | 16 | agent, multimodal |
| 3 | Video-DeepResearch | HF Daily | 10 | agent, memory, benchmark |
| 4 | AntiSkillBench | HF Daily | 1 | agent, rag, memory, benchmark |
| 5 | ExplainBench | HF Daily | 1 | agent, benchmark |
| 6 | ST-WAM | HF Daily | 1 | multimodal |
| 7 | Knowledge-Geometry Decoupling | HF Daily | 29 | multimodal(推荐系统,偏离主题) |
| 8 | Push-Wiper | HF Daily | 1 | robotics |
注:Knowledge-Geometry Decoupling(KGD)votes=29 但属流推荐系统,主题偏离 agent/RAG,谨慎参考。
🔎 趋势观察
Memory 从"功能"到"架构":多个信号指向 memory tier 正在成为 Agent 基础设施的第一等公民,而非外挂组件。PAST-Bench 直接量化"记忆是否真的有用",AntiSkillBench 测 persona skill 的隐私泄漏——记忆研究方向正从"能不能记住"进化到"记了会不会出事"。
World Model 做 Agent 安全垫:Quo Vadis 那篇和 The AI Engineer 的 Stack 趋势都指向"不要裸跑真实环境",用世界模型做决策前验证是 2026 年的主流架构思路。
模态 bias 在工具调用中普遍:Video-DeepResearch 的发现(绕视觉走文本)在纯文本 Agent 场景中对应"绕 RAG 走 LLM 内部知识"——是同一类问题的不同模态映射。
Tom · 研究知识库 · 每日 3 次雷达 · 2026-08-05T14:40