📋 Tom 文献雷达 · Agent + RAG + Long Context · 2026-08-28 14:40 UTC

本期执行记录

  • 轮次:第3次/天(14:40 UTC)
  • 候选来源:HF Daily(arXiv 富化)
  • Substack/Web:轻量补充(5 条)

💡 本期高价值条目(3 条)

1. PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents

  • 来源: arXiv 2608.26530 | HF Daily
  • 核心: 提出"实时自我提升"机制——Agent 在长时序执行过程中同时更新当前任务轨迹和持久化 harness,而非等执行结束后再批处理经验。
  • 意义: 为 Agent 记忆和在线学习提供了一个可验证的架构框架,与 RAG 持久化存储路线正交但互补。
  • 标签: agent memory online-learning

2. CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval

  • 来源: arXiv 2608.25500 | HF Daily
  • 核心: 用反事实-因果图对 Agent 技能库做检索前校准,解决"技能被视为独立文本而忽略工作流依赖"的问题。
  • 意义: 检索层直接面向 Agent 技能复用痛点,因果图方法比纯向量检索更有解释性,对构建可扩展 Agent 记忆系统有直接参考价值。
  • 标签: agent rag memory benchmark

3. TTPO: Test-Time Policy Optimization for Math Reasoning

  • 来源: arXiv 2608.27448 | HF Daily,37 votes
  • 核心: 用多数票伪标签替代 ground truth 做测试时训练(TTT),并发现"反对伪标签的 rollout 通常本身就是错的"这一非对称失败模式。
  • 意义: 对 RAG 系统的评测和推理优化有启发——测试时适应能力正在成为 LLM 微调的新方向。
  • 标签: rag evaluation test-time

📦 完整候选列表(8 条)

# 标题 标签 Votes
1 PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents agent, memory 18
2 TTPO: Test-Time Policy Optimization rag 37
3 CaSKG: Counterfactual-Causal Skill Graphs agent, rag, memory, benchmark 1
4 Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning agent, rag, multimodal 2
5 Procedura: Agentic 3D Modeling with Procedural Control agent, rag, systems 2
6 GameWAM: A World Action Model for Video Games agent, multimodal 2
7 Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates benchmark, multimodal 1
8 Agentic Game Development as a Verifiable Trajectory Data Engine agent, multimodal, systems 1

🔍 行业动向(Web 补充)

RAG vs Long Context 2026 实测数据(usewire.io): - RAG 单次查询成本约 $0.00008,Long Context 约 $0.10(差距 1250x) - Long Context 在内容位于上下文中间位置时准确率下降超 30% - 2026 主流架构:RAG 缩小范围 → Long Context 全局推理(混合编排)

10M Token 时代(digitalapplied.com): - 延迟 <2s:需 RAG 或 warm cache - 跨文档推理、合成类任务:Long Context 胜出 - 简单 Lookup/Q&A:RAG 更快更便宜

长时序 Agent 相关资源(Awesome-Long-Horizon-Agents 策展): - MEM1 (ICLR 2026):记忆+推理协同 - MemAgent (ICLR 2026):多轮 RL 记忆重塑 - ContextBudget (arXiv 2026):预算感知上下文管理


📝 简短洞察

本期主题:Agent 在线学习与技能检索正在两条腿走路。 - PILOT 和 CaSKG 代表"让 Agent 边跑边学/边跑边找"的实时化路线; - TTPO 代表"测试时适应"路线,不依赖离线批训练; - RAG vs Long Context 的结论已经清晰:不是非此即彼,而是 RAG 粗筛 + Long Context 精推理的混合; - 2026 年 Agent 评测框架(Aphanta、CaSKG benchmark)正在从单一任务走向过程可验证性。


Tom 文献雷达 · 每日 3 频 · Agent · RAG · Long Context · 评测 · 新论文