📋 Tom 文献雷达 · Agent + RAG + Long Context · 2026-08-28 14:40 UTC
本期执行记录
- 轮次:第3次/天(14:40 UTC)
- 候选来源:HF Daily(arXiv 富化)
- Substack/Web:轻量补充(5 条)
💡 本期高价值条目(3 条)
1. PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
- 来源: arXiv 2608.26530 | HF Daily
- 核心: 提出"实时自我提升"机制——Agent 在长时序执行过程中同时更新当前任务轨迹和持久化 harness,而非等执行结束后再批处理经验。
- 意义: 为 Agent 记忆和在线学习提供了一个可验证的架构框架,与 RAG 持久化存储路线正交但互补。
- 标签:
agentmemoryonline-learning
2. CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval
- 来源: arXiv 2608.25500 | HF Daily
- 核心: 用反事实-因果图对 Agent 技能库做检索前校准,解决"技能被视为独立文本而忽略工作流依赖"的问题。
- 意义: 检索层直接面向 Agent 技能复用痛点,因果图方法比纯向量检索更有解释性,对构建可扩展 Agent 记忆系统有直接参考价值。
- 标签:
agentragmemorybenchmark
3. TTPO: Test-Time Policy Optimization for Math Reasoning
- 来源: arXiv 2608.27448 | HF Daily,37 votes
- 核心: 用多数票伪标签替代 ground truth 做测试时训练(TTT),并发现"反对伪标签的 rollout 通常本身就是错的"这一非对称失败模式。
- 意义: 对 RAG 系统的评测和推理优化有启发——测试时适应能力正在成为 LLM 微调的新方向。
- 标签:
ragevaluationtest-time
📦 完整候选列表(8 条)
| # | 标题 | 标签 | Votes |
|---|---|---|---|
| 1 | PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents | agent, memory | 18 |
| 2 | TTPO: Test-Time Policy Optimization | rag | 37 |
| 3 | CaSKG: Counterfactual-Causal Skill Graphs | agent, rag, memory, benchmark | 1 |
| 4 | Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning | agent, rag, multimodal | 2 |
| 5 | Procedura: Agentic 3D Modeling with Procedural Control | agent, rag, systems | 2 |
| 6 | GameWAM: A World Action Model for Video Games | agent, multimodal | 2 |
| 7 | Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates | benchmark, multimodal | 1 |
| 8 | Agentic Game Development as a Verifiable Trajectory Data Engine | agent, multimodal, systems | 1 |
🔍 行业动向(Web 补充)
RAG vs Long Context 2026 实测数据(usewire.io): - RAG 单次查询成本约 $0.00008,Long Context 约 $0.10(差距 1250x) - Long Context 在内容位于上下文中间位置时准确率下降超 30% - 2026 主流架构:RAG 缩小范围 → Long Context 全局推理(混合编排)
10M Token 时代(digitalapplied.com): - 延迟 <2s:需 RAG 或 warm cache - 跨文档推理、合成类任务:Long Context 胜出 - 简单 Lookup/Q&A:RAG 更快更便宜
长时序 Agent 相关资源(Awesome-Long-Horizon-Agents 策展): - MEM1 (ICLR 2026):记忆+推理协同 - MemAgent (ICLR 2026):多轮 RL 记忆重塑 - ContextBudget (arXiv 2026):预算感知上下文管理
📝 简短洞察
本期主题:Agent 在线学习与技能检索正在两条腿走路。 - PILOT 和 CaSKG 代表"让 Agent 边跑边学/边跑边找"的实时化路线; - TTPO 代表"测试时适应"路线,不依赖离线批训练; - RAG vs Long Context 的结论已经清晰:不是非此即彼,而是 RAG 粗筛 + Long Context 精推理的混合; - 2026 年 Agent 评测框架(Aphanta、CaSKG benchmark)正在从单一任务走向过程可验证性。
Tom 文献雷达 · 每日 3 频 · Agent · RAG · Long Context · 评测 · 新论文