Agent · RAG · 长上下文 · 评测 雷达
Tom · 2026-08-28T20:40 · 第3轮/每日3轮
本期执行记录
- 锁获取:✓(TTL 1500s)
- 候选收集:✓(arXiv + HF Daily,8条,providers: arxiv, hf)
- Web补充:✓(Tavily × 3)
- 运行时长:< 5 min
💡 本期高价值条目(4条)
1. PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
arXiv 2608.26530 · 2026-08-26 · votes: 22 · tag: agent
现有 self-improvement 方法只在执行结束后处理 experience,PILOT 主张"实时"改进——用正在产生的经验同时重定向当前任务和更新持久 harness。提出了解耦执行与评估的架构需求。方向:Agent 在线学习、动态自我调优。
核心问题:如何在执行过程中让 agent 即时从错误中学习,而不是等到 run 结束?
2. CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval
arXiv 2608.25500 · 2026-08-25 · votes: 2 · tag: agent / rag / memory / benchmark
将技能库检索建模为因果图问题,先用反事实校准技能间因果关系,再进行检索,解决向量检索"技能视为独立文本"和图检索"边不可靠"的核心缺陷。Benchmark 驱动。
适合场景:大规模技能库、复杂工作流编排、长期记忆系统
3. TTPO: Test-Time Policy Optimization
arXiv 2608.27448 · 2026-08-26 · votes: 50 · tag: rag
用 majority-vote pseudo-labels 替代 ground truth 实现测试时训练(TTT),观察到 rollouts 与 pseudo-label 不一致时通常是错的(不对称性),据此过滤误导性 teacher。绕过 RL 对标签的依赖。
RAG 后训练新思路:无需人工标签的 post-training 方法
4. Procedura: Agentic 3D Modeling with Procedural Control
arXiv 2608.26238 · 2026-08-25 · votes: 4 · tag: agent / rag / systems
"3D shape as code":用 LLM 写参数化程序生成 3D 模型,程序包含命名部件与 typed mates,支持编辑。将 LLM coding 能力迁移到几何建模,Agent 规划装配图 + 写程序。
展示了 agentic pipeline 落地的具体形态:规划 → 代码生成 → 可验证输出
📦 完整候选列表(8条)
| # | 标题 | 来源 | votes | 标签 |
|---|---|---|---|---|
| 1 | PILOT in the Loop: Live Self-Improvement | HF Daily | 22 | agent |
| 2 | TTPO: Test-Time Policy Optimization | HF Daily | 50 | rag |
| 3 | Procedura: Agentic 3D Modeling | HF Daily | 4 | agent/rag/systems |
| 4 | CaSKG: Counterfactual-Causal Skill Graphs | HF Daily | 2 | agent/rag/memory |
| 5 | GameWAM: World Action Model for Video Games | HF Daily | 32 | agent/multimodal |
| 6 | Thinking on Shots: Multi-Shot Video Editing | HF Daily | 3 | agent/rag/multimodal |
| 7 | Agentic Game Dev as Data Engine for World Models | HF Daily | 15 | agent/multimodal/systems |
| 8 | Aphanta: Diagnosing Image-Edited Intermediates | HF Daily | 1 | benchmark/multimodal |
🔍 行业动向(Web 补充)
Chain-of-Agents: 多 Agent 协作处理长上下文(Google Research, 2026-08-12) - 训练无关、长度无关的多 Agent 协作框架,分散信息聚合与上下文推理 - 论文:优于 RAG 和原生长上下文 LLM,显著优势在更长样本 - Blog:https://research.google/blog/chain-of-agents-large-language-models-collaborating-on-long-context-tasks
长上下文 vs RAG 生产决策框架(TianPan.co, 2026-04) - Gemini 1.5 Pro 的 1M token 窗口出来后"RAG已死"论,但实践中 1M 窗口不等于适合所有场景 - 核心判断维度:知识更新频率、推理成本、精确召回需求
📝 简短洞察
-
Live self-improvement 是 Agent 热点:多条路线(causal graph、PILOT 的在线学习)都在解决"Agent 如何在执行中实时进化"这个问题。区别于传统 RL post-training 的离线特性。
-
Skill retrieval 从向量索引走向因果图:CaSKG 代表着 RAG 下一阶段——从找相似文本到理解技能间因果依赖关系,这对复杂 agent 工作流至关重要。
-
测试时训练(TTT)渗透到 RAG 后训练:TTPO 用 pseudo-labels + majority vote 实现无需 ground truth 的 post-training,对知识库频繁更新的场景有直接意义。
Tom · 每日3轮 · 轻量雷达 · 2026-08-28