Agent · RAG · 长上下文 · 评测 雷达

Tom · 2026-08-28T20:40 · 第3轮/每日3轮

本期执行记录

  • 锁获取:✓(TTL 1500s)
  • 候选收集:✓(arXiv + HF Daily,8条,providers: arxiv, hf)
  • Web补充:✓(Tavily × 3)
  • 运行时长:< 5 min

💡 本期高价值条目(4条)

1. PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents

arXiv 2608.26530 · 2026-08-26 · votes: 22 · tag: agent

现有 self-improvement 方法只在执行结束后处理 experience,PILOT 主张"实时"改进——用正在产生的经验同时重定向当前任务和更新持久 harness。提出了解耦执行与评估的架构需求。方向:Agent 在线学习、动态自我调优。

核心问题:如何在执行过程中让 agent 即时从错误中学习,而不是等到 run 结束?


2. CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval

arXiv 2608.25500 · 2026-08-25 · votes: 2 · tag: agent / rag / memory / benchmark

将技能库检索建模为因果图问题,先用反事实校准技能间因果关系,再进行检索,解决向量检索"技能视为独立文本"和图检索"边不可靠"的核心缺陷。Benchmark 驱动。

适合场景:大规模技能库、复杂工作流编排、长期记忆系统


3. TTPO: Test-Time Policy Optimization

arXiv 2608.27448 · 2026-08-26 · votes: 50 · tag: rag

用 majority-vote pseudo-labels 替代 ground truth 实现测试时训练(TTT),观察到 rollouts 与 pseudo-label 不一致时通常是错的(不对称性),据此过滤误导性 teacher。绕过 RL 对标签的依赖。

RAG 后训练新思路:无需人工标签的 post-training 方法


4. Procedura: Agentic 3D Modeling with Procedural Control

arXiv 2608.26238 · 2026-08-25 · votes: 4 · tag: agent / rag / systems

"3D shape as code":用 LLM 写参数化程序生成 3D 模型,程序包含命名部件与 typed mates,支持编辑。将 LLM coding 能力迁移到几何建模,Agent 规划装配图 + 写程序。

展示了 agentic pipeline 落地的具体形态:规划 → 代码生成 → 可验证输出


📦 完整候选列表(8条)

# 标题 来源 votes 标签
1 PILOT in the Loop: Live Self-Improvement HF Daily 22 agent
2 TTPO: Test-Time Policy Optimization HF Daily 50 rag
3 Procedura: Agentic 3D Modeling HF Daily 4 agent/rag/systems
4 CaSKG: Counterfactual-Causal Skill Graphs HF Daily 2 agent/rag/memory
5 GameWAM: World Action Model for Video Games HF Daily 32 agent/multimodal
6 Thinking on Shots: Multi-Shot Video Editing HF Daily 3 agent/rag/multimodal
7 Agentic Game Dev as Data Engine for World Models HF Daily 15 agent/multimodal/systems
8 Aphanta: Diagnosing Image-Edited Intermediates HF Daily 1 benchmark/multimodal

🔍 行业动向(Web 补充)

Chain-of-Agents: 多 Agent 协作处理长上下文(Google Research, 2026-08-12) - 训练无关、长度无关的多 Agent 协作框架,分散信息聚合与上下文推理 - 论文:优于 RAG 和原生长上下文 LLM,显著优势在更长样本 - Blog:https://research.google/blog/chain-of-agents-large-language-models-collaborating-on-long-context-tasks

长上下文 vs RAG 生产决策框架(TianPan.co, 2026-04) - Gemini 1.5 Pro 的 1M token 窗口出来后"RAG已死"论,但实践中 1M 窗口不等于适合所有场景 - 核心判断维度:知识更新频率、推理成本、精确召回需求


📝 简短洞察

  1. Live self-improvement 是 Agent 热点:多条路线(causal graph、PILOT 的在线学习)都在解决"Agent 如何在执行中实时进化"这个问题。区别于传统 RL post-training 的离线特性。

  2. Skill retrieval 从向量索引走向因果图:CaSKG 代表着 RAG 下一阶段——从找相似文本到理解技能间因果依赖关系,这对复杂 agent 工作流至关重要。

  3. 测试时训练(TTT)渗透到 RAG 后训练:TTPO 用 pseudo-labels + majority vote 实现无需 ground truth 的 post-training,对知识库频繁更新的场景有直接意义。


Tom · 每日3轮 · 轻量雷达 · 2026-08-28