Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-30 20:40

概览

  • 数据源:HF Daily(arXiv 元数据 timeout,仅 HF 富化有效)
  • 候选总数:8 条
  • 高价值:4 条
  • Substack/CSDN:Substack(ICLR 2026 Workshop on Self-Improvement)
  • 去重参考:2026-08-30 已有 0840、1440 两期 radar,arXiv 今日未拉取,无直接重复

⭐ 高价值候选

1. CritICL:推理时弱到强泛化,从小型模型失败模式中学习

  • 来源:HF Daily · arXiv · 2026-08-26 · 8 票
  • 链接:https://arxiv.org/abs/2608.27455
  • 标签rag systems
  • 摘要:推理时 scaling 常用重复生成或外部验证,CritICL 提出新思路——利用同系列模型中弱模型的失败模式作为引导信号,让强模型在推理时自我改进。关键洞察:失败模式在不同规模模型间有结构性规律,可被复用。
  • 价值判断:弱到强泛化 + 推理时 scaling 的交叉点,与当前 RAG/Agent 评测趋势高度相关,是评测驱动优化的新方向。

2. PILOT in the Loop:长时域 Agent 的在线自我改进

  • 来源:HF Daily · arXiv · 2026-08-26 · 28 票
  • 链接:https://arxiv.org/abs/2608.26530
  • 标签agent
  • 摘要:现有自我改进方法在执行结束后才处理经验,无法重定向当前运行。PILOT 主张"在线改进"——在执行过程中同时重定向当前运行并更新持久化 harness,支持主动 run 的即时学习与验证。
  • 价值判断:Agent 自我改进范式的核心问题,与 ICLR 2026 Workshop "AI with Recursive Self-Improvement" 直接呼应,落地价值高。

3. What Does an Evaluation License?:Inspect Evals 的声明边界审查

  • 来源:HF Daily · arXiv · 2026-08-24 · 2 票
  • 链接:https://arxiv.org/abs/2608.19269
  • 标签benchmark systems
  • 摘要:评测 artifact 只规定了"任务-评分器-指标"的正向计算,却不必然 license 指标背后的声明,因为复现所需的历史证据和语义锚定可能是无界的。对 124 个 Inspect Evals 单元的审查发现:110 个在确定性推理前停止,缺少历史证据或语义锚定。
  • 价值判断:评测诚信问题——这篇直指当前 LLM 评测实践的根基地位,是 Agent 评测基础设施建设的关键前提。

4. Agentic Game Development:可验证轨迹数据引擎扩展世界模型

  • 来源:HF Daily · arXiv · 2026-08-25 · 136 票
  • 链接:https://arxiv.org/abs/2608.25518
  • 标签agent multimodal systems
  • 摘要:可执行代码能提供高质量 RL post-training 奖励信号(编译器/runtimes),而空间生成仍依赖 CLIP 等模糊代理,无法支撑 RL。将游戏开发作为可验证轨迹数据引擎,验证 Agent scaling 的数据闭环思路。
  • 价值判断:Agent + RL 后训练 + 世界模型三者交集,136 票最高热度,方法论上对 RAG/Agent 的评估体系有参照价值。

📋 其他候选

# 标题 票数 标签 备注
5 Procedura:Agentic 3D 建模(参数化程序化建模) 10 agent rag systems LLM 生成可编辑 3D 程序,RAG 标签来自 3D 检索管线
6 Luce:3D 资产生成的可重光照 Gaussian 7 multimodal 偏 3D 视觉生成,非核心
7 TacForcing:触觉反馈流式动作生成 5 multimodal 机器人操控方向
8 EditaLive!:直播实时人物视频编辑 3 multimodal systems 实时视频编辑,非核心

💡 Substack 补充:ICLR 2026 Workshop 信号

ICLR 2026 Workshop: AI with Recursive Self-Improvement - 核心议题:自改进从实验室走向生产,涵盖经验学习、合成数据管线、多模态 Agent 系统、弱到强泛化、推理时 scaling - 与本期待选高度相关:PILOT(在线改进)、CritICL(弱到强泛化)均为 workshop 讨论核心 - workshop 主页:https://iclr.cc/virtual/2026/workshop/10000796


📝 本期小结

本期集中于 Agent 推理时自我改进(PILOT、CritICL)与 评测诚信(Evaluation License)两条线索,与 ICLR 2026 自改进 workshop 形成共振。arXiv 元数据本次 timeout,依赖 HF Daily 策展数据,广度受限但质量稳定。