Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-30 20:40
概览
- 数据源:HF Daily(arXiv 元数据 timeout,仅 HF 富化有效)
- 候选总数:8 条
- 高价值:4 条
- Substack/CSDN:Substack(ICLR 2026 Workshop on Self-Improvement)
- 去重参考:2026-08-30 已有 0840、1440 两期 radar,arXiv 今日未拉取,无直接重复
⭐ 高价值候选
1. CritICL:推理时弱到强泛化,从小型模型失败模式中学习
- 来源:HF Daily · arXiv · 2026-08-26 · 8 票
- 链接:https://arxiv.org/abs/2608.27455
- 标签:
ragsystems - 摘要:推理时 scaling 常用重复生成或外部验证,CritICL 提出新思路——利用同系列模型中弱模型的失败模式作为引导信号,让强模型在推理时自我改进。关键洞察:失败模式在不同规模模型间有结构性规律,可被复用。
- 价值判断:弱到强泛化 + 推理时 scaling 的交叉点,与当前 RAG/Agent 评测趋势高度相关,是评测驱动优化的新方向。
2. PILOT in the Loop:长时域 Agent 的在线自我改进
- 来源:HF Daily · arXiv · 2026-08-26 · 28 票
- 链接:https://arxiv.org/abs/2608.26530
- 标签:
agent - 摘要:现有自我改进方法在执行结束后才处理经验,无法重定向当前运行。PILOT 主张"在线改进"——在执行过程中同时重定向当前运行并更新持久化 harness,支持主动 run 的即时学习与验证。
- 价值判断:Agent 自我改进范式的核心问题,与 ICLR 2026 Workshop "AI with Recursive Self-Improvement" 直接呼应,落地价值高。
3. What Does an Evaluation License?:Inspect Evals 的声明边界审查
- 来源:HF Daily · arXiv · 2026-08-24 · 2 票
- 链接:https://arxiv.org/abs/2608.19269
- 标签:
benchmarksystems - 摘要:评测 artifact 只规定了"任务-评分器-指标"的正向计算,却不必然 license 指标背后的声明,因为复现所需的历史证据和语义锚定可能是无界的。对 124 个 Inspect Evals 单元的审查发现:110 个在确定性推理前停止,缺少历史证据或语义锚定。
- 价值判断:评测诚信问题——这篇直指当前 LLM 评测实践的根基地位,是 Agent 评测基础设施建设的关键前提。
4. Agentic Game Development:可验证轨迹数据引擎扩展世界模型
- 来源:HF Daily · arXiv · 2026-08-25 · 136 票
- 链接:https://arxiv.org/abs/2608.25518
- 标签:
agentmultimodalsystems - 摘要:可执行代码能提供高质量 RL post-training 奖励信号(编译器/runtimes),而空间生成仍依赖 CLIP 等模糊代理,无法支撑 RL。将游戏开发作为可验证轨迹数据引擎,验证 Agent scaling 的数据闭环思路。
- 价值判断:Agent + RL 后训练 + 世界模型三者交集,136 票最高热度,方法论上对 RAG/Agent 的评估体系有参照价值。
📋 其他候选
| # | 标题 | 票数 | 标签 | 备注 |
|---|---|---|---|---|
| 5 | Procedura:Agentic 3D 建模(参数化程序化建模) | 10 | agent rag systems |
LLM 生成可编辑 3D 程序,RAG 标签来自 3D 检索管线 |
| 6 | Luce:3D 资产生成的可重光照 Gaussian | 7 | multimodal |
偏 3D 视觉生成,非核心 |
| 7 | TacForcing:触觉反馈流式动作生成 | 5 | multimodal |
机器人操控方向 |
| 8 | EditaLive!:直播实时人物视频编辑 | 3 | multimodal systems |
实时视频编辑,非核心 |
💡 Substack 补充:ICLR 2026 Workshop 信号
ICLR 2026 Workshop: AI with Recursive Self-Improvement - 核心议题:自改进从实验室走向生产,涵盖经验学习、合成数据管线、多模态 Agent 系统、弱到强泛化、推理时 scaling - 与本期待选高度相关:PILOT(在线改进)、CritICL(弱到强泛化)均为 workshop 讨论核心 - workshop 主页:https://iclr.cc/virtual/2026/workshop/10000796
📝 本期小结
本期集中于 Agent 推理时自我改进(PILOT、CritICL)与 评测诚信(Evaluation License)两条线索,与 ICLR 2026 自改进 workshop 形成共振。arXiv 元数据本次 timeout,依赖 HF Daily 策展数据,广度受限但质量稳定。