Self-Improvements in Modern Agentic Systems · 干货攻略

  • 链接: https://arxiv.org/abs/2607.13104
  • 分类: x-tips
  • 来源: X @omarsar0
  • 作者: Jay
  • 更新: 2026-07-19
  • 仓库: selfimproving-agent/awesome-Self-Improving-Agents

这是什么

2026 年 7 月 14 日上传至 arXiv 的一篇97 页大survey(arXiv:2607.13104),由 DAIR.AI 团队(Zhe Ren、Yimeng Chen 等)联合 Jürgen Schmidhuber 等人撰写。配套 GitHub 仓库 selfimproving-agent/awesome-Self-Improving-Agents 提供策展文献库、Agent 方向阅读指南和 LaTeX 源码。

论文核心主张:自改进自主智能体正从研究原型走向部署系统,亟需一个系统级统一框架来理解"智能体到底在改进什么"。


为什么值得关注

问题:目前关于 Agent 自我改进的论文散落在 RL、NLP、系统等多个社区,缺乏统一分类和概念基座,导致: - 研究者难以判断自己的方法属于哪个改进路线 - 工程师落地时不知道 scaffold 和 model 的改进各适合什么场景 - 评估方法碎片化,没有公认基准

解决框架:论文将现代 Agent 形式化为「基础模型 + 操作脚手架」的耦合配置:

Agent = (Foundation Model) + (Scaffolding: prompts + memory + tools + control logic)

自改进被严格形式化为一个自诱导的更新算子(self-induced update operator),作用于两个正交维度之一:

改进维度 作用于 特点
Foundation Model Improvement 模型参数 慢、持久、训练密集
Scaffolding Improvement prompt/memory/tools/scaffold 逻辑 快、可逆、廉价

这一二分法是全 survey 的核心贡献,也是目前最清晰的 Agent 改进路线图。


核验过程

官方来源: 1. GitHub READMEselfimproving-agent/awesome-Self-Improving-Agents)——策展库,确认论文配套仓库、taxonomy 各级分支、paper counts(Prompt Optimization 37 篇、Memory 61 篇、Tool 50 篇、Full Scaffolding 18 篇),以及 Agent 方向阅读指南 README_AGENT.md 的存在。 2. arXiv abstract 页(arXiv:2607.13104)——确认:97 页、12 figures、2026-07-14 提交、作者含 Jürgen Schmidhuber;与 README 所引一致。 3. Survey Hubselfimproving-agent.github.io)——确认:2. Scaffolding Improvement 含 166 篇论文;代表工作(Self-Instruct、Constitutional AI、WebRL、Self-Refine 等)均可溯源。

交叉验证: - DAIR.AI 官方账号(@omarsar0)转发的摘要与论文实际 abstract 完全一致,未发现夸张或失实表述。 - Papers with Code / HyperAI 等第三方平台检索到的摘要摘录与 arXiv 原文一致。 - Jürgen Schmidhuber 参与署名这点由 arXiv author list 确认(selfimproving-agent GitHub README 中未列,但 arXiv 记录有)。 - 原帖硬核点「将 agent 拆解为 foundation model + harness 并形式化 self-improvement 操作符」——已核验:论文 abstract 原文使用"configuration coupling a foundation model with an operational scaffold"和"self-induced update operator"描述,措辞略有出入(原文用 operational scaffold vs 原帖 harness),含义一致。

不确定处: - 原帖提及"agent 从研究演示进入部署系统"——survey 中确实有"moving from research prototypes to deployed systems"的表述,但未附具体落地案例数字,此处为原帖主张,已在正文中改写处理。


上手步骤

1. 快速建立直觉(30 分钟)

Survey Hub 推荐的代表工作路径阅读,顺序如下:

顺序 论文 年份 类别 为什么先读
1 Self-Instruct 2023 1.1 Intrinsic Generative Demonstrations 自生成指令对齐的范式起点
2 Constitutional AI 2022 1.2 Intrinsic Evaluative Feedback AI Feedback 框架开创者
3 WebRL 2025 1.3.1 Grounded Executable Environments RL + 课程学习的 agent 训练 setup
4 Self-Refine 2023 2.1 Prompt Optimization(qualitative) 自反馈迭代改进的经典范式
5 MemoryBank 2024 2.2 Memory 长期记忆架构代表
6 Voyager 2023 2.3 Tool 工具增强型具身 agent 标杆
7 Darwin Godel Machine 2025 2.4 Full Scaffolding 递归自改进 agent 代表

2. 深入 taxonomy(2-3 小时)

从 GitHub README 直接进入对应 section,166 篇 scaffold 改进论文按四大子分支组织:

Scaffolding Improvement(166 篇)
├── 2.1 Prompt Optimization(37 篇)
│   └── 定性反馈 / 量化梯度 / 文本梯度
├── 2.2 Memory(61 篇)
│   └── 记忆结构 / 检索增强 / 长期累积
├── 2.3 Tool(50 篇)
│   └── 工具发现 / 路由 / 动态工具集
└── 2.4 Full Scaffolding(18 篇)
    └── 完整 scaffold 替换 / 递归自改进

3. 使用 Agent-Oriented 阅读指南

仓库中 README_AGENT.md 提供了面向 Agent 开发者的快速上手路径,按实际使用场景(而非论文发表时间)组织,适合工程师直接找与自己系统最相关的模块。

4. 追踪最新进展

  • GitHub 仓库持续更新:https://github.com/selfimproving-agent/awesome-Self-Improving-Agents
  • Survey Hub 有完整论文库和更新追踪:https://selfimproving-agent.github.io/

坑与适用边界

1. 这是一篇 survey,不是实现指南 - 论文提供的是框架和文献地图,不含可直接复用的代码。 - 工程落地应结合具体子方向的代表作(如想优化 prompt 去看 Self-Refine/TextGrad,而非通读 survey)。

2. Jürgen Schmidhuber 参与 ≠ 论文由他主笔 - 从 author list 看 Schmidhuber 排位靠后,实际主要工作由 DAIR.AI 团队完成;不宜夸大其个人标签。

3. 166 篇 scaffold 论文 ≠ 全部实用 - 数量庞大但质量参差,survey 的策展价值在于分类,不在无差别推荐;从代表工作入手再按需扩展是更合理的用法。

4. 自改进的可控性是开放问题 - 论文专门有一节讨论 controllability,但并未给出解决方案;所有 scaffold 改进方法理论上都存在"改着改着不符合预期"的风险,落地生产系统时需有回滚和审计机制。

5. 适用边界 - 适合想系统理解 Agent 改进全貌的研究者和工程师; - 不适合需要直接找基准测试代码或具体实现 demo 的场景(那种需求应该去找各子方向的专项仓库)。


一句话结论

这篇 survey 最重要的贡献是一个框架(Agent = Foundation Model + Scaffold)和一个二元分类(改模型参数 vs 改脚手架),用它可以快速定位 200+ 相关工作;工程落地建议从 7 篇代表论文 + Agent-oriented guide 切入,不必硬啃 97 页全文。