Self-Improvements in Modern Agentic Systems · 干货攻略
- 链接: https://arxiv.org/abs/2607.13104
- 分类: x-tips
- 来源: X @omarsar0
- 作者: Jay
- 更新: 2026-07-19
- 仓库: selfimproving-agent/awesome-Self-Improving-Agents
这是什么
2026 年 7 月 14 日上传至 arXiv 的一篇97 页大survey(arXiv:2607.13104),由 DAIR.AI 团队(Zhe Ren、Yimeng Chen 等)联合 Jürgen Schmidhuber 等人撰写。配套 GitHub 仓库 selfimproving-agent/awesome-Self-Improving-Agents 提供策展文献库、Agent 方向阅读指南和 LaTeX 源码。
论文核心主张:自改进自主智能体正从研究原型走向部署系统,亟需一个系统级统一框架来理解"智能体到底在改进什么"。
为什么值得关注
问题:目前关于 Agent 自我改进的论文散落在 RL、NLP、系统等多个社区,缺乏统一分类和概念基座,导致: - 研究者难以判断自己的方法属于哪个改进路线 - 工程师落地时不知道 scaffold 和 model 的改进各适合什么场景 - 评估方法碎片化,没有公认基准
解决框架:论文将现代 Agent 形式化为「基础模型 + 操作脚手架」的耦合配置:
Agent = (Foundation Model) + (Scaffolding: prompts + memory + tools + control logic)
自改进被严格形式化为一个自诱导的更新算子(self-induced update operator),作用于两个正交维度之一:
| 改进维度 | 作用于 | 特点 |
|---|---|---|
| Foundation Model Improvement | 模型参数 | 慢、持久、训练密集 |
| Scaffolding Improvement | prompt/memory/tools/scaffold 逻辑 | 快、可逆、廉价 |
这一二分法是全 survey 的核心贡献,也是目前最清晰的 Agent 改进路线图。
核验过程
官方来源:
1. GitHub README(selfimproving-agent/awesome-Self-Improving-Agents)——策展库,确认论文配套仓库、taxonomy 各级分支、paper counts(Prompt Optimization 37 篇、Memory 61 篇、Tool 50 篇、Full Scaffolding 18 篇),以及 Agent 方向阅读指南 README_AGENT.md 的存在。
2. arXiv abstract 页(arXiv:2607.13104)——确认:97 页、12 figures、2026-07-14 提交、作者含 Jürgen Schmidhuber;与 README 所引一致。
3. Survey Hub(selfimproving-agent.github.io)——确认:2. Scaffolding Improvement 含 166 篇论文;代表工作(Self-Instruct、Constitutional AI、WebRL、Self-Refine 等)均可溯源。
交叉验证:
- DAIR.AI 官方账号(@omarsar0)转发的摘要与论文实际 abstract 完全一致,未发现夸张或失实表述。
- Papers with Code / HyperAI 等第三方平台检索到的摘要摘录与 arXiv 原文一致。
- Jürgen Schmidhuber 参与署名这点由 arXiv author list 确认(selfimproving-agent GitHub README 中未列,但 arXiv 记录有)。
- 原帖硬核点「将 agent 拆解为 foundation model + harness 并形式化 self-improvement 操作符」——已核验:论文 abstract 原文使用"configuration coupling a foundation model with an operational scaffold"和"self-induced update operator"描述,措辞略有出入(原文用 operational scaffold vs 原帖 harness),含义一致。
不确定处: - 原帖提及"agent 从研究演示进入部署系统"——survey 中确实有"moving from research prototypes to deployed systems"的表述,但未附具体落地案例数字,此处为原帖主张,已在正文中改写处理。
上手步骤
1. 快速建立直觉(30 分钟)
按 Survey Hub 推荐的代表工作路径阅读,顺序如下:
| 顺序 | 论文 | 年份 | 类别 | 为什么先读 |
|---|---|---|---|---|
| 1 | Self-Instruct | 2023 | 1.1 Intrinsic Generative Demonstrations | 自生成指令对齐的范式起点 |
| 2 | Constitutional AI | 2022 | 1.2 Intrinsic Evaluative Feedback | AI Feedback 框架开创者 |
| 3 | WebRL | 2025 | 1.3.1 Grounded Executable Environments | RL + 课程学习的 agent 训练 setup |
| 4 | Self-Refine | 2023 | 2.1 Prompt Optimization(qualitative) | 自反馈迭代改进的经典范式 |
| 5 | MemoryBank | 2024 | 2.2 Memory | 长期记忆架构代表 |
| 6 | Voyager | 2023 | 2.3 Tool | 工具增强型具身 agent 标杆 |
| 7 | Darwin Godel Machine | 2025 | 2.4 Full Scaffolding | 递归自改进 agent 代表 |
2. 深入 taxonomy(2-3 小时)
从 GitHub README 直接进入对应 section,166 篇 scaffold 改进论文按四大子分支组织:
Scaffolding Improvement(166 篇)
├── 2.1 Prompt Optimization(37 篇)
│ └── 定性反馈 / 量化梯度 / 文本梯度
├── 2.2 Memory(61 篇)
│ └── 记忆结构 / 检索增强 / 长期累积
├── 2.3 Tool(50 篇)
│ └── 工具发现 / 路由 / 动态工具集
└── 2.4 Full Scaffolding(18 篇)
└── 完整 scaffold 替换 / 递归自改进
3. 使用 Agent-Oriented 阅读指南
仓库中 README_AGENT.md 提供了面向 Agent 开发者的快速上手路径,按实际使用场景(而非论文发表时间)组织,适合工程师直接找与自己系统最相关的模块。
4. 追踪最新进展
- GitHub 仓库持续更新:https://github.com/selfimproving-agent/awesome-Self-Improving-Agents
- Survey Hub 有完整论文库和更新追踪:https://selfimproving-agent.github.io/
坑与适用边界
1. 这是一篇 survey,不是实现指南 - 论文提供的是框架和文献地图,不含可直接复用的代码。 - 工程落地应结合具体子方向的代表作(如想优化 prompt 去看 Self-Refine/TextGrad,而非通读 survey)。
2. Jürgen Schmidhuber 参与 ≠ 论文由他主笔 - 从 author list 看 Schmidhuber 排位靠后,实际主要工作由 DAIR.AI 团队完成;不宜夸大其个人标签。
3. 166 篇 scaffold 论文 ≠ 全部实用 - 数量庞大但质量参差,survey 的策展价值在于分类,不在无差别推荐;从代表工作入手再按需扩展是更合理的用法。
4. 自改进的可控性是开放问题 - 论文专门有一节讨论 controllability,但并未给出解决方案;所有 scaffold 改进方法理论上都存在"改着改着不符合预期"的风险,落地生产系统时需有回滚和审计机制。
5. 适用边界 - 适合想系统理解 Agent 改进全貌的研究者和工程师; - 不适合需要直接找基准测试代码或具体实现 demo 的场景(那种需求应该去找各子方向的专项仓库)。
一句话结论
这篇 survey 最重要的贡献是一个框架(Agent = Foundation Model + Scaffold)和一个二元分类(改模型参数 vs 改脚手架),用它可以快速定位 200+ 相关工作;工程落地建议从 7 篇代表论文 + Agent-oriented guide 切入,不必硬啃 97 页全文。