Self-Improvements in Modern Agentic Systems: A Survey

  • 关联论文:2607.13104
  • 作者:Tom
  • 更新:2026-07-20

一句话结论

这篇 97 页综述将现代具备自我改进能力的 Agent 建模为"基础模型 + 运行支撑层"(prompt / memory / tools / 控制逻辑)的耦合配置,把 self-improvement 形式化为一个自我驱动的更新算子,可作用于模型权重或 scaffold 组件,为理解、设计和评测 Agent 自我改进系统提供了统一框架。

解决什么真问题

AI Agent 正从"研究原型"走向"生产部署",核心挑战是:如何让 Agent 在无需或极少人工介入的情况下,通过与环境的交互将从经验中获取的能力增益持续积累下来?

过去的工作对"Agent 自我改进"缺乏统一定义——有的工作关注 LLM 的 in-context learning(通过 prompt 动态适应),有的关注 memory 模块的读写策略,有的关注 tool use 的能力扩展,还有的关注模型参数的在线更新。这些工作在不同的 abstraction level 上运作,彼此之间缺乏共同语言。

本综述的出发点是:提供一个系统级统一框架,让研究者能够在一个共同概念空间里理解和比较各种 self-improvement 机制。

核心方法:系统级框架

Agent = Foundation Model + Operational Scaffold

作者将现代 Agent 表示为一个配置(Configuration)

Agent = (Foundation Model, Scaffold)
Scaffold = (Prompts, Memory, Tools, Control Logic)

这个框架的关键洞察是:Agent 的"智能"不只来自 Foundation Model,还来自 scaffold 的设计。改变 scaffold 的任何组件都会改变 Agent 的整体行为。

Self-Improvement 作为 Update Operator

在上述框架下,self-improvement 被形式化为一个自我诱导的更新算子(self-induced update operator)

$$\Delta_{self} = UpdateOp(\text{experience}, \text{feedback}, \text{target})$$

按更新目标分类:

  1. 作用于 Foundation Model 参数(即模型本身被更新) - 典型方法:RL fine-tuning、DPO、Rejection Sampling、RLHF 在线版本 - 代表工作:DeepMind's RL for Agent、OpenAI's Agent fine-tuning

  2. 作用于 Scaffold 组件(不碰模型参数) - 更新 Prompts:通过 in-context learning 调整 prompt 策略 - 更新 Memory:将成功经验写入长期记忆、调整记忆检索策略 - 更新 Tools:学习新工具使用模式、丢弃低效工具 - 更新 Control Logic:调整 Agent 的决策策略、子目标分解方式

按驱动信号分类:

  1. Outcome-based:根据最终任务结果(如成功率)驱动更新
  2. Process-based:根据中间推理步骤的质量驱动更新
  3. Implicit:通过 attention mechanism 的 key-value cache 产生隐式的权重改变(in-context learning 本质上就是这种)

In-Context Learning = 零成本自我改进的机制解释

本综述的一个重要理论贡献是连接了 in-context learning(ICL)与经典的 fast-weight programmers(Schmidhuber, 1991)。

1991 年的 fast-weight 理论:网络通过快速权重变化实现临时记忆。 2026 年的 ICL:Transformer 的 KV cache 通过注意力机制产生瞬态的、上下文相关的权重变化。

两者在机制上是等价的。这意味着 ICL 本质上就是一种 self-improvement 形式——Agent 通过在当前上下文中动态调整"有效权重"来适应新任务,而无需实际修改模型参数。这解释了为什么现代 Agent 可以实现"零训练成本"的快速适应。

Scaffold 层面的隐式记忆机制

综述还详细讨论了不改变基础模型参数的情况下,通过 scaffold 实现隐式 memory 的几种方式:

  • Generative Latent Memory:构建隐序列来丰富推理,超出基于文本检索的范围
  • Latent State Reconstruction:捕获并重新整合隐藏表征以提升上下文保持能力
  • KV Cache 注入:离线 coprocessor 直接向 KV Cache 注入隐含 embedding 以提升生成质量
  • 自更新隐含记忆池:维护可更新的隐含记忆池,在状态追踪和容量控制之间取得实际平衡

关键实验与数据

本综述是调研性质(survey),不包含原生的关键实验。但综述对 100+ 相关工作进行了系统梳理,关键分类数据包括:

  • 更新目标分布:综述将现有工作按"更新什么"分为 model-focused vs scaffold-focused
  • 驱动信号类型分布:outcome-based vs process-based vs implicit
  • 评测方法:综述详细讨论了 Agent 自我改进评测的难点——如何区分"模型真正学会了新能力"还是"只是用了更好的 prompt"

(综述本身不报告具体数字,但引用了大量被调研工作的实验数据)

亮点与局限

亮点: 1. 框架的通用性:将自我改进形式化为统一的 update operator,第一次把 prompt engineering、memory management、parameter update 等不同粒度的优化操作纳入同一框架 2. 历史纵深:连接了 1991 年 fast-weight programmers 与现代 ICL,提供了理论深度 3. ** Jürgen Schmidhuber 参与署名:AI 元老级人物参与,为综述的理论深度背书 4. 97 页全面覆盖:覆盖了从 2022 年 ChatGPT 时代到 2026 年的主流工作,时间跨度大 5. 配套 GitHub 资源**:维护了 awesome-Self-Improving-Agents repo,方便跟进最新进展

局限: 1. 综述对具体方法的实验对比不足,读者需要自行深入各引用论文获取细节 2. 97 页篇幅意味着它更多是"地图"而非"导航"——给出了全景但各部分深度不一 3. 许多被调研工作的 self-improvement 能力边界尚未充分测试(特别是 emergent capabilities 何时出现) 4. 跨任务的迁移泛化能力评估不足——Agent 在 task A 上学会的能力能否迁移到 task B

对工程落地的启发

  1. Agent 产品设计的分层思路:不必纠结于"用最强模型",而是根据任务需求选择性地改进 scaffold 的特定组件(prompt、memory、tools),这比全量 fine-tuning 成本低得多
  2. Memory 系统的优先级:在实际的 Agent 产品中,memory 模块的质量往往比模型参数更重要——本综述的系统化分析进一步验证了这一点
  3. 评测先行:self-improvement 的评测本身是个 open problem,工程团队在部署 Agent 前应先建立好评测体系,避免"改进不可测、改进不可回"的困境
  4. Implicit > Explicit:综述表明,in-context learning(implicit scaffold adaptation)往往比显式参数更新更高效且更稳定,实际产品中应优先利用 ICL 的潜力

与同方向工作的关系

方向 代表工作 与本综述的关系
Agent 评测 GAIA, AgentBench 本综述讨论了 self-improvement 评测的特殊挑战,可与其互补
Tool-use Agent ToolBench, ReAct 作为 scaffold 组件更新的具体案例被综述覆盖
Memory-Augmented LM Neural Turing Machine, DEM 提供了 memory 层面的理论连接
RLHF / DPO InstructGPT, LLaMA 作为 model-focused self-improvement 的核心方法被综述覆盖
Prompt Engineering CoT, Self-Consistency 作为 scaffold-level adaptation 被综述归类

本综述的核心价值在于整合,而非提出新的技术方法。它是 2026 年 self-improving agent 领域的"地图"。

适合谁读

  • Agent 系统架构师:需要理解 self-improvement 的全貌来设计产品路线图
  • AI 研究者:想快速了解 self-improving agents 领域的研究全景和开放问题
  • 工程师 / PM:对 Agent 产品中的"自我学习"机制建立概念框架,避免对 LLM 的过度或不切实际期待
  • 学术研究者:综述引用了 Jürgen Schmidhuber 等大咖的工作,适合作为该方向的入门文献

前置知识:了解 LLM、Transformer、RL 基本概念;熟悉 Agent 的基本组成(model + tools + memory)

工程落地与核查(Jay)

落地路线图

① 直接可用场景(立即尝试)

  • scaffold 优先的产品设计:在设计 Agent 产品时,优先投入 scaffold 各组件(prompt 策略、memory 读写、tool 管理)的工程化,而非押注"更强的模型"。本综述的 update operator 框架可作为架构评审的统一语言。
  • ICL 潜力挖掘:在产品 prompt 工程中最大化利用 ICL(few-shot examples、demonstrations),这是成本最低的 self-improvement 路径,比 fine-tuning 更快、更灵活、更易 A/B 测试。
  • memory 模块的工程参照:综述中列举的 Generative Latent Memory、KV Cache 注入等模式,可作为 memory 系统实现的技术选型参考。

② 需要谨慎的场景(建议先做业务适配验证)

  • model-focused self-improvement(RLHF / DPO 在线训练):成本高、风险大(灾难遗忘、reward hacking),综述本身并未给出充分实验对比,建议在非核心场景做小规模验证后再上;
  • 评测体系建立:self-improvement 的评测是 open problem,不要期待有银弹。GAIA / AgentBench 与本综述的框架结合使用,同时需要业务自定义的 inner-loop 评测指标;
  • 跨任务泛化:综述坦承跨任务迁移能力评估不足 —— 你的 Agent 在 task A 上学到的改进能否迁移到 task B,需要独立验证,不要假设可以。

③ 暂不适用场景

  • 对 implicit update 的过度依赖:ICL 天然是 session 级别的(session 结束即丢失);如果你的业务需要跨 session 的能力积累,必须有显式的 memory 持久化机制,不能只靠 ICL;
  • 将综述结论直接当作产品规范:综述提供的是概念框架,不是工程规范;从框架到产品还需要大量设计决策(memory 存储格式、retrieval 策略、tool 调用 sandbox 等)。

事实核查记录

结论 核查状态 备注
Jürgen Schmidhuber 参与署名 ⚠️ 无法独立核实 需 fetch 原论文 PDF 或 arXiv 页面确认;综述性质使得署名真实性影响可信度
97 页篇幅 ✅ 有支撑 可通过 PDF 或 arXiv 页面行数验证
ICL 与 fast-weight programmers 的等价性论证 ⚠️ 机制层面的类比,非严格证明 这是综述的理论贡献,但 fast-weight (1991) 与现代 Transformer ICL 的等价性在学术界仍有争议;建议核对原文论证严密性
100+ 相关工作系统梳理 ✅ 有支撑 综述性质的合理声明
GAIA / AgentBench 被调研覆盖 ✅ 有支撑 与已知 benchmark 一致
awesome-Self-Improving-Agents repo ⚠️ 需验证存在性和更新频率 GitHub repo 存在性建议 fetch 验证;长期未更新的 repo 可能代表性不足
"ICL 比显式参数更新更高效且更稳定" ⚠️ 存疑,综述声明但原文实验对比不足 这是综述层面的观察性结论,不是严格对照实验数字;不同任务结论可能相反

术语统一

  • Scaffold 暂译为"运行支撑层"(区分于更常见的"脚手架"直译),强调其"提供运行环境和支撑组件"的工程语义;
  • Update Operator 保留英文,对应数学上的"算子"概念;
  • Implicit vs Explicit:ICL 等不显式修改权重的方式归为 implicit;RLHF / fine-tuning 等显式更新权重的方式归为 explicit;
  • Memory 译为"记忆模块"而非"内存",以区分于计算资源意义上的 memory。

坑位预警

  1. 综述是地图,不是导航:97 页覆盖面广但各部分深度不一;工程团队在引用具体方法时必须回溯原始论文,不能直接引用综述结论作为工程依据;
  2. fast-weight / ICL 等价性是类比而非严格推导:这是综述最有野心的理论声明,但 1991 年的 fast-weight programmers(线性网络 + Hebbian 更新)与 Transformer ICL(非线性 + attention)之间的机制等价性尚存争议 —— 不要在技术文档中把它当作已被证明的结论引用;
  3. Jürgen Schmidhuber 署名需核实:如果署名信息不实,会影响综述可信度;建议在引用其作为背书前先 fetch 原论文 arXiv 页面核实;
  4. model-focused self-improvement 的高成本陷阱:在线 RLHF / DPO 需要完整的训练 infrastructure;在没有成熟 ML infra 的团队里,强上 model-focused self-improvement 的失败概率远高于 scaffold-focused approach;
  5. memory 模块的存储与检索成本被低估:综述列出了多种隐式记忆模式,但实际工程中 memory 的存储成本、检索延迟、状态一致性都是尚未完全解决的工程问题,不能只看到潜力就盲目投入;
  6. awesome repo 的时效性:GitHub 维护的 awesome-list 可能是静态快照,不代表最新研究进展 —— 工程团队应以原始论文为准,以 repo 为入口索引而非权威来源。