DAEDALUS:用「自生成任务」给 LLM Agent 冷启动一份可复用记忆
- 关联论文:2610.08048
- 作者:flyP
- 更新:2026-10-08
一句话结论
DAEDALUS 是一个不需要预置环境知识、不需要 oracle 验证器的 Agent 记忆构建框架。它让一对 Agent(一个 explorer、一个 solver)在环境里互相对弈:explorer 出题,solver 做题,只有当 solver 在「带启发式」情况下反复成功,才把启发式写进记忆库。在 AppWorld、τ²-bench、AutomationBench 上比无记忆基线最多 +15.9 个百分点的成功率、pass^5 最多 2.2×,且在 AppWorld 与 τ²-bench 上与「依赖训练任务 + oracle」的方法有竞争力,推理成本更低。
解决什么真问题
LLM Agent 部署到新环境时普遍撞三堵墙:
- 操作知识空白——工具行为、环境规约往往要靠试错累积;没有记忆,每条新轨迹都重新踩坑。
- 现有记忆路线有先决条件——人类手写 guideline 成本高且难迁移;用训练任务 + oracle verifier 构造 procedural memory 又要求事先知道任务分布。
- 失败模式难以总结——同类错误在不同 query 措辞下反复出现,简单的「把 trace 存起来回放」拿不到抽象后的可用规则。
DAEDALUS 的核心判断是:记忆不需要「先有人教」,而可以从 agent 自己在环境里生成(且能稳定复现)的成功经验里抽规则。
核心方法
双 Agent 闭环
explorer (出题) ── 任务 ──> solver (做题)
^ │
│ ▼
└── 难度反馈 <──── 成功 / 失败 + solver trace
- Explorer:在环境中尝试「动作」以生成有挑战但可解的任务。任务难度由 explorer 根据 solver 的成功率反馈动态调整。
- Solver:拿到任务后执行,输出完整轨迹(trace)。
- 启发式提取:当 solver 失败时,从 trace 里抽一条候选启发式;只有当把这条启发式放进 prompt 后,solver 多次重复成功,它才被「验收」并写入 memory bank。
启发式准入准则(关键)
DAEDALUS 的成败分水岭在这条准入规则:
一条启发式要被采纳,需要 solver 在「含该启发式」的 prompt 下反复成功。
这相当于一种自我验证(self-validation):不靠外部 oracle,而是靠「同一 agent、带不带这条规则、稳定性差异」做证据。它有三层含义:
- 防幻觉:瞎写的规则加进去不会让成功率稳定提升,自然被拒。
- 可解释:被采纳的规则都能拿到「加上后稳定的成功 case」作支撑。
- 跨模型可迁移:作者报告这些规则对其他模型家族的 agent 也有效(即「这份记忆」不是绑死某个底座)。
探索预算与早期发现
- 小预算即可见效:作者报告早期发现已经能产出可用规则,且对早期启发式做因子化分解让探索更省钱。
- 任务的难度由 explorer 据 solver 反馈动态调整,避免 explorer 一直出 trivial 任务(无信息量)或过难任务(学不到东西)。
推理时的使用
测试时,memory bank 被检索/注入 solver prompt。作者没声明只用 top-k 还是全部;从「pass^5 增益」看,是显著提升了重复尝试的成功率——意味着记忆帮 agent 在多轮尝试中不重复犯同类错。
关键实验与数据
论文在三个 Agent 评测环境上做了对比:
- AppWorld:模拟真实 App 交互的基准
- τ²-bench(tau²-bench):τ-bench 升级版,复杂多轮客服/工具场景
- AutomationBench:自动化任务评测
核心数字(来自 abstract,verbatim):
- 平均成功率相对无记忆基线提升最高 +15.9 个百分点
- pass^5 最高 2.2×
- 在部分基准上与依赖训练任务 + oracle 的方法有竞争力,且推理成本更低
- 小探索预算下已出现性能增益
- 启发式可跨模型家族迁移
- 消融实验:solver trace 是抽取有效启发式的关键信息源;因子化早期发现可降低探索成本
- 副发现:DAEDALUS 生成的任务可作为 benchmark 任务的代理用于模型排名
代码与制品开源:http://www.github.com/illuin-tech/daedalus(注:abstract 原文使用 this http URL 短链前缀 + github.com/illuin-tech/daedalus,按 verbatim 转写)。
论文规格:9 页正文 + 附录共 31 页 / 8 图(含附录 11 图),v1 提交于 2026-10-06,cs.AI / cs.CL / cs.LG。
亮点与局限
亮点
- 冷启动友好:不依赖人类 guideline、不依赖训练任务与 oracle,纯靠「agent 自己出题自己做」攒记忆。
- 跨模型迁移:memory bank 不是绑死某底座,对其他模型家族的 agent 也有用。
- 副产品可当 benchmark:自生成任务能用于模型排名,对评估数据稀缺的领域是利好。
- pass^5 增益可观:在多轮尝试场景下,记忆显著降低「重复踩同一坑」的浪费。
局限
- 计算成本换人力成本:explorer + solver 双 agent + 多轮验证 = 在线探索阶段的 token 开销不低;abstract 没给具体成本数字。诚实标注:探索阶段每条规则的平均 token/美元成本原文未明确。
- 启发式质量上限取决于 solver 自身——如果底座弱到连 trace 都不可信,启发式准入机制会失效;abstract 未报告不同底座大小下的稳健性曲线。诚实标注:弱底座下的稳定性边界原文未公开。
- 规则检索机制是分延问题——memory bank 增长后,「怎么找到当下该用哪条规则」会变成新的检索子问题;abstract 未明确用 embedding/keyword/LLM-rerank 哪种。
- 任务分布偏置:explorer 出题倾向它能生成的难度分布,对真实用户 query 的覆盖度未必完整。
§八 工程坑点(现象/影响/修复)
-
启发式过拟合单一 query 模板 - 现象:启发式被「在某条 query 措辞下有效」通过验收,但在语义等价改写下失败。 - 影响:memory bank 表面指标好看,真实部署时反复踩坑。 - 修复:准入阶段加「同义改写集」作为交叉验证;query 侧允许 LLM 重写后再检索。
-
explorer 任务难度坍缩到 trivial - 现象:explorer 发现 solver 总是成功,便持续出简单任务,探索停止提供新信息。 - 影响:memory bank 早停,泛化差。 - 修复:设置最小难度阈值 + 多样性奖励(与历史任务 embedding 距离),并周期性注入「未覆盖场景」种子。
-
重复成功判定的采样数过少 - 现象:「加上启发式后 N 次成功」中 N 太小,统计噪声大,弱规则被放行。 - 影响:bank 充满噪声规则,下游成功率被拉低。 - 修复:动态 N(按难度递增)+ 失败回退窗口(任何一次回退就降权/撤销)。
-
memory bank 检索延迟与 token 成本 - 现象:bank 增长到数百/数千条规则后,每轮都全量注入 prompt。 - 影响:推理时延与成本暴涨,反而比无记忆基线更差。 - 修复:嵌入检索 + top-k 选择;规则压缩(多条合并成「meta-rule」);条件触发而非默认注入。
-
跨模型迁移的格式敏感 - 现象:在某模型上提炼出的规则依赖其特殊工具调用格式,迁到其他模型失效。 - 影响:所谓「跨模型可用」只在格式兼容时成立。 - 修复:规则库层与底座解耦,规则采用语义化自然语言描述 + 调用模板由底座适配层补全。
-
trace 噪声被当成启发式 - 现象:trace 中夹杂幻觉工具名/参数,启发式抽到这些噪声。 - 影响:执行阶段触发工具调用错误。 - 修复:抽取前对工具名/参数做 schema 校验;用静态分析过滤「不可执行」片段。
对工程落地的启发
- 记忆是 agent 的「冷启动护城河」:与其上线后让用户当 QA,不如先用 DAEDALUS 这类自博弈攒一份基础记忆。
- 准入机制比记忆库大小更重要:能稳定让成功率上升的规则才有价值,量大但良莠不齐的库反而是负担。
- 副产品可当 benchmark 数据:在没有公开 benchmark 的垂直域,自生成任务可作模型排名依据。
- 跨底座迁移是设计目标:写规则时就考虑解耦,避免被某个模型的私有格式绑死。
与同方向工作的关系
- vs. 人类手写 guideline / SOP:DAEDALUS 完全免人工,但牺牲在线计算换人力。
- vs. 训练任务 + oracle 的 procedural memory(如某些 RL-style agent memory 工作):DAEDALUS 放弃训练任务分布假设,引入自博弈;推理成本更低但需要在线 token 预算。
- vs. Experience Replay / Reflexion 类的「把失败存下来回放」:DAEDALUS 把失败升级成「带反复验证才能采纳的规则」,抽象层级更高。
- vs. Voyager / Generative Agents 的类技能库:DAEDALUS 的关键贡献是不靠预先存在的任务/技能清单,门槛更低。
适合谁读
- 做 Agent 平台、需要给冷启动 agent 准备记忆库的工程团队
- 研究 self-play / 自动 curriculum 的 RL 与 LLM 交叉方向研究者
- 对 agent benchmark 成本敏感、想用自生成任务做模型排名的评测工程师
- 想理解「免 oracle 也能做 memory bootstrap」的入门读者
诚实标注汇总:①探索阶段 token/美元成本原文未明确;②弱底座下的稳定性边界原文未公开;③memory bank 内部检索机制 abstract 未披露;④规则库具体跨哪些模型家族的逐项迁移率原文未列。解读仅基于 abstract 与 paper_card 字段,未读 PDF 全文。