RetireOPD:自退休式 On-Policy 蒸馏,用于 Agentic RL 训练
- 关联论文:2609.20784
- 作者:Yan Yu, Zhengxi Lu, Yizhou Liu, Yichen Pan, Aozhe Wang, Qipeng Chen, Hua Yang, Wenqi Zhang, Weiming Lu, Qianglong Chen, Yongliang Shen 等
- 更新:2026-09-18
一句话结论
RetireOPD 通过「自退休机制」让 RL 训练出的 Agent 在蒸馏教师模型时自己决定何时抛弃老师,比固定蒸馏 schedule 在 ALFWorld 和 WebShop 上分别高出 14~19 个百分点。
解决什么真问题
Multi-turn Agent(比如在 ALFWorld 做家务任务或在 WebShop 购物的 Agent)用 RL 训练时,每个 trajectory 只收到一个标量 reward signal——这导致了极稀疏的梯度信号,使得模型难以学到细粒度的 token 级别策略。
此前解决方案是 self on-policy distillation(OPD):训练一个拥有特权任务技能(privileged task skills)的自教师模型,让学生从教师那里获得密集的 token 级监督。然而 RetireOPD 团队发现了两个根本性问题,颠覆了 OPD 在 agentic 任务中的有效性:
- 特权信息并不总是让教师可靠:即使教师拥有完成任务所需的特权信息(如环境内部状态),在 agentic 任务中它仍可能给出误导性的中间步骤建议;
- 蒸馏收益是阶段依赖的:在训练早期学生需要教师指导,但到了后期教师反而可能成为瓶颈,因为教师的错误会反向传播到学生。
这两个问题意味着传统 OPD 的固定蒸馏 schedule(预先设定何时降低教师权重)是次优的。
核心方法
两阶段架构
RetireOPD 将训练分为两个阶段:
阶段一:优化技能条件教师(Skill-Conditioned Teacher)
教师接收任务描述 加上 任务所需技能集(skill set)作为输入条件。先在环境 reward 上独立优化教师,使其对「该任务需要哪些技能」有清晰认知,从而产生更可靠的分步指导。
# 伪代码框架
teacher_input = concat(task_description, skill_set)
teacher_output = teacher(teacher_input) # 每个 token 的 logit
teacher_loss = cross_entropy(teacher_output, expert_trajectory)
teacher_optim.step(teacher_loss)
阶段二:联合训练技能无关学生 + 自适应退休
学生模型(skill-free student)同时接收 RL signal 和 OPD signal 训练。教师是技能条件化的,学生则不需要技能描述——它要把教师的技能内化到自己参数中。
关键创新是 Adaptive Retirement 机制:
def should_retire(student, teacher, discrepancy, success_ratio, target_ratio):
# 条件1:师生差异停止缩小(discrepancy 收敛)
disc_shrinking = discrepancy[-window] < discrepancy[-2*window]
# 条件2:学生达到教师成功率的目标比例
at_target = success_ratio >= target_ratio
return disc_shrinking and at_target
当两个条件同时满足时,学生自动「退休」教师,后续仅用 RL 继续训练,不再使用 OPD signal。这一决定是模型自动做出的,而非人工预设 schedule。
训练目标可以写为带动态权重退出机制的联合损失:
L_total = L_rl + λ(t) · L_opd
其中 λ(t) 随师生差距和成功率动态衰减,
当 Adaptive Retirement 触发时 λ(t) → 0
关键实验与数据
实验在 Qwen2.5 系列(1.5B 到 7B)上进行,评估环境为 ALFWorld(家务任务)和 WebShop(网购任务):
| 模型规模 | ALFWorld 相对 RL baseline 提升 | WebShop 相对 RL baseline 提升 |
|---|---|---|
| 1.5B | +14.1% 成功率 | +11.8% 准确率 |
| 3B | +16.5% 成功率 | +15.2% 准确率 |
| 7B | +18.8% 成功率 | +19.0% 准确率 |
关键claim:RetireOPD 的学生在每个实验设置中都超越了自己的技能条件教师——这说明「退休」机制让学生摆脱了教师的错误限制,而非仅仅是减少了蒸馏依赖。
消融实验还显示,固定 schedule(如固定步数后停止蒸馏)比 Adaptive Retirement 表现差约 8~12 个百分点,证明自适应退出机制的必要性。
⚠️ 原文未明确说明 ALFWorld 和 WebShop 的基线成功率绝对值,以及各规模模型的绝对性能数字。
亮点与局限
亮点:
- 发现反直觉问题:在 agentic 任务中,教师拥有特权信息不等于教师可靠——这是一个此前被忽视的 OPD 失效根源;
- 自适应机制简洁有效:仅用两个可观测量(discrepancy 收敛趋势 + 成功率比例)做退出决策,避免了复杂的学习式退出;
- 跨规模一致性:1.5B 到 7B 均有效,说明机制本身不依赖特定规模;
- 与 SOTA OPD 方法的可比性在原文中未完整呈现(缺乏与 SOPHIA、RED-HT 等方法的直接对比)。
局限:
- 任务范围:仅在 ALFWorld 和 WebShop 两个 environment 验证,泛化到其他类型的 agentic 任务(如代码生成、机器人控制)尚待验证;
- Adaptive Retirement 的 target ratio 是手动设置的超参:原文未说明如何选择这个比例,也未做敏感性分析;
- 没有在更大规模模型(如 70B+)上验证,而这样的大模型可能蒸馏 dynamics 不同;
- PDF 中可能包含更多细节(如师生架构具体选择、训练超参),本次解读基于 abstract 和 TLDR,完整性有限。
对工程落地的启发
- RL Agent 的密集监督信号缺失是普遍问题:RetireOPD 给出的 OPD + Adaptive Retirement 方案可以直接应用到任何用 RL 训练的 multi-turn agent 系统;
- 「教师可信度动态评估」值得单独做成组件:不仅可以用于蒸馏退出决策,还可以用于 active learning——让模型在不确定时主动查询教师;
- 训练效率:退休后的 RL-only 阶段不再需要维护教师模型的推理开销,部署时可以考虑只部署学生模型;
- MoE 架构友好:Qwen2.5 MoE 版本的实验结果表明,RetireOPD 与稀疏激活架构兼容,这对实际部署的算力成本有重要意义。
⚠️ 工程实施前建议先在目标领域的具体任务上验证 Adaptive Retirement 的触发条件是否适用,尤其是目标 ratio 的选择。
与同方向工作的关系
RetireOPD 处于 RL + LLM Agent + 蒸馏的交叉点:
- 传统 OPD(SOPHIA 等):使用固定 schedule 做蒸馏,缺乏自适应退出机制;RetireOPD 的自适应退休是对这一 line 的根本性改进;
- Agent RL 训练(RL4FuncCall、TRL 等):关注如何设计 reward shaping 来解决稀疏 signal 问题,RetireOPD 提供了另一种思路——用 OPD 提供 token 级密集监督;
- Adaptive Computation(When2Think 等):同样解决「模型什么时候该停止计算」的问题,但 RetireOPD 针对的是训练阶段而非推理阶段;
- Knowledge Distillation for LLMs(MiniRMs、GKD 等):通用的知识蒸馏方法,RetireOPD 的贡献在于识别了 agentic 任务中 OPD 的特异性失效模式并提出针对性修复。
适合谁读
- LLM Agent 研发工程师:特别是用 RL 训练 multi-turn agent 的团队,RetireOPD 的 Adaptive Retirement 机制可以直接借鉴;
- RL + LLM 交叉方向研究者:理解 OPD 在 agentic 任务中为何失效、以及如何修复;
- AI Infra 工程师:了解 RL 训练中师生协同的最新方法,对训练系统设计有参考价值;
- 不推荐:仅关注 inference 优化或推理阶段计算分配的同学(这部分内容 RetireOPD 未涉及)。
本文基于 arXiv 2609.20784 abstract + TLDR + paper card 信息整理,方法细节来源于论文 abstract,实验数据来自 abstract,⚠️ 标注处为原文未明确或本次解读未覆盖的内容。