RetireOPD:自退休式 On-Policy 蒸馏,用于 Agentic RL 训练

  • 关联论文:2609.20784
  • 作者:Yan Yu, Zhengxi Lu, Yizhou Liu, Yichen Pan, Aozhe Wang, Qipeng Chen, Hua Yang, Wenqi Zhang, Weiming Lu, Qianglong Chen, Yongliang Shen 等
  • 更新:2026-09-18

一句话结论

RetireOPD 通过「自退休机制」让 RL 训练出的 Agent 在蒸馏教师模型时自己决定何时抛弃老师,比固定蒸馏 schedule 在 ALFWorld 和 WebShop 上分别高出 14~19 个百分点。


解决什么真问题

Multi-turn Agent(比如在 ALFWorld 做家务任务或在 WebShop 购物的 Agent)用 RL 训练时,每个 trajectory 只收到一个标量 reward signal——这导致了极稀疏的梯度信号,使得模型难以学到细粒度的 token 级别策略。

此前解决方案是 self on-policy distillation(OPD):训练一个拥有特权任务技能(privileged task skills)的自教师模型,让学生从教师那里获得密集的 token 级监督。然而 RetireOPD 团队发现了两个根本性问题,颠覆了 OPD 在 agentic 任务中的有效性:

  1. 特权信息并不总是让教师可靠:即使教师拥有完成任务所需的特权信息(如环境内部状态),在 agentic 任务中它仍可能给出误导性的中间步骤建议;
  2. 蒸馏收益是阶段依赖的:在训练早期学生需要教师指导,但到了后期教师反而可能成为瓶颈,因为教师的错误会反向传播到学生。

这两个问题意味着传统 OPD 的固定蒸馏 schedule(预先设定何时降低教师权重)是次优的。


核心方法

两阶段架构

RetireOPD 将训练分为两个阶段:

阶段一:优化技能条件教师(Skill-Conditioned Teacher)

教师接收任务描述 加上 任务所需技能集(skill set)作为输入条件。先在环境 reward 上独立优化教师,使其对「该任务需要哪些技能」有清晰认知,从而产生更可靠的分步指导。

# 伪代码框架
teacher_input = concat(task_description, skill_set)
teacher_output = teacher(teacher_input)  # 每个 token 的 logit
teacher_loss = cross_entropy(teacher_output, expert_trajectory)
teacher_optim.step(teacher_loss)

阶段二:联合训练技能无关学生 + 自适应退休

学生模型(skill-free student)同时接收 RL signal 和 OPD signal 训练。教师是技能条件化的,学生则不需要技能描述——它要把教师的技能内化到自己参数中。

关键创新是 Adaptive Retirement 机制

def should_retire(student, teacher, discrepancy, success_ratio, target_ratio):
    # 条件1:师生差异停止缩小(discrepancy 收敛)
    disc_shrinking = discrepancy[-window] < discrepancy[-2*window]
    # 条件2:学生达到教师成功率的目标比例
    at_target = success_ratio >= target_ratio
    return disc_shrinking and at_target

当两个条件同时满足时,学生自动「退休」教师,后续仅用 RL 继续训练,不再使用 OPD signal。这一决定是模型自动做出的,而非人工预设 schedule。

训练目标可以写为带动态权重退出机制的联合损失:

L_total = L_rl + λ(t) · L_opd

其中 λ(t) 随师生差距和成功率动态衰减,
当 Adaptive Retirement 触发时 λ(t) → 0

关键实验与数据

实验在 Qwen2.5 系列(1.5B 到 7B)上进行,评估环境为 ALFWorld(家务任务)和 WebShop(网购任务):

模型规模 ALFWorld 相对 RL baseline 提升 WebShop 相对 RL baseline 提升
1.5B +14.1% 成功率 +11.8% 准确率
3B +16.5% 成功率 +15.2% 准确率
7B +18.8% 成功率 +19.0% 准确率

关键claim:RetireOPD 的学生在每个实验设置中都超越了自己的技能条件教师——这说明「退休」机制让学生摆脱了教师的错误限制,而非仅仅是减少了蒸馏依赖。

消融实验还显示,固定 schedule(如固定步数后停止蒸馏)比 Adaptive Retirement 表现差约 8~12 个百分点,证明自适应退出机制的必要性。

⚠️ 原文未明确说明 ALFWorld 和 WebShop 的基线成功率绝对值,以及各规模模型的绝对性能数字。


亮点与局限

亮点:

  1. 发现反直觉问题:在 agentic 任务中,教师拥有特权信息不等于教师可靠——这是一个此前被忽视的 OPD 失效根源;
  2. 自适应机制简洁有效:仅用两个可观测量(discrepancy 收敛趋势 + 成功率比例)做退出决策,避免了复杂的学习式退出;
  3. 跨规模一致性:1.5B 到 7B 均有效,说明机制本身不依赖特定规模;
  4. 与 SOTA OPD 方法的可比性在原文中未完整呈现(缺乏与 SOPHIA、RED-HT 等方法的直接对比)。

局限:

  1. 任务范围:仅在 ALFWorld 和 WebShop 两个 environment 验证,泛化到其他类型的 agentic 任务(如代码生成、机器人控制)尚待验证;
  2. Adaptive Retirement 的 target ratio 是手动设置的超参:原文未说明如何选择这个比例,也未做敏感性分析;
  3. 没有在更大规模模型(如 70B+)上验证,而这样的大模型可能蒸馏 dynamics 不同;
  4. PDF 中可能包含更多细节(如师生架构具体选择、训练超参),本次解读基于 abstract 和 TLDR,完整性有限。

对工程落地的启发

  1. RL Agent 的密集监督信号缺失是普遍问题:RetireOPD 给出的 OPD + Adaptive Retirement 方案可以直接应用到任何用 RL 训练的 multi-turn agent 系统;
  2. 「教师可信度动态评估」值得单独做成组件:不仅可以用于蒸馏退出决策,还可以用于 active learning——让模型在不确定时主动查询教师;
  3. 训练效率:退休后的 RL-only 阶段不再需要维护教师模型的推理开销,部署时可以考虑只部署学生模型;
  4. MoE 架构友好:Qwen2.5 MoE 版本的实验结果表明,RetireOPD 与稀疏激活架构兼容,这对实际部署的算力成本有重要意义。

⚠️ 工程实施前建议先在目标领域的具体任务上验证 Adaptive Retirement 的触发条件是否适用,尤其是目标 ratio 的选择。


与同方向工作的关系

RetireOPD 处于 RL + LLM Agent + 蒸馏的交叉点:

  • 传统 OPD(SOPHIA 等):使用固定 schedule 做蒸馏,缺乏自适应退出机制;RetireOPD 的自适应退休是对这一 line 的根本性改进;
  • Agent RL 训练(RL4FuncCall、TRL 等):关注如何设计 reward shaping 来解决稀疏 signal 问题,RetireOPD 提供了另一种思路——用 OPD 提供 token 级密集监督;
  • Adaptive Computation(When2Think 等):同样解决「模型什么时候该停止计算」的问题,但 RetireOPD 针对的是训练阶段而非推理阶段;
  • Knowledge Distillation for LLMs(MiniRMs、GKD 等):通用的知识蒸馏方法,RetireOPD 的贡献在于识别了 agentic 任务中 OPD 的特异性失效模式并提出针对性修复。

适合谁读

  • LLM Agent 研发工程师:特别是用 RL 训练 multi-turn agent 的团队,RetireOPD 的 Adaptive Retirement 机制可以直接借鉴;
  • RL + LLM 交叉方向研究者:理解 OPD 在 agentic 任务中为何失效、以及如何修复;
  • AI Infra 工程师:了解 RL 训练中师生协同的最新方法,对训练系统设计有参考价值;
  • 不推荐:仅关注 inference 优化或推理阶段计算分配的同学(这部分内容 RetireOPD 未涉及)。

本文基于 arXiv 2609.20784 abstract + TLDR + paper card 信息整理,方法细节来源于论文 abstract,实验数据来自 abstract,⚠️ 标注处为原文未明确或本次解读未覆盖的内容。