Open-MOPD:多教师同策略蒸馏全流程开源复现 · 干货攻略
- 链接: https://x.com/cwolferesearch/status/2095256315476000817
- 分类: x-tips
- 来源: X @cwolferesearch
- 作者: Jay
- 更新: 2026-09-27
- 仓库: BytedTsinghua-SIA/Open-MOPD
这是什么
Open-MOPD(Open Multi-Teacher On-Policy Distillation)是清华大学AIR学院与字节跳动Seed团队开源的多教师同策略蒸馏完整配方,发布于 2026 年 8 月 19 日(arXiv:2608.19098)。它解决了一个 2026 年后训练领域公认难题:如何把多个领域专精的 RL 教师(如数学、代码、指令遵循)的能力,高保真地合并到一个学生模型里,而不是让各教师相互干扰导致能力退化。
该工作的核心贡献不是提出新架构,而是一套可复现的诊断 + 修复框架:先用受控基准隔离出"能力集成瓶颈"的真正根因,再针对性地提出三种机制将瓶颈一一解除,最终在一个 SmolLM3-3B-Base(3B 参数)模型上验证有效。
为什么值得关注
谁在用 MOPD
多教师同策略蒸馏(MOPD)范式在 2026 年已被多家前沿团队采纳。据 alphaXiv 社区梳理,MiMo-V2-Flash、Kimi K3、DeepSeek-V4 等模型的后训练均涉及类似思路。Open-MOPD 的意义在于它是第一个把完整配方开源的工作——包括 SFT 数据、RL 教师训练脚本、蒸馏代码、模型权重和评测数据,任何人都可以在学术预算内复现。
解决什么问题
当你想让一个学生模型同时具备数学、代码和指令遵循能力时,最直觉的做法是让三个教师分别对各自的请求做 on-policy 采样,然后用 KL 散度让学生的 token 分布逼近对应教师的分布。但这样做会遇到严重的能力集成退化:
- Naive M-OPD 的综合得分只比单做 SFT 高 2.4 分(28.05 vs 25.67)
- 与分领域部署的 RouteRL 上限相比,只恢复了 35.6% 的可提升空间
- 指令遵循(IF)退化最严重:IFEval 得分仅从 41.46 微涨到 43.64,远低于 RouteRL 的 51.08
原帖将其描述为 2026 年后训练新范式,核心洞察是:能力集成不再是 SFT/RL 的二元选择,同策略蒸馏是可以把多个 RL 教师能力合并的第三条路。
核验过程
本攻略全部数字、版本、方法论均来自以下官方来源,已与多处交叉验证:
| 来源 | 用途 |
|---|---|
| GitHub README | 完整 pipeline 描述、评测数据、模型卡片、启动命令 |
| arXiv:2608.19098 | 论文 abstract、方法动机、实验配置 |
| 项目主页 | 诊断过程详解、三大瓶颈机制、可视化数据 |
| Hugging Face 集合 | 5 个模型权重 + 训练评测数据集地址 |
| VESSL Blog | 独立技术博客交叉验证 MOPD 的 token 级 KL 目标、PPO 样本效率对比(6×) |
关键数字核验结果:
- 基准模型:SmolLM3-3B-Base(论文选择依据:在 1.7B 能力不足和 7B 成本过高之间取得平衡)
- 评测基准:AIME24/AIME25(mean@64)、LiveCodeBench v5/v6(mean@10)、IFEval/IFBench_test(mean@1)——与 README 一致
- 集成缺口:3.50 分 → 0.31 分;恢复率 35.6% → 83.4%——多个来源一致
- token 级失衡:Prompt 分布 39.8/39.8/20.3%(Math/Code/IF),但梯度 token 分布实际为 49.7/49.3/0.99%——IF 几乎被吞掉
原帖主张 vs 官方确认: - 原帖称"MOPD 被 MiMo/K3/DeepSeek-V4 采用"→ 来自 alphaXiv 社区梳理,非本论文直接声明,标注为「原帖主张」;Open-MOPD 论文本身不涉及这些模型的内部实现 - 交叉验证搜索未发现其他独立复现报告,但 HuggingFace 上 6 个模型/数据集页面可验证权重存在
上手步骤
环境安装
git clone https://github.com/BytedTsinghua-SIA/Open-MOPD.git
cd Open-MOPD
bash training/install_requirements.sh
下载模型权重(Hugging Face)
官方提供了完整的 5 个模型家族,通过 Hugging Face 集合页分发:
| 模型 | 用途 | Hugging Face ID |
|---|---|---|
| MixSFT | 初始化基座 | BytedTsinghua-SIA/Open-MOPD-SmolLM3-3B-MixSFT |
| Math RL 教师 | 数学领域强化学习教师 | BytedTsinghua-SIA/Open-MOPD-SmolLM3-3B-RL-Math |
| Code RL 教师 | 代码领域强化学习教师 | BytedTsinghua-SIA/Open-MOPD-SmolLM3-3B-RL-Code |
| IF RL 教师 | 指令遵循领域强化学习教师 | BytedTsinghua-SIA/Open-MOPD-SmolLM3-3B-RL-IF |
| 最终学生 | Open-MOPD 蒸馏结果 | BytedTsinghua-SIA/Open-MOPD-SmolLM3-3B-Final |
数据集:BytedTsinghua-SIA/Open-MOPD-Data(训练提示混合 + 评测数据)
预览训练命令(不执行)
bash scripts/local/mt_opd.sh \
--model /path/to/mixsft \
--teacher /path/to/math-teacher \
--teacher /path/to/code-teacher \
--teacher /path/to/if-teacher \
--domains math,code,if \
--train /path/to/rl_prompt_mix/train.parquet \
--val /path/to/validation.parquet \
--output /path/to/runs/open-mopd
本地脚本只打印命令,加上 --run 才会真正执行。详细配置见 scripts/local/README.md。
三步 pipeline 概览
Step 1 — 混合领域 SFT(MixSFT) 用混合了数学/代码/指令遵循领域的数据对基座模型做 SFT,为后续 RL 教师提供初始化。这是所有 5 个模型的共同起点。
Step 2 — 独立训练三个 RL 教师 分别在数学、代码、指令遵循领域用 on-policy RL 训练教师模型。三个教师完全独立,没有跨域干扰。
Step 3 — 多教师同策略蒸馏(Multi-Teacher OPD) 核心创新在这里:学生模型同时向三个教师学习,每个 token 根据请求领域路由到对应教师计算 KL 损失。Open-MOPD 在此基础上加入了三种修复机制(见下一节)。
坑与适用边界
三大瓶颈与修复机制
瓶颈一:响应长度差异导致 token 预算失衡
数学/代码的生成长度约 10,500 tokens,而 IF 仅约 409 tokens。若按 prompt 数量均匀采样,IF 只占 20.3% 的 prompt,但实际梯度 tokens 中 IF 仅占 0.99%。这意味着 IF 教师几乎拿不到优化信号。
→ 修复:token-share balancing,在采样阶段对 IF 做过采样(约 33.6×)以匹配梯度 token 预算。
瓶颈二:教师-学生差距收敛速度不同导致预算漂移
三个领域的 RL 收敛速度不同——IF 的教师-学生差距缩小最快,导致其在优化预算中的占比从初始的 48.7% 在 25 步内跌至约 9%。即使做了 token 平衡,有效预算仍然漂移。
→ 修复:gap-aware dynamic budget allocation,实时监测各领域 teacher-student 差距,动态调整采样比例。
瓶颈三:多步 inner PPO 更新导致奖励 stale
将混合领域 rollout batch 分成多个 PPO minibatch 更新时,student 每次更新后 policy 改变,但 frozen teacher 的奖励信号仍然是 rollout 时的旧策略。Rollout-to-current KL 在 K=4 时已达 0.059,K=32 时达 0.216;裁剪 token 比例高达 86%。
→ 修复:student reward refresh,定期用当前 student 策略重新计算奖励信号。
适用边界
- 基座选择:论文以 SmolLM3-3B-Base 为实验平台,3B 以下模型(1.7B)可能面临能力不足导致轨迹截断,7B 以上模型成本显著增加且未经论文测试
- 领域标签:Open-MOPD 假设已知请求所属领域(math/code/IF),即 routing 由外部系统提供;若需要同时做领域识别 + 蒸馏,效果可能下降
- 与 RouteRL/RouteOPD 的关系:论文中的 RouteRL/RouteOPD 是用 oracle 领域标签做路由的参考上限,不是单一可部署模型;Open-MOPD 是单一学生模型,恢复率 83.4% 仍非 100%
- 与 Mix-RL 的区别:Mix-RL 在每个领域需要完整 150-180K 样本预算;MOPD 仅需约 25K(IF)和 30K(SWE),约 6 倍采样效率提升(据 VESSL 博客引用)
一句话结论
Open-MOPD 首次把多教师同策略蒸馏的完整配方开源,揭示了能力集成退化的三大根因(token 预算失衡、差距漂移、奖励 stale),并通过三种针对性机制将综合得分缺口从 3.50 压缩到 0.31 分,是 2026 年后训练多能力融合的必读复现资源。