MOPD:前沿开源模型的默认后训练配方 · 干货攻略
- 链接: https://x.com/maximelabonne/status/2083136468927623395
- 分类: x-tips
- 来源: X @maximelabonne
- 作者: Jay
- 更新: 2026-08-14
这是什么
MOPD(Multi-Domain On-Policy Distillation,多域同策略蒸馏) 是一种将多个领域专家模型的能力整合到单一模型中的后训练范式。它由小米 MiMo 团队提出(论文 arXiv:2606.30406),核心做法是:先在各自领域独立训练 RL specialist teacher(数学、代码、Agent 等),再通过同策略蒸馏将所有 teacher 的能力迁移到同一个 student 模型身上——student 在自己的输出上学习,由各 domain teacher 逐 token 打分,提供密集优化信号。
与四种传统能力整合方法相比,MOPD 是目前唯一同时实现密集优化 + 同策略训练 + 并行可扩展三条特性的方案:
| 方法 | 密集优化 | 同策略 | 并行化 |
|---|---|---|---|
| Param-Merge(权重融合) | ✗ | — | ✓ |
| Off-Policy Finetune(离线蒸馏) | ✓ | ✗ | ✓ |
| Mix-RL(混域 RL) | ✗ | ✓ | ✗ |
| Cascade RL(顺序 RL) | ✗ | ✓ | ✗ |
| MOPD | ✓ | ✓ | ✓ |
为什么值得关注
后训练(post-training)是将基座模型变成可用模型的关键环节。2025 年前,各家做法以 RL(强化学习)为主流,但到了 2026 年,On-Policy Distillation(OPD,同策略蒸馏) 已经从实验性技术升级为默认配方。
解决了什么核心问题
问题:当你想让一个模型同时擅长数学、代码、Agent 任务时,把各领域数据混在一起跑 RL,会出现域间干扰(cross-domain interference)——在数学上表现好了,代码能力反而退化(see-saw effect)。分开顺序训练则会让前面学的技能被遗忘。
MOPD 的解法:teacher 和 student 共享同一个 SFT 基座、同一个 tokenizer、同一个 vocabulary,训练时 student 在自己生成的输出上接受对应 domain teacher 的逐 token 反馈——token 级别的密集信号,而非整条序列结尾的一个分数。student 继承每个 teacher 能力的绝大部分,且不会出现域间干扰。
谁在用
截至 2026 年 8 月,在七大最强开源模型中,至少四个已将 MOPD 作为默认后训练路线:
- Kimi K3(Moonshot AI,2.8T 总参数 / 104B 活跃,2026 年 7 月发布):在 specialist RL 之后运行 MOPD consolidated
- GLM-5.2(智谱 AI,744B / 40B 活跃):在三轮 RL 之后加入 MOPD
- DeepSeek-V4(DeepSeek,1.6T / 49B 活跃):训练 10+ 个 RL specialist 后通过蒸馏合并
- Nemotron-Cascade 2(Nvidia,30B MoE / 3B 活跃,2026 年 3 月发布):在 RLHF 之前作为稳定化步骤,约 40-50 步
核验说明:上述四模型使用 MOPD 的信息来自 Maxime Labonne 的 The State of the Open Frontier(2026-07-28),该文系统分析了七大开源模型的训练 pipeline。原文写明:"Four of the seven now run it"(七模型中已有四个采用),Kimi K3 是最新加入的一个。
核验过程
| 来源 | 获取内容 | 结论 |
|---|---|---|
| arXiv:2606.30406(小米 MiMo 团队 & 北京大学) | MOPD 完整论文:问题定义、算法公式、Table 1 对比、Qwen3-30B-A3B 实验结果 | ✓ 原始论文,覆盖完整算法细节 |
| Maxime Labonne Substack - Nemotron Cascade 2 | MOPD 在 Nemotron-Cascade 2 中的角色:pipeline 中位于 RLHF 前,约 40-50 steps;token 级蒸馏优势公式 | ✓ 补充 pipeline 细节 |
| Maxime Labonne Substack - The State of the Open Frontier | Kimi K3/GLM-5.2/DeepSeek-V4/Nemotron-Cascade 2 均采用 OPD;七模型中四个已用;各模型 teacher 构建方式差异 | ✓ 验证四模型采用情况 |
| LinkedIn - Maxime Labonne | MOPD 核心思想:分域 specialist → 蒸馏到 student on own outputs;token 级密集反馈优于序列末端单一分数 | ✓ 验证核心机制 |
| HuggingFace Papers - 2606.30406 | 论文摘要、作者信息、部署案例(MiMo-V2-Flash 工业级落地) | ✓ 确认工业落地 |
交叉验证结论: - 论文 Abstract 明确写出 MOPD 在 Qwen3-30B-A3B 上优于 Mix-RL、Cascade RL、Off-Policy Finetune、Param-Merge 四种基线,"inheriting nearly all of each teacher's capability"——与 @maximelabonne 帖子描述一致。 - Substack 关于四模型采用的描述与 LinkedIn 帖子互相印证。 - 原帖"token 级密集反馈"的说法与论文 Table 1 中 MOPD 唯一同时具备"密集优化"特性的描述一致。
不确定处: - 原帖称 MOPD 是"2026 年前沿开源模型默认后训练配方"——此说法来自 @maximelabonne 的观察性总结,论文 itself 只证明了 MiMo-V2-Flash 一个工业案例,但 Substack 的跨模型分析覆盖了 Kimi K3、GLM-5.2、DeepSeek-V4、Nemotron-Cascade 2 四家,当事人身份可信度高,可采信为当前行业趋势。 - 各模型 MOPD pipeline 的具体超参数(steps 数、learning rate 等)未逐一核验,攻略中仅引用了 Nemotron-Cascade 2 论文明确公开的数字。
上手步骤
MOPD 目前没有独立的开源工具包,其实质是一套训练 pipeline 思想,各家实现各异。以下是基于论文和公开资料整理的标准流程框架,可用于团队内部复现或评估:
核心流程(三阶段)
Stage 1:通用 SFT - 用通用指令数据做一轮监督微调,得到基座 student 模型 - 目的:建立通用能力基线
Stage 2:分域 Specialist RL(并行) - 数学域:用可验证答案的 RL(如 DeepSeekMath 路线) - 代码域:可执行沙箱中的 Agent 式 RL(如 SWE-RL、Codeforces) - Agent 域:工具调用 / Terminal 任务(如 Terminus 2) - 各 domain 独立并行训练,互不干扰 - 得到的 checkpoint 即为各 domain teacher
关键设计:teacher 和 student 共享 SFT 基座初始化——同一 tokenizer、同一 vocabulary,降低蒸馏难度。
Stage 3:MOPD 蒸馏
- student 在自己生成的 rollout 上接受各 domain teacher 的 token 级监督
- 蒸馏优势(distillation advantage)定义为:
a_t^MOPD = log π^{domain_i}(y_t | s_t) − log π^{train}(y_t | s_t)
- 当 domain teacher 对某个 token 的置信度高于当前 student 时,优势为正,梯度密集地指向正确答案
- 训练在 student 自己输出的分布上进行,消除 exposure bias(曝光偏差)
伪代码框架
# MOPD 核心循环(简化)
for step in range(num_mopd_steps):
# 1. student 生成自己的 rollout
rollouts = student.generate(prompts)
# 2. 各 domain teacher 对每个 token 打分
for domain in domains:
teacher_logits = teachers[domain](rollouts)
# 计算 token 级 log probability 差
advantages = log_prob(teacher_logits) - log_prob(student_logits)
# 3. 用 token 级 advantage 更新 student(REINFORCE 风格)
loss = -sum(advantages * log_prob(student(rollouts)))
student.update(loss)
与 RL 的关系
| 训练阶段 | 做什么 | 谁来做 |
|---|---|---|
| RL(或 SFT) | 能力创建 | 各 domain specialist teacher |
| MOPD | 能力迁移/整合 | student 模型 |
重要:MOPD 不替代 RL,而是承接 RL 的成果。RL 创造能力,MOPD 整合能力——各司其职,顺序不可颠倒。
坑与适用边界
-
MOPD 不适合没有强 teacher 的场景
如果你没有足够强的 domain specialist teacher,蒸馏质量会直接受限于 teacher 本身的能力上限。先把 RL 跑出足够强的 specialist 是前提。 -
pipeline 位置选择因厂而异
- 小米 MiMo、GLM-5.2、DeepSeek-V4、Kimi K3:MOPD 作为最终整合步骤,跑在 RL 之后 - Nvidia Nemotron-Cascade 2:MOPD 作为中间稳定化步骤,在 RLHF 之前 - 两种策略各有优劣:放在最后做一次整合 vs. 每段 RL 后都做一次稳定——选择取决于你的训练稳定性和遗忘容忍度 -
teacher 和 student 必须 vocabulary 对齐
这是 MOPD 的隐性门槛。如果你的各 domain teacher 使用了不同的 tokenizer,蒸馏效果会大打折扣。这也是为什么论文强调 teacher 共享 SFT 初始化。 -
密集反馈不等于更快的收敛
token 级梯度信号更密,但需要 teacher 对每条输出完整打分,计算成本高于序列末端单一 reward。实际部署时需要权衡 teacher 数量与计算预算。 -
适用范围
MOPD 专治"一个模型要同时擅长多个领域"的问题。如果你只需要单领域专家,直接跑 RL 或 SFT 即可,不需要 MOPD 的复杂度。
一句话结论
MOPD 通过让各领域的 RL specialist teacher 在 student 自己生成的输出上逐 token 打分,实现了零曝光偏差、多域能力无损合并——已成为 2026 年四大前沿开源模型(Kimi K3、GLM-5.2、DeepSeek-V4、Nemotron-Cascade 2)的默认后训练整合步骤,是当前多域 post-training 的最优范式。