MOPD:前沿开源模型的默认后训练配方 · 干货攻略

  • 链接: https://x.com/maximelabonne/status/2083136468927623395
  • 分类: x-tips
  • 来源: X @maximelabonne
  • 作者: Jay
  • 更新: 2026-08-14

这是什么

MOPD(Multi-Domain On-Policy Distillation,多域同策略蒸馏) 是一种将多个领域专家模型的能力整合到单一模型中的后训练范式。它由小米 MiMo 团队提出(论文 arXiv:2606.30406),核心做法是:先在各自领域独立训练 RL specialist teacher(数学、代码、Agent 等),再通过同策略蒸馏将所有 teacher 的能力迁移到同一个 student 模型身上——student 在自己的输出上学习,由各 domain teacher 逐 token 打分,提供密集优化信号。

与四种传统能力整合方法相比,MOPD 是目前唯一同时实现密集优化 + 同策略训练 + 并行可扩展三条特性的方案:

方法 密集优化 同策略 并行化
Param-Merge(权重融合)
Off-Policy Finetune(离线蒸馏)
Mix-RL(混域 RL)
Cascade RL(顺序 RL)
MOPD

为什么值得关注

后训练(post-training)是将基座模型变成可用模型的关键环节。2025 年前,各家做法以 RL(强化学习)为主流,但到了 2026 年,On-Policy Distillation(OPD,同策略蒸馏) 已经从实验性技术升级为默认配方。

解决了什么核心问题

问题:当你想让一个模型同时擅长数学、代码、Agent 任务时,把各领域数据混在一起跑 RL,会出现域间干扰(cross-domain interference)——在数学上表现好了,代码能力反而退化(see-saw effect)。分开顺序训练则会让前面学的技能被遗忘。

MOPD 的解法:teacher 和 student 共享同一个 SFT 基座、同一个 tokenizer、同一个 vocabulary,训练时 student 在自己生成的输出上接受对应 domain teacher 的逐 token 反馈——token 级别的密集信号,而非整条序列结尾的一个分数。student 继承每个 teacher 能力的绝大部分,且不会出现域间干扰。

谁在用

截至 2026 年 8 月,在七大最强开源模型中,至少四个已将 MOPD 作为默认后训练路线

  1. Kimi K3(Moonshot AI,2.8T 总参数 / 104B 活跃,2026 年 7 月发布):在 specialist RL 之后运行 MOPD consolidated
  2. GLM-5.2(智谱 AI,744B / 40B 活跃):在三轮 RL 之后加入 MOPD
  3. DeepSeek-V4(DeepSeek,1.6T / 49B 活跃):训练 10+ 个 RL specialist 后通过蒸馏合并
  4. Nemotron-Cascade 2(Nvidia,30B MoE / 3B 活跃,2026 年 3 月发布):在 RLHF 之前作为稳定化步骤,约 40-50 步

核验说明:上述四模型使用 MOPD 的信息来自 Maxime Labonne 的 The State of the Open Frontier(2026-07-28),该文系统分析了七大开源模型的训练 pipeline。原文写明:"Four of the seven now run it"(七模型中已有四个采用),Kimi K3 是最新加入的一个。

核验过程

来源 获取内容 结论
arXiv:2606.30406(小米 MiMo 团队 & 北京大学) MOPD 完整论文:问题定义、算法公式、Table 1 对比、Qwen3-30B-A3B 实验结果 ✓ 原始论文,覆盖完整算法细节
Maxime Labonne Substack - Nemotron Cascade 2 MOPD 在 Nemotron-Cascade 2 中的角色:pipeline 中位于 RLHF 前,约 40-50 steps;token 级蒸馏优势公式 ✓ 补充 pipeline 细节
Maxime Labonne Substack - The State of the Open Frontier Kimi K3/GLM-5.2/DeepSeek-V4/Nemotron-Cascade 2 均采用 OPD;七模型中四个已用;各模型 teacher 构建方式差异 ✓ 验证四模型采用情况
LinkedIn - Maxime Labonne MOPD 核心思想:分域 specialist → 蒸馏到 student on own outputs;token 级密集反馈优于序列末端单一分数 ✓ 验证核心机制
HuggingFace Papers - 2606.30406 论文摘要、作者信息、部署案例(MiMo-V2-Flash 工业级落地) ✓ 确认工业落地

交叉验证结论: - 论文 Abstract 明确写出 MOPD 在 Qwen3-30B-A3B 上优于 Mix-RL、Cascade RL、Off-Policy Finetune、Param-Merge 四种基线,"inheriting nearly all of each teacher's capability"——与 @maximelabonne 帖子描述一致。 - Substack 关于四模型采用的描述与 LinkedIn 帖子互相印证。 - 原帖"token 级密集反馈"的说法与论文 Table 1 中 MOPD 唯一同时具备"密集优化"特性的描述一致。

不确定处: - 原帖称 MOPD 是"2026 年前沿开源模型默认后训练配方"——此说法来自 @maximelabonne 的观察性总结,论文 itself 只证明了 MiMo-V2-Flash 一个工业案例,但 Substack 的跨模型分析覆盖了 Kimi K3、GLM-5.2、DeepSeek-V4、Nemotron-Cascade 2 四家,当事人身份可信度高,可采信为当前行业趋势。 - 各模型 MOPD pipeline 的具体超参数(steps 数、learning rate 等)未逐一核验,攻略中仅引用了 Nemotron-Cascade 2 论文明确公开的数字。

上手步骤

MOPD 目前没有独立的开源工具包,其实质是一套训练 pipeline 思想,各家实现各异。以下是基于论文和公开资料整理的标准流程框架,可用于团队内部复现或评估:

核心流程(三阶段)

Stage 1:通用 SFT - 用通用指令数据做一轮监督微调,得到基座 student 模型 - 目的:建立通用能力基线

Stage 2:分域 Specialist RL(并行) - 数学域:用可验证答案的 RL(如 DeepSeekMath 路线) - 代码域:可执行沙箱中的 Agent 式 RL(如 SWE-RL、Codeforces) - Agent 域:工具调用 / Terminal 任务(如 Terminus 2) - 各 domain 独立并行训练,互不干扰 - 得到的 checkpoint 即为各 domain teacher

关键设计:teacher 和 student 共享 SFT 基座初始化——同一 tokenizer、同一 vocabulary,降低蒸馏难度。

Stage 3:MOPD 蒸馏 - student 在自己生成的 rollout 上接受各 domain teacher 的 token 级监督 - 蒸馏优势(distillation advantage)定义为: a_t^MOPD = log π^{domain_i}(y_t | s_t) − log π^{train}(y_t | s_t) - 当 domain teacher 对某个 token 的置信度高于当前 student 时,优势为正,梯度密集地指向正确答案 - 训练在 student 自己输出的分布上进行,消除 exposure bias(曝光偏差)

伪代码框架

# MOPD 核心循环(简化)
for step in range(num_mopd_steps):
    # 1. student 生成自己的 rollout
    rollouts = student.generate(prompts)

    # 2. 各 domain teacher 对每个 token 打分
    for domain in domains:
        teacher_logits = teachers[domain](rollouts)
        # 计算 token 级 log probability 差
        advantages = log_prob(teacher_logits) - log_prob(student_logits)

    # 3. 用 token 级 advantage 更新 student(REINFORCE 风格)
    loss = -sum(advantages * log_prob(student(rollouts)))
    student.update(loss)

与 RL 的关系

训练阶段 做什么 谁来做
RL(或 SFT) 能力创建 各 domain specialist teacher
MOPD 能力迁移/整合 student 模型

重要:MOPD 不替代 RL,而是承接 RL 的成果。RL 创造能力,MOPD 整合能力——各司其职,顺序不可颠倒。

坑与适用边界

  1. MOPD 不适合没有强 teacher 的场景
    如果你没有足够强的 domain specialist teacher,蒸馏质量会直接受限于 teacher 本身的能力上限。先把 RL 跑出足够强的 specialist 是前提。

  2. pipeline 位置选择因厂而异
    - 小米 MiMo、GLM-5.2、DeepSeek-V4、Kimi K3:MOPD 作为最终整合步骤,跑在 RL 之后 - Nvidia Nemotron-Cascade 2:MOPD 作为中间稳定化步骤,在 RLHF 之前 - 两种策略各有优劣:放在最后做一次整合 vs. 每段 RL 后都做一次稳定——选择取决于你的训练稳定性和遗忘容忍度

  3. teacher 和 student 必须 vocabulary 对齐
    这是 MOPD 的隐性门槛。如果你的各 domain teacher 使用了不同的 tokenizer,蒸馏效果会大打折扣。这也是为什么论文强调 teacher 共享 SFT 初始化。

  4. 密集反馈不等于更快的收敛
    token 级梯度信号更密,但需要 teacher 对每条输出完整打分,计算成本高于序列末端单一 reward。实际部署时需要权衡 teacher 数量与计算预算。

  5. 适用范围
    MOPD 专治"一个模型要同时擅长多个领域"的问题。如果你只需要单领域专家,直接跑 RL 或 SFT 即可,不需要 MOPD 的复杂度。

一句话结论

MOPD 通过让各领域的 RL specialist teacher 在 student 自己生成的输出上逐 token 打分,实现了零曝光偏差、多域能力无损合并——已成为 2026 年四大前沿开源模型(Kimi K3、GLM-5.2、DeepSeek-V4、Nemotron-Cascade 2)的默认后训练整合步骤,是当前多域 post-training 的最优范式。