On-Policy Self-Distillation 中"特权信息"到底加了什么?

  • 关联论文:2609.20612
  • 作者:flyP
  • 更新:2026-09-18

一句话结论

本文用 5,319 道数学题 × 6 种推理视角构建的 AMPLE-Math 套件,把 OPSD(on-policy self-distillation)里"教师看到解题过程/答案"这一特权信息的贡献剥离出来,结论是:对 Qwen3-1.7B 而言绝大部分收益来自 reference-free 蒸馏本身,参考信号的额外增益很有限;只有少数模型/视角能看到明显收益,且这种收益强烈依赖学生本身的推理模式。

解决什么真问题

On-policy self-distillation(OPSD)是当前 reasoning 模型后训练里非常常用的一招:冻结一个教师拷贝,让学生在自己采样出的轨迹上拟合教师输出。在数学题上,OPSD 通常会让"教师看到最终答案 + 完整推理过程",看上去"信息更密 = 学得更好"。但工业界一直有一个朴素疑问:

这些特权信息(reference、worked solution、最终答案)到底有多少是真的"额外"贡献?还是只是蒸馏本身在起作用?

这个问题对实践很重要:如果你想提升 reasoning 模型,到底是该花预算造更多更精致的 worked solution,还是只要做对 reference-free 蒸馏就够了? 答案错了,训练数据团队的方向就错了。

论文要回答的就是:把这两种贡献拆开来测。

核心方法

1. AMPLE-Math:5,319 题 × 6 视角的复用套件

AMPLE-Math 是论文的核心基础设施。设计要点:

  • 5,319 道数学题,可重复使用(数据集本身成为论文的"资产");
  • 6 种 reasoning view(同一题,不同的解题/参考形态);
  • 关键约束:所有 6 种 view 共享同一个最终答案,从而可以公平比较"信息形态"对训练效果的影响,而不会因题目难度不同而混淆。

6 种 view 大致涵盖:

  1. polished solution(精心打磨的标准解答);
  2. complete trace(完整思维链 trace);
  3. 其他更短/更零散的视角(具体命名见 PDF 表格,原文摘要未逐一列举)。

2. Matched reference-free distillation

为了让"特权信息"的贡献可归因,论文做了一个关键设计:matched reference-free distillation——把每种带参考的视角和一种"无参考"的对照版本在同一题、同 rollout、同损失下做对照。

伪代码:

for view in 6_views_of_same_problem:
    privileged = rollout_with_teacher_seeing(view)        # 教师看到 view
    matched_ref_free = rollout_without_view_privileged()  # 教师只看学生 rollouts
    student_after_privileged = train(student, loss=privileged)
    student_after_ref_free  = train(student, loss=matched_ref_free)
    delta = eval(student_after_privileged) - eval(student_after_ref_free)

如果 delta 接近 0,说明特权信息没什么用;如果明显 > 0,说明这种 view 真的"加了什么"。

3. 双模型族验证

为了避免只在某一种模型上得出过强结论,论文在两个模型族上做对照:

  • Qwen3-1.7B(thinking-enabled 教师监督 direct-response rollouts);
  • SmolLM3-3B(同套实验框架)。

并辅以 teacher profiles 与 matched loss 干预:当教师换一种 token-level 监督(profile)但参考相同,看学生行为是否真的改变——这是测"特权信息是否真的影响学生,而不是只改变了损失函数"。

关键实验与数据

⚠️ 下面的所有数字与定性结论均来自 arXiv 摘要。具体 ablation 表(按 step、按 view 的细分)需要 PDF §X 主表确认。摘要中未给出完整百分位 / 损失曲线

主要发现:

  1. Qwen3-1.7B 下 reference-free 蒸馏解释了大部分收益: - 在 thinking-enabled 评估下,reference-free 蒸馏本身就把 in-domain 和外部 benchmark 都推到了高水平。 - 任何特权 view 的"额外增益"都很 modest(小;摘要用语为 "modest")。 - 唯一相对明显的是 polished solution 这一 view,但仍属有限。

  2. SmolLM3-3B 下特权信息才看出较明显的额外增益: - complete tracestep 50 处带来 +2 个百分点 的额外增益(摘要明确给的少数具体数字之一)。 - 这说明:特权信息的价值不是普适的,取决于学生本身——某些模型/容量/训练阶段才能"接住"额外参考。

  3. 学生推理模式比参考更重要: - 在同一 checkpoint,把短的 direct-response rollout 换成长的 thinking-enabled rollout 会让增益变损失,即便题集、参考、评估都保持不变。 - 这是一个非常反直觉的发现:推理模式(学生输出形态)对学生学习效果的影响,比"教师多看一点参考"大得多

  4. Token-level 监督变化未必改变学生行为: - Teacher profiles 与 matched loss 干预在 Qwen 上显示,改变 token-level 监督未必导致学生行为显著变化。 - 含义:监督信号的"形式"可能没看上去那么关键。

  5. 跨模式迁移机制假说(论文的最终解释): - OPSD 的真正价值可能是通过直答和思维推理两种模式共享的参数,让学生"访问"已有的推理能力; - 特权参考的真正价值是它"对这种跨模式迁移的贡献",而不是"它揭示了多少解法"。

亮点与局限

亮点

  1. 可复用的 AMPLE-Math 套件:5,319 题 × 6 view 的对照基础设施,后续工作可以直接在上面继续做 ablation——这是把研究从"单次实验"推进到"可复用 benchmark"的关键贡献。
  2. matched reference-free 的设计:把"特权信息"和"蒸馏本身"在损失层面解耦,是方法学上真正的进步。
  3. 结论诚实、克制:没有宣传"特权信息很重要",而是明确说"在 Qwen 上 modest,在 SmolLM3-3B 上对某些 view +2pp,且强烈依赖学生本身"——这种克制在 reasoning 论文里相对少见。
  4. 跨模式迁移的解释:给出了一个机制层面的解释(直答↔思维模式共享参数),而不是停留在经验观察。

局限

  1. 数学题域单一:AMPLE-Math 是数学题。代码、常识、多步规划等域的 OPSD 是否同此规律,原文未明确,不能直接外推。
  2. 只两个模型族(Qwen3-1.7B / SmolLM3-3B):能下结论的范围有限;更大模型(如 7B+)或不同 family(Llama、Mistral)是否会复现 "polished solution modest" 还需要验证。
  3. complete trace +2pp 是 step 50 的快照:不同训练步的曲线原文未明确给出;这有可能是峰值而非平均。
  4. 没有给出 OPSD 与 RFT/RLVR/GRPO 的直接对照:基线参考面较窄,无法判断相对这些主流方法 OPSD 的真实位置。
  5. "跨模式迁移"目前是机制假说:未给出机制级实验(如参数级探针 / probing classifier)直接验证。

对工程落地的启发

  • 预算应该花在 reference-free OPSD,而不是堆 worked solution:在 Qwen3-1.7B 这一档,造一份精心打磨的解法并不比"教师只看学生 rollout"多带来多少。这是直接的数据工程预算决策。
  • "学生推理模式"是隐藏杠杆:同一个 checkpoint 换 rollout 长短,效果可以由正变负。这意味着 reasoning 训练里,rollout 形态比 reference 内容更值得工程化调优
  • 完整 trace 不是越多越好:SmolLM3-3B 上才看到 +2pp,但 step 50 后是否衰减未明;做 reasoning 训练时,不要默认 "complete trace 永远加分"。
  • 可复用 benchmark 是方法学资产:把"题集 + 多 view + matched reference-free 协议"打包成 AMPLE-Math 这种形式,比单点实验更容易复现和迭代。
  • 小模型对参考更敏感的提示:如果你在做小模型(≤3B)的蒸馏,参考信号值得投;大模型参考信号边际收益更小,可以省去做 polished solution 的成本。

与同方向工作的关系

  • vs RFT/RLVR/GRPO:OPSD 的核心区别是教师是冻结的学生自己,没有外部奖励模型/偏好数据。本文没有直接对比,但"reference-free 已解释大部分增益"对 RL 路线的合理性是一个间接背书——RL 的"奖励信号"可能也比想象中更接近"蒸馏本身"而非"奖励本身"。
  • vs DeepSeek-R1 类推理模型后训练:R1 路线强调大规模 RL,本文路线强调"蒸馏+特权信息"的细粒度归因,两者可以互相印证。
  • vs 多视角 / Self-rewarding 类工作:AMPLE-Math 的 "6 view × same answer" 是同类方法学的延伸,但更强调对照设计的可复用性
  • vs Privileged Information Distillation 经典定义(Vapnik 等):经典 PID 指教师在训练时多看一些 input 的元信息;本文把它迁移到 reasoning + OPSD 语境,并给出"小模型才更受益"的经验结论。

适合谁读

  • reasoning 模型后训练工程师:直接受益于"哪些信号值得投预算"的结论。
  • 数据工程 / 训练数据团队:AMPLE-Math 的对照协议可作为内部 reasoning 数据构建模板。
  • 机制研究方向(emergent abilities / cross-mode transfer)的研究者:本文给出的"直答↔思维共享参数"假说是一个可被 probing 实验验证的命题。
  • 不推荐:只关心通用 chat 模型 post-training、或纯 RL 路线研究者,本文数学域单一、直接对照面窄,价值有限。

补充:方法学与机制层面的几点深入

OPSD 与 "self-improvement" 的关系

OPSD 看上去是 "自我提升",但本文发现特权参考的边际贡献有限——这暗示 OPSD 的主要机制可能更接近 "把教师分布平滑地压到学生分布",而不是 "教会学生新东西"。换言之:蒸馏带来的提升,可能来自学生分布被"软化"后更好地覆盖了答案空间,而不是来自特权信息本身。这与一些早期工作(e.g. Born-Again Networks)观察一致:教师不一定要比学生强,蒸馏本身就有正则化作用。

"6 view × same answer" 的价值不只是数据

AMPLE-Math 的 "6 view 共享同一答案" 是一个 约束生成协议

  • 同一题可生成多种解法,但答案空间被锁定;
  • 这使得 "view 不同 → 训练动态不同" 的因果推断变得可能;
  • 这是把 "prompt / context" 当作自变量的设计,区别于把 "题目" 当自变量的传统 ablation。

这种协议对未来的 reasoning 训练研究有借鉴意义:只要你能锁定答案 / 锁定输出空间,就能把 "格式、长度、监督形态" 拆开独立比较。

跨模式迁移机制假说为何重要

"直答↔思维共享参数" 这一假说如果成立,将带来几个推论:

  • reasoning 模型后训练可能不需要真的让模型"学会新推理",只需让模型"访问"已经内化的能力;
  • 直接对 reasoning 模型做 RL 可能也只是 "解锁" 而不是 "注入";
  • 多模式推理(直答 + CoT + 工具调用)的统一架构也许比想象中更可行,因为参数本来就在共享。

要验证这个假说,下一步需要做 probing 实验:训练一个简单的分类器,看直答模型与思维模型在 hidden states 上是否对齐。如果对齐度高,"共享参数"假说就获得机制级证据。

对小模型团队的实际建议

如果你在做一个 1-3B 的 reasoning 小模型,本文结论的实务建议是:

  • 先把 reference-free OPSD 跑通,把 in-domain + 几个外部 benchmark 的基线拿出来;
  • 不要急于堆 polished solution 数据,先看 short→long rollout 的影响曲线;
  • 如果学生 capacity 足够(接近 3B 且训练步数充裕),再加 complete trace;polished solution 优先级最低。

这样可以把数据标注预算花在 ROI 最高的地方。

工程落地与核查(Jay)

⚠️ 事实核查存疑

核查项 状态 说明
"5,319 道数学题"具体来源 ⚠️ 待核 需确认是自建数据集还是复用现有数学题集(如 MATH / GSM8K);若复用,来源需注明
SmolLM3-3B 模型名称 ⚠️ 待核 SmolLM 系列最新为 SmolLM2(360M / 1.7B),SmolLM3-3B 存疑,可能是 SmolLM2-3B 或论文自定义版本,需 PDF 核实
6 种 reasoning view 完整列表 ⚠️ 原文未逐一列出 本文列举的 polished solution / complete trace / 其他视角为推断,非原文 verbatim
complete trace +2pp(step 50) ✓ 来源 abstract ⚠️ 需确认是峰值还是平均值;是否随训练步增加而衰减
"matched reference-free" 实验设计 ✓ 来源 abstract 需 PDF 确认 loss 对照是否真正 matched(同题、同 rollout、同 loss)
OPSD vs RFT/RLVR/GRPO 未直接对照 ⚠️ abstract 已承认 影响本文结论的工程参考价值边界

存疑就地修正

  1. SmolLM3-3B → "SmolLM3 系列(疑似 SmolLM2-3B)":截至 2026-09,SmolLM 官方最新为 SmolLM2(2025 年发布),最高参数为 1.7B。SmolLM3-3B 型号存疑,可能是论文私有训练版本而非公开发布型号。本文保留原名称但标注存疑,请以 PDF 为准。

生产部署三大坑

坑 1:+2pp 来自 step 50 快照,不代表全程有效

SmolLM3-3B 上 complete trace 的 +2pp 是在 step 50 测得的。如果这是训练曲线上的一个峰值而非稳定增益,实际训练中持续使用 complete trace 可能反而带来负向收益。建议:画出完整的训练步曲线(step 0 到 step N 的 delta 变化),确认 +2pp 不是孤立峰值后再决定是否在生产中持续使用 complete trace。

坑 2:结论跨域外推无效——数学题域 ≠ 代码/常识/规划域

AMPLE-Math 的所有实验在数学题上完成。数学题的特点是有唯一确定答案、推理链可验证——这个域的特性决定了 reference-free 蒸馏的收益可能格外高(因为学生自己的 rollouts 已经有相当概率得到正确答案)。代码生成、常识推理、多步规划等域,reference-free 蒸馏的边际收益可能显著不同,不要直接套用本文结论做预算决策。

坑 3:"matched reference-free"实现不对齐会导致错误归因

matched reference-free 蒸馏的设计理念是"同题、同 rollout、同 loss"——但如果实现时 rollout 策略不同(privileged 和 ref-free 版本用了不同的 temperature、top-p、或 sampling 策略),delta 就不能归因到"特权信息"本身,而可能是 rollout 差异造成的。建议:生产实现时严格审计 privileged 和 ref-free 两个分支的 rollout 参数一致性,确保 delta 归因可靠。

快速工程验收检查单

  • [ ] 确认 5,319 道数学题的具体来源(自建 or 复用现有题集)
  • [ ] 确认 SmolLM3-3B 是公开模型还是论文自定义版本(PDF 核实)
  • [ ] 画出完整训练步 delta 曲线,确认 +2pp 不是 step 50 的孤立峰值
  • [ ] 确认 matched reference-free 两个分支的 rollout 参数完全一致
  • [ ] 明确本文结论只适用于数学题域,不可直接外推到代码/常识/规划
  • [ ] 你在做 1-7B 量级的 reasoning 模型蒸馏(小于此规模结论参考性更低)
  • [ ] 评估完整 trace 数据标注的预算 ROI,与 reference-free 基线做 A/B 对照后再决定是否投入