On-Policy Self-Distillation 中"特权信息"到底加了什么?
- 关联论文:2609.20612
- 作者:flyP
- 更新:2026-09-18
一句话结论
本文用 5,319 道数学题 × 6 种推理视角构建的 AMPLE-Math 套件,把 OPSD(on-policy self-distillation)里"教师看到解题过程/答案"这一特权信息的贡献剥离出来,结论是:对 Qwen3-1.7B 而言绝大部分收益来自 reference-free 蒸馏本身,参考信号的额外增益很有限;只有少数模型/视角能看到明显收益,且这种收益强烈依赖学生本身的推理模式。
解决什么真问题
On-policy self-distillation(OPSD)是当前 reasoning 模型后训练里非常常用的一招:冻结一个教师拷贝,让学生在自己采样出的轨迹上拟合教师输出。在数学题上,OPSD 通常会让"教师看到最终答案 + 完整推理过程",看上去"信息更密 = 学得更好"。但工业界一直有一个朴素疑问:
这些特权信息(reference、worked solution、最终答案)到底有多少是真的"额外"贡献?还是只是蒸馏本身在起作用?
这个问题对实践很重要:如果你想提升 reasoning 模型,到底是该花预算造更多更精致的 worked solution,还是只要做对 reference-free 蒸馏就够了? 答案错了,训练数据团队的方向就错了。
论文要回答的就是:把这两种贡献拆开来测。
核心方法
1. AMPLE-Math:5,319 题 × 6 视角的复用套件
AMPLE-Math 是论文的核心基础设施。设计要点:
- 5,319 道数学题,可重复使用(数据集本身成为论文的"资产");
- 6 种 reasoning view(同一题,不同的解题/参考形态);
- 关键约束:所有 6 种 view 共享同一个最终答案,从而可以公平比较"信息形态"对训练效果的影响,而不会因题目难度不同而混淆。
6 种 view 大致涵盖:
- polished solution(精心打磨的标准解答);
- complete trace(完整思维链 trace);
- 其他更短/更零散的视角(具体命名见 PDF 表格,原文摘要未逐一列举)。
2. Matched reference-free distillation
为了让"特权信息"的贡献可归因,论文做了一个关键设计:matched reference-free distillation——把每种带参考的视角和一种"无参考"的对照版本在同一题、同 rollout、同损失下做对照。
伪代码:
for view in 6_views_of_same_problem:
privileged = rollout_with_teacher_seeing(view) # 教师看到 view
matched_ref_free = rollout_without_view_privileged() # 教师只看学生 rollouts
student_after_privileged = train(student, loss=privileged)
student_after_ref_free = train(student, loss=matched_ref_free)
delta = eval(student_after_privileged) - eval(student_after_ref_free)
如果 delta 接近 0,说明特权信息没什么用;如果明显 > 0,说明这种 view 真的"加了什么"。
3. 双模型族验证
为了避免只在某一种模型上得出过强结论,论文在两个模型族上做对照:
- Qwen3-1.7B(thinking-enabled 教师监督 direct-response rollouts);
- SmolLM3-3B(同套实验框架)。
并辅以 teacher profiles 与 matched loss 干预:当教师换一种 token-level 监督(profile)但参考相同,看学生行为是否真的改变——这是测"特权信息是否真的影响学生,而不是只改变了损失函数"。
关键实验与数据
⚠️ 下面的所有数字与定性结论均来自 arXiv 摘要。具体 ablation 表(按 step、按 view 的细分)需要 PDF §X 主表确认。摘要中未给出完整百分位 / 损失曲线。
主要发现:
-
Qwen3-1.7B 下 reference-free 蒸馏解释了大部分收益: - 在 thinking-enabled 评估下,reference-free 蒸馏本身就把 in-domain 和外部 benchmark 都推到了高水平。 - 任何特权 view 的"额外增益"都很 modest(小;摘要用语为 "modest")。 - 唯一相对明显的是 polished solution 这一 view,但仍属有限。
-
SmolLM3-3B 下特权信息才看出较明显的额外增益: - complete trace 在 step 50 处带来 +2 个百分点 的额外增益(摘要明确给的少数具体数字之一)。 - 这说明:特权信息的价值不是普适的,取决于学生本身——某些模型/容量/训练阶段才能"接住"额外参考。
-
学生推理模式比参考更重要: - 在同一 checkpoint,把短的 direct-response rollout 换成长的 thinking-enabled rollout 会让增益变损失,即便题集、参考、评估都保持不变。 - 这是一个非常反直觉的发现:推理模式(学生输出形态)对学生学习效果的影响,比"教师多看一点参考"大得多。
-
Token-level 监督变化未必改变学生行为: - Teacher profiles 与 matched loss 干预在 Qwen 上显示,改变 token-level 监督未必导致学生行为显著变化。 - 含义:监督信号的"形式"可能没看上去那么关键。
-
跨模式迁移机制假说(论文的最终解释): - OPSD 的真正价值可能是通过直答和思维推理两种模式共享的参数,让学生"访问"已有的推理能力; - 特权参考的真正价值是它"对这种跨模式迁移的贡献",而不是"它揭示了多少解法"。
亮点与局限
亮点
- 可复用的 AMPLE-Math 套件:5,319 题 × 6 view 的对照基础设施,后续工作可以直接在上面继续做 ablation——这是把研究从"单次实验"推进到"可复用 benchmark"的关键贡献。
- matched reference-free 的设计:把"特权信息"和"蒸馏本身"在损失层面解耦,是方法学上真正的进步。
- 结论诚实、克制:没有宣传"特权信息很重要",而是明确说"在 Qwen 上 modest,在 SmolLM3-3B 上对某些 view +2pp,且强烈依赖学生本身"——这种克制在 reasoning 论文里相对少见。
- 跨模式迁移的解释:给出了一个机制层面的解释(直答↔思维模式共享参数),而不是停留在经验观察。
局限
- 数学题域单一:AMPLE-Math 是数学题。代码、常识、多步规划等域的 OPSD 是否同此规律,原文未明确,不能直接外推。
- 只两个模型族(Qwen3-1.7B / SmolLM3-3B):能下结论的范围有限;更大模型(如 7B+)或不同 family(Llama、Mistral)是否会复现 "polished solution modest" 还需要验证。
- complete trace +2pp 是 step 50 的快照:不同训练步的曲线原文未明确给出;这有可能是峰值而非平均。
- 没有给出 OPSD 与 RFT/RLVR/GRPO 的直接对照:基线参考面较窄,无法判断相对这些主流方法 OPSD 的真实位置。
- "跨模式迁移"目前是机制假说:未给出机制级实验(如参数级探针 / probing classifier)直接验证。
对工程落地的启发
- 预算应该花在 reference-free OPSD,而不是堆 worked solution:在 Qwen3-1.7B 这一档,造一份精心打磨的解法并不比"教师只看学生 rollout"多带来多少。这是直接的数据工程预算决策。
- "学生推理模式"是隐藏杠杆:同一个 checkpoint 换 rollout 长短,效果可以由正变负。这意味着 reasoning 训练里,rollout 形态比 reference 内容更值得工程化调优。
- 完整 trace 不是越多越好:SmolLM3-3B 上才看到 +2pp,但 step 50 后是否衰减未明;做 reasoning 训练时,不要默认 "complete trace 永远加分"。
- 可复用 benchmark 是方法学资产:把"题集 + 多 view + matched reference-free 协议"打包成 AMPLE-Math 这种形式,比单点实验更容易复现和迭代。
- 小模型对参考更敏感的提示:如果你在做小模型(≤3B)的蒸馏,参考信号值得投;大模型参考信号边际收益更小,可以省去做 polished solution 的成本。
与同方向工作的关系
- vs RFT/RLVR/GRPO:OPSD 的核心区别是教师是冻结的学生自己,没有外部奖励模型/偏好数据。本文没有直接对比,但"reference-free 已解释大部分增益"对 RL 路线的合理性是一个间接背书——RL 的"奖励信号"可能也比想象中更接近"蒸馏本身"而非"奖励本身"。
- vs DeepSeek-R1 类推理模型后训练:R1 路线强调大规模 RL,本文路线强调"蒸馏+特权信息"的细粒度归因,两者可以互相印证。
- vs 多视角 / Self-rewarding 类工作:AMPLE-Math 的 "6 view × same answer" 是同类方法学的延伸,但更强调对照设计的可复用性。
- vs Privileged Information Distillation 经典定义(Vapnik 等):经典 PID 指教师在训练时多看一些 input 的元信息;本文把它迁移到 reasoning + OPSD 语境,并给出"小模型才更受益"的经验结论。
适合谁读
- reasoning 模型后训练工程师:直接受益于"哪些信号值得投预算"的结论。
- 数据工程 / 训练数据团队:AMPLE-Math 的对照协议可作为内部 reasoning 数据构建模板。
- 机制研究方向(emergent abilities / cross-mode transfer)的研究者:本文给出的"直答↔思维共享参数"假说是一个可被 probing 实验验证的命题。
- 不推荐:只关心通用 chat 模型 post-training、或纯 RL 路线研究者,本文数学域单一、直接对照面窄,价值有限。
补充:方法学与机制层面的几点深入
OPSD 与 "self-improvement" 的关系
OPSD 看上去是 "自我提升",但本文发现特权参考的边际贡献有限——这暗示 OPSD 的主要机制可能更接近 "把教师分布平滑地压到学生分布",而不是 "教会学生新东西"。换言之:蒸馏带来的提升,可能来自学生分布被"软化"后更好地覆盖了答案空间,而不是来自特权信息本身。这与一些早期工作(e.g. Born-Again Networks)观察一致:教师不一定要比学生强,蒸馏本身就有正则化作用。
"6 view × same answer" 的价值不只是数据
AMPLE-Math 的 "6 view 共享同一答案" 是一个 约束生成协议:
- 同一题可生成多种解法,但答案空间被锁定;
- 这使得 "view 不同 → 训练动态不同" 的因果推断变得可能;
- 这是把 "prompt / context" 当作自变量的设计,区别于把 "题目" 当自变量的传统 ablation。
这种协议对未来的 reasoning 训练研究有借鉴意义:只要你能锁定答案 / 锁定输出空间,就能把 "格式、长度、监督形态" 拆开独立比较。
跨模式迁移机制假说为何重要
"直答↔思维共享参数" 这一假说如果成立,将带来几个推论:
- reasoning 模型后训练可能不需要真的让模型"学会新推理",只需让模型"访问"已经内化的能力;
- 直接对 reasoning 模型做 RL 可能也只是 "解锁" 而不是 "注入";
- 多模式推理(直答 + CoT + 工具调用)的统一架构也许比想象中更可行,因为参数本来就在共享。
要验证这个假说,下一步需要做 probing 实验:训练一个简单的分类器,看直答模型与思维模型在 hidden states 上是否对齐。如果对齐度高,"共享参数"假说就获得机制级证据。
对小模型团队的实际建议
如果你在做一个 1-3B 的 reasoning 小模型,本文结论的实务建议是:
- 先把 reference-free OPSD 跑通,把 in-domain + 几个外部 benchmark 的基线拿出来;
- 不要急于堆 polished solution 数据,先看 short→long rollout 的影响曲线;
- 如果学生 capacity 足够(接近 3B 且训练步数充裕),再加 complete trace;polished solution 优先级最低。
这样可以把数据标注预算花在 ROI 最高的地方。
工程落地与核查(Jay)
⚠️ 事实核查存疑
| 核查项 | 状态 | 说明 |
|---|---|---|
| "5,319 道数学题"具体来源 | ⚠️ 待核 | 需确认是自建数据集还是复用现有数学题集(如 MATH / GSM8K);若复用,来源需注明 |
| SmolLM3-3B 模型名称 | ⚠️ 待核 | SmolLM 系列最新为 SmolLM2(360M / 1.7B),SmolLM3-3B 存疑,可能是 SmolLM2-3B 或论文自定义版本,需 PDF 核实 |
| 6 种 reasoning view 完整列表 | ⚠️ 原文未逐一列出 | 本文列举的 polished solution / complete trace / 其他视角为推断,非原文 verbatim |
| complete trace +2pp(step 50) | ✓ 来源 abstract | ⚠️ 需确认是峰值还是平均值;是否随训练步增加而衰减 |
| "matched reference-free" 实验设计 | ✓ 来源 abstract | 需 PDF 确认 loss 对照是否真正 matched(同题、同 rollout、同 loss) |
| OPSD vs RFT/RLVR/GRPO 未直接对照 | ⚠️ abstract 已承认 | 影响本文结论的工程参考价值边界 |
存疑就地修正
- SmolLM3-3B → "SmolLM3 系列(疑似 SmolLM2-3B)":截至 2026-09,SmolLM 官方最新为 SmolLM2(2025 年发布),最高参数为 1.7B。SmolLM3-3B 型号存疑,可能是论文私有训练版本而非公开发布型号。本文保留原名称但标注存疑,请以 PDF 为准。
生产部署三大坑
坑 1:+2pp 来自 step 50 快照,不代表全程有效
SmolLM3-3B 上 complete trace 的 +2pp 是在 step 50 测得的。如果这是训练曲线上的一个峰值而非稳定增益,实际训练中持续使用 complete trace 可能反而带来负向收益。建议:画出完整的训练步曲线(step 0 到 step N 的 delta 变化),确认 +2pp 不是孤立峰值后再决定是否在生产中持续使用 complete trace。
坑 2:结论跨域外推无效——数学题域 ≠ 代码/常识/规划域
AMPLE-Math 的所有实验在数学题上完成。数学题的特点是有唯一确定答案、推理链可验证——这个域的特性决定了 reference-free 蒸馏的收益可能格外高(因为学生自己的 rollouts 已经有相当概率得到正确答案)。代码生成、常识推理、多步规划等域,reference-free 蒸馏的边际收益可能显著不同,不要直接套用本文结论做预算决策。
坑 3:"matched reference-free"实现不对齐会导致错误归因
matched reference-free 蒸馏的设计理念是"同题、同 rollout、同 loss"——但如果实现时 rollout 策略不同(privileged 和 ref-free 版本用了不同的 temperature、top-p、或 sampling 策略),delta 就不能归因到"特权信息"本身,而可能是 rollout 差异造成的。建议:生产实现时严格审计 privileged 和 ref-free 两个分支的 rollout 参数一致性,确保 delta 归因可靠。
快速工程验收检查单
- [ ] 确认 5,319 道数学题的具体来源(自建 or 复用现有题集)
- [ ] 确认 SmolLM3-3B 是公开模型还是论文自定义版本(PDF 核实)
- [ ] 画出完整训练步 delta 曲线,确认 +2pp 不是 step 50 的孤立峰值
- [ ] 确认 matched reference-free 两个分支的 rollout 参数完全一致
- [ ] 明确本文结论只适用于数学题域,不可直接外推到代码/常识/规划
- [ ] 你在做 1-7B 量级的 reasoning 模型蒸馏(小于此规模结论参考性更低)
- [ ] 评估完整 trace 数据标注的预算 ROI,与 reference-free 基线做 A/B 对照后再决定是否投入