nick7nlp/Awesome-LLM-On-Policy-Distillation · 上手攻略

是什么

一个面向 LLM「On-Policy Distillation(OPD,在策略蒸馏)」主题的 curated 论文清单与配套综述生态。仓库本体是持续维护的论文列表与导航站,附带三件产出:

  1. 一篇 70+ 篇 OPD 论文的 survey(arXiv:2604.00626,V4 / 2026-06-18 发布);
  2. 一个 OPDHub 静态检索站:按章节、loss、领域、信号源、rollout 频率、学生模型规模、年份多维筛选;
  3. 一个名为 EasyOPD 的统一训练框架(GitHub lds-ustc/EasyOPD),覆盖 10+ 方法,一行 YAML 切换,基于 verl。

⚠️ 版本口径:README 顶部 NEWS 区标注的版本号(V4 / V3 / V2 / V1 / arXiv:2604.00626)写于 2026-04 ~ 07;后续是否升到 V5 需查 arXiv 与 OPDHub。下方涉及具体日期均以仓库 README + alphaXiv 元数据为准。

解决什么问题

LLM 后训练从 2024 年起出现一个清晰拐点:带 reasoning / 长 CoT 的模型对「off-policy SFT」越来越不友好——学生只在教师的「完美前缀」上学过,到自己推理时一旦偏离就崩,错误复合得很快。OPD 让学生在自己的状态空间里 rollout,再让 teacher / reward model / verifier 评估,把「imitation」升级成「interactive learning」。

但 OPD 内部的子流派极多:

  • 目标函数:固定 KL / 自适应 KL / RL 增强(GRPO / RLOO 等)
  • 信号源:白盒 logit / 黑盒 API / 自蒸馏 / 特权信息 / 外部反馈
  • 训练稳定性:trust region、teacher 刷新频率、rollout 截断、token-level advantage 重设计
  • 应用域:reasoning、agent、safety、MLLM(视觉-语言)、code、tool-use

新人想找一篇「最对路」的论文非常费时。这个仓库把上面四轴做成 taxonomy + 章节导航,再加 Hall of Fame、按背景推荐的阅读顺序、mermaid 演化时间线,做成可入门的路径。

快速安装 / 使用

仓库本身是清单与导航,没有「安装」概念;真正可装的产出物是 EasyOPD 框架:

# 克隆主清单
git clone https://github.com/nick7nlp/Awesome-LLM-On-Policy-Distillation.git
cd Awesome-LLM-On-Policy-Distillation

# 直接看分类即可上手
ls
# README.md(主清单)
# assets/(图例、taxonomy mindmap)
#(后续可能还有 chapters/ 或 sections/,以仓库当前目录为准)

# EasyOPD(实验复现用)
git clone https://github.com/lds-ustc/EasyOPD.git
cd EasyOPD
# 基于 verl 的训练框架,按仓库 README 安装 verl 与依赖后即可运行

⚠️ EasyOPD 强依赖 verl 的特定版本与 GPU 集群环境,不是 pip install 一键。本文不展开 verl 安装路径,建议直接看 EasyOPD 的 README。

核心用法(清单怎么用)

仓库 README 已自带目录与跳转锚。建议按以下顺序读:

  1. §「Why On-Policy?」——一句话解释 OPD 与传统 SFT 的 exposure bias 差异。
  2. §「Quick-Start Guide」——按读者背景(PPO 老兵 / SFT 老兵 / RL 新手)给推荐阅读顺序。
  3. §「Hall of Fame」——按时代列出 must-read 论文,比从头读 200 篇省力。
  4. §「Taxonomy」——三大主轴:目标函数(§4)、信号源(§5)、训练稳定性(§6)+ 理解(§7)+ 应用(§8)。
  5. §「Teacher–Student Model Atlas」 + §「Loss-Objective Distribution」——两张表,快速看出哪条主轴上有哪类师生组合。
  6. OPDHub——做论文检索 / BibTeX 导出。

例:想找「带 reasoning 的小模型怎么蒸馏」:

  • 进 OPDHub → 筛 domain = reasoning + signal = white-box + student size ≤ 7B;
  • 回 README 看 §5.1 「White-Box Logit Supervision」与 §4.2 「Adaptive Divergence Objectives」两节;
  • Hall of Fame 里找「R1-distill 系列 / DeepSeek-R1-Distill / MiniLLM / GKD」;
  • 进阶看 §6 的 trust region / teacher refresh 论文。

典型适用场景

  1. 学术入门:LLM 后训练方向的研究生/工程师,需要 OPD 入门路径与 baseline 论文。
  2. 工业小模型蒸馏:想把 70B/405B teacher 的能力塞进 7B/13B 学生模型,且有 reasoning 需求。
  3. 黑盒 teacher 蒸馏:teacher 只能调 API(logit 拿不到)→ 看 §5.2「Black-Box & API-Constrained」与「OmniOPD」「SODA」类方法。
  4. 跨 tokenizer / 跨架构:teacher 与 student 词表不同 → §5.1 「Breaking the Tokenizer Barrier」「DuDi」类。
  5. MLLM / 多模态蒸馏:§5.3.1 「Privileged Information」下大量论文(Thinking Without Images、World Models Meet LMs、Visual Spatial Planning)。
  6. Safety / 对齐:§5.3.1 「Constitutional On-Policy Safe Distillation」、§6.1 「SafeSteer」。
  7. Agent / Tool-use:§5.3.2 「COMAP」「Be My Tutor」。

坑与注意

⚠️ arXiv ID 与日期口径:README 里出现的论文 ID(如 2606.xxxxx)属于 2026 年编号,与论文实际首发的月份未必一一对应;引用前请用 alphaXiv / arXiv 实际页面核对 v1 / latest 版本日期。

⚠️ survey 版本频繁迭代:V1(2026-04)→ V2(2026-05-12)→ V3(2026-05-18)→ V4(2026-06-18)四个月内四个版本;下游引用务必在 arXiv 页确认当前最新版本号与日期,避免引用了被作者作废的版本。

⚠️ 「On-Policy」≠「同一个 checkpoint 同时做 teacher 和 student」:仓库自 §5.3 起区分「白盒 logit」「黑盒」「自蒸馏」「特权信息」「外部反馈」五种信号源;不要把所有 OPD 等同于「self-distillation」,否则容易在工程里把 teacher 的 ground-truth 漏给学生造成 leakage。

⚠️ 数据隐私 / leakage:§5.3.1 的「Privileged Information」类方法会引入「未来信息 / GT 答案 / 隐藏 crop」,泛化风险高;做评测时要把「hindsight leakage」一类失败模式(参见「Beyond Absolute Imitation」/「When Context Returns」)单列审计。

⚠️ OPD ≠ 解决所有问题:off-policy SFT 在短文本任务(NLU、分类)上仍然稳;不要为用 OPD 而用 OPD。先看 §7.1 成功条件,再决定要不要换路径。

⚠️ EasyOPD 与 verl 的版本耦合:EasyOPD 标榜「one-line YAML」切换 10+ 方法,但底层是 verl;verl 升级到新版本时常需要同步 EasyOPD;写生产训练脚本前先看 EasyOPD 与 verl 的 release note 兼容矩阵。

与同类对比

资源 定位 优点 短板
本仓库(nick7nlp/Awesome-LLM-On-Policy-Distillation) OPD 专题清单 + survey + OPDHub + EasyOPD 一体化 taxonomy 完整,附检索站与可运行框架;最近迭代活跃 偏 OPD 主题,与「通用 LLM 蒸馏 / RLHF 综述」有交叠但不全
chrisliu298/awesome-on-policy-distillation 另一份 OPD 清单 收录了一些工业向 / 实战经验 体量较小,无配套 survey 与训练框架
rlhfbook.com 第 12 章(Nathan Lambert) RLHF 教科书视角下的合成数据与蒸馏 教学体系完整、context 清晰 OPD 不是主线,更新节奏较慢
thinkingmachines.ai/blog/on-policy-distillation(Kevin Lu, 2025-10-27) TML 的工程视角 blog 实操感强、与工业 pipeline 贴近 单篇 blog,不是清单;不替代 survey
hiyouga/LLaMA-Factory 通用 LLM 训练框架 一键 SFT/DPO/PPO OPD 不是 first-class,需自己写训练 loop
Hugging Face TRL PPO/GRPO Trainer 通用 RL 训练器 接入 Hugging Face 生态 on-policy distillation 范式需自行拼装

简单说**:OPD 主题要「看完 + 跑通」,本仓库是当前最完整的 single point of entry;要补 RLHF 通用背景去看 rlhfbook,要看工业实践看 Thinking Machines 那篇 blog。

一句话推荐结论

如果研究方向涉及「reasoning 模型的小型化 / 黑盒蒸馏 / 自蒸馏 / MLLM」,这份清单 + survey + OPDHub + EasyOPD 是当前最值得系统跟的入口;非 OPD 主题不必从这里进。