nick7nlp/Awesome-LLM-On-Policy-Distillation · 上手攻略
- 仓库:nick7nlp/Awesome-LLM-On-Policy-Distillation
- 链接:https://github.com/nick7nlp/Awesome-LLM-On-Policy-Distillation · 配套 Survey arXiv:2604.00626 · OPDHub https://nick7nlp.github.io/OPDHub/
- 分类:学术资源 / 论文清单(Awesome)+ 综述
- 作者:spark
- 更新:2026-08-27
是什么
一个面向 LLM「On-Policy Distillation(OPD,在策略蒸馏)」主题的 curated 论文清单与配套综述生态。仓库本体是持续维护的论文列表与导航站,附带三件产出:
- 一篇 70+ 篇 OPD 论文的 survey(arXiv:2604.00626,V4 / 2026-06-18 发布);
- 一个 OPDHub 静态检索站:按章节、loss、领域、信号源、rollout 频率、学生模型规模、年份多维筛选;
- 一个名为 EasyOPD 的统一训练框架(GitHub
lds-ustc/EasyOPD),覆盖 10+ 方法,一行 YAML 切换,基于 verl。
⚠️ 版本口径:README 顶部 NEWS 区标注的版本号(V4 / V3 / V2 / V1 / arXiv:2604.00626)写于 2026-04 ~ 07;后续是否升到 V5 需查 arXiv 与 OPDHub。下方涉及具体日期均以仓库 README + alphaXiv 元数据为准。
解决什么问题
LLM 后训练从 2024 年起出现一个清晰拐点:带 reasoning / 长 CoT 的模型对「off-policy SFT」越来越不友好——学生只在教师的「完美前缀」上学过,到自己推理时一旦偏离就崩,错误复合得很快。OPD 让学生在自己的状态空间里 rollout,再让 teacher / reward model / verifier 评估,把「imitation」升级成「interactive learning」。
但 OPD 内部的子流派极多:
- 目标函数:固定 KL / 自适应 KL / RL 增强(GRPO / RLOO 等)
- 信号源:白盒 logit / 黑盒 API / 自蒸馏 / 特权信息 / 外部反馈
- 训练稳定性:trust region、teacher 刷新频率、rollout 截断、token-level advantage 重设计
- 应用域:reasoning、agent、safety、MLLM(视觉-语言)、code、tool-use
新人想找一篇「最对路」的论文非常费时。这个仓库把上面四轴做成 taxonomy + 章节导航,再加 Hall of Fame、按背景推荐的阅读顺序、mermaid 演化时间线,做成可入门的路径。
快速安装 / 使用
仓库本身是清单与导航,没有「安装」概念;真正可装的产出物是 EasyOPD 框架:
# 克隆主清单
git clone https://github.com/nick7nlp/Awesome-LLM-On-Policy-Distillation.git
cd Awesome-LLM-On-Policy-Distillation
# 直接看分类即可上手
ls
# README.md(主清单)
# assets/(图例、taxonomy mindmap)
#(后续可能还有 chapters/ 或 sections/,以仓库当前目录为准)
# EasyOPD(实验复现用)
git clone https://github.com/lds-ustc/EasyOPD.git
cd EasyOPD
# 基于 verl 的训练框架,按仓库 README 安装 verl 与依赖后即可运行
⚠️ EasyOPD 强依赖 verl 的特定版本与 GPU 集群环境,不是 pip install 一键。本文不展开 verl 安装路径,建议直接看 EasyOPD 的 README。
核心用法(清单怎么用)
仓库 README 已自带目录与跳转锚。建议按以下顺序读:
- §「Why On-Policy?」——一句话解释 OPD 与传统 SFT 的 exposure bias 差异。
- §「Quick-Start Guide」——按读者背景(PPO 老兵 / SFT 老兵 / RL 新手)给推荐阅读顺序。
- §「Hall of Fame」——按时代列出 must-read 论文,比从头读 200 篇省力。
- §「Taxonomy」——三大主轴:目标函数(§4)、信号源(§5)、训练稳定性(§6)+ 理解(§7)+ 应用(§8)。
- §「Teacher–Student Model Atlas」 + §「Loss-Objective Distribution」——两张表,快速看出哪条主轴上有哪类师生组合。
- OPDHub——做论文检索 / BibTeX 导出。
例:想找「带 reasoning 的小模型怎么蒸馏」:
- 进 OPDHub → 筛 domain = reasoning + signal = white-box + student size ≤ 7B;
- 回 README 看 §5.1 「White-Box Logit Supervision」与 §4.2 「Adaptive Divergence Objectives」两节;
- Hall of Fame 里找「R1-distill 系列 / DeepSeek-R1-Distill / MiniLLM / GKD」;
- 进阶看 §6 的 trust region / teacher refresh 论文。
典型适用场景
- 学术入门:LLM 后训练方向的研究生/工程师,需要 OPD 入门路径与 baseline 论文。
- 工业小模型蒸馏:想把 70B/405B teacher 的能力塞进 7B/13B 学生模型,且有 reasoning 需求。
- 黑盒 teacher 蒸馏:teacher 只能调 API(logit 拿不到)→ 看 §5.2「Black-Box & API-Constrained」与「OmniOPD」「SODA」类方法。
- 跨 tokenizer / 跨架构:teacher 与 student 词表不同 → §5.1 「Breaking the Tokenizer Barrier」「DuDi」类。
- MLLM / 多模态蒸馏:§5.3.1 「Privileged Information」下大量论文(Thinking Without Images、World Models Meet LMs、Visual Spatial Planning)。
- Safety / 对齐:§5.3.1 「Constitutional On-Policy Safe Distillation」、§6.1 「SafeSteer」。
- Agent / Tool-use:§5.3.2 「COMAP」「Be My Tutor」。
坑与注意
⚠️ arXiv ID 与日期口径:README 里出现的论文 ID(如 2606.xxxxx)属于 2026 年编号,与论文实际首发的月份未必一一对应;引用前请用 alphaXiv / arXiv 实际页面核对 v1 / latest 版本日期。
⚠️ survey 版本频繁迭代:V1(2026-04)→ V2(2026-05-12)→ V3(2026-05-18)→ V4(2026-06-18)四个月内四个版本;下游引用务必在 arXiv 页确认当前最新版本号与日期,避免引用了被作者作废的版本。
⚠️ 「On-Policy」≠「同一个 checkpoint 同时做 teacher 和 student」:仓库自 §5.3 起区分「白盒 logit」「黑盒」「自蒸馏」「特权信息」「外部反馈」五种信号源;不要把所有 OPD 等同于「self-distillation」,否则容易在工程里把 teacher 的 ground-truth 漏给学生造成 leakage。
⚠️ 数据隐私 / leakage:§5.3.1 的「Privileged Information」类方法会引入「未来信息 / GT 答案 / 隐藏 crop」,泛化风险高;做评测时要把「hindsight leakage」一类失败模式(参见「Beyond Absolute Imitation」/「When Context Returns」)单列审计。
⚠️ OPD ≠ 解决所有问题:off-policy SFT 在短文本任务(NLU、分类)上仍然稳;不要为用 OPD 而用 OPD。先看 §7.1 成功条件,再决定要不要换路径。
⚠️ EasyOPD 与 verl 的版本耦合:EasyOPD 标榜「one-line YAML」切换 10+ 方法,但底层是 verl;verl 升级到新版本时常需要同步 EasyOPD;写生产训练脚本前先看 EasyOPD 与 verl 的 release note 兼容矩阵。
与同类对比
| 资源 | 定位 | 优点 | 短板 |
|---|---|---|---|
| 本仓库(nick7nlp/Awesome-LLM-On-Policy-Distillation) | OPD 专题清单 + survey + OPDHub + EasyOPD 一体化 | taxonomy 完整,附检索站与可运行框架;最近迭代活跃 | 偏 OPD 主题,与「通用 LLM 蒸馏 / RLHF 综述」有交叠但不全 |
chrisliu298/awesome-on-policy-distillation |
另一份 OPD 清单 | 收录了一些工业向 / 实战经验 | 体量较小,无配套 survey 与训练框架 |
rlhfbook.com 第 12 章(Nathan Lambert) |
RLHF 教科书视角下的合成数据与蒸馏 | 教学体系完整、context 清晰 | OPD 不是主线,更新节奏较慢 |
thinkingmachines.ai/blog/on-policy-distillation(Kevin Lu, 2025-10-27) |
TML 的工程视角 blog | 实操感强、与工业 pipeline 贴近 | 单篇 blog,不是清单;不替代 survey |
hiyouga/LLaMA-Factory |
通用 LLM 训练框架 | 一键 SFT/DPO/PPO | OPD 不是 first-class,需自己写训练 loop |
Hugging Face TRL PPO/GRPO Trainer |
通用 RL 训练器 | 接入 Hugging Face 生态 | on-policy distillation 范式需自行拼装 |
简单说**:OPD 主题要「看完 + 跑通」,本仓库是当前最完整的 single point of entry;要补 RLHF 通用背景去看 rlhfbook,要看工业实践看 Thinking Machines 那篇 blog。
一句话推荐结论
如果研究方向涉及「reasoning 模型的小型化 / 黑盒蒸馏 / 自蒸馏 / MLLM」,这份清单 + survey + OPDHub + EasyOPD 是当前最值得系统跟的入口;非 OPD 主题不必从这里进。