Distilled Reinforcement Learning for LLM Post-training
- 类型:arxiv
- 标识:2607.17247
- 链接:https://arxiv.org/abs/2607.17247
- 主分类:engineering
- 形态:method
- 被引:1
- 被引来源:Semantic Scholar
- S2被引:1
- OpenAlex被引:0
- 影响力被引:0
- TLDR:Extensive experiments show that Distilled RL substantially outperforms standard RL and OPD in terms of both pass@1 and pass@k, and can effectively transfer previously unavailable knowledge from a teacher model to a student model.
- OpenAlex ID:W7169874691
- OpenAlex DOI:10.48550/arxiv.2607.17247
- DOI:10.48550/arxiv.2607.17247
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://doi.org/10.48550/arxiv.2607.17247
- OpenAlex更新:2026-08-24
- 待LLM分类:否
- 标题中文:LLM 后训练的蒸馏强化学习
- TLDR中文:大量实验表明,Distilled RL 在 pass@1 和 pass@k 上均显著优于标准 RL 和 OPD,并能将教师模型中此前无法获得的知识有效迁移至学生模型。
- 来源文件:
- /inbox/tom/_candidates/2026-07-21-agent-rag-longcontext-candidates.json
- [S2 enrich]
- [OpenAlex backfill]