SAF-OPD: Stable Advantage Fusion for On-Policy Distillation
- 类型:arxiv
- 标识:2607.29209
- 链接:https://arxiv.org/abs/2607.29209
- 主分类:llm-infra
- 形态:method
- 被引:1
- 被引来源:Semantic Scholar
- S2被引:1
- OpenAlex被引:0
- 影响力被引:0
- TLDR:SA is proposed, a Stable Advantage Fusion framework that avoids entropy collapse and consistently outperforms fixed-coefficient GRPO+OPD fusion, improving the aggregate score by 0.70% across all six model-domain settings while achieving more stable training.
- OpenAlex ID:W7172319842
- OpenAlex DOI:10.48550/arxiv.2607.29209
- DOI:10.48550/arxiv.2607.29209
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://doi.org/10.48550/arxiv.2607.29209
- OpenAlex更新:2026-08-26
- 待LLM分类:否
- 标题中文:SAF-OPD:面向 On-Policy 蒸馏的稳定优势融合
- TLDR中文:提出SA,一种Stable Advantage Fusion框架,避免熵崩塌,在所有六个模型-领域设定上持续优于固定系数的GRPO+OPD融合,聚合得分提升0.70%,训练更稳定。
- 成熟度:research
- 场景:on-policy-distillation、rlvr
- 来源文件:
- /inbox/tom/_candidates/2026-08-03-agent-rag-longcontext-candidates.json
- /inbox/tom/_candidates/2026-08-04-rag-retrieval-reranking-candidates.json
- /inbox/tom/_candidates/2026-08-04-agent-rag-longcontext-candidates.json
- [S2 enrich]
- [OpenAlex backfill]