SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

  • 类型:arxiv
  • 标识:2607.29209
  • 链接:https://arxiv.org/abs/2607.29209
  • 主分类:llm-infra
  • 形态:method
  • 被引:1
  • 被引来源:Semantic Scholar
  • S2被引:1
  • OpenAlex被引:0
  • 影响力被引:0
  • TLDR:SA is proposed, a Stable Advantage Fusion framework that avoids entropy collapse and consistently outperforms fixed-coefficient GRPO+OPD fusion, improving the aggregate score by 0.70% across all six model-domain settings while achieving more stable training.
  • OpenAlex ID:W7172319842
  • OpenAlex DOI:10.48550/arxiv.2607.29209
  • DOI:10.48550/arxiv.2607.29209
  • DOI来源:OpenAlex
  • 开放获取:green
  • 开放获取链接:https://doi.org/10.48550/arxiv.2607.29209
  • OpenAlex更新:2026-08-26
  • 待LLM分类:否
  • 标题中文:SAF-OPD:面向 On-Policy 蒸馏的稳定优势融合
  • TLDR中文:提出SA,一种Stable Advantage Fusion框架,避免熵崩塌,在所有六个模型-领域设定上持续优于固定系数的GRPO+OPD融合,聚合得分提升0.70%,训练更稳定。
  • 成熟度:research
  • 场景:on-policy-distillation、rlvr
  • 来源文件
  • /inbox/tom/_candidates/2026-08-03-agent-rag-longcontext-candidates.json
  • /inbox/tom/_candidates/2026-08-04-rag-retrieval-reranking-candidates.json
  • /inbox/tom/_candidates/2026-08-04-agent-rag-longcontext-candidates.json
  • [S2 enrich]
  • [OpenAlex backfill]