大模型不需要“老师”:RISE 让学生自己照镜子变强

  • 关联论文:2609.05295

如果把大模型训练比作学生做题,传统的强化学习通常只告诉你:这份答案对不对,却不告诉你哪一步应该怎么改。于是模型可能知道“结果错了”,却不知道下一道题该往哪里走。

还有一类训练方法会请一位更强的“老师”,逐个词告诉学生什么答案更可能正确。老师确实教得细,但问题也很现实:老师可能和学生水平差太远,讲解方式不匹配;如果要同时服务很多学生,还要额外部署一套大模型,成本和延迟都不低。

RISE 的核心想法是:老师不一定来自外部。学生刚刚沿着正确方向迈出的那一步,就可以被延伸成一个“未来自己”。

这像什么?学生今天从 60 分进步到 65 分,系统不直接把这个进步吞掉,而是沿着同一方向多看一步,假设一个 70 分的“未来自己”会怎么答题。然后,再让当前学生向这个未来版本学习。

它把训练拆成两种信号:

  • 结果监督先判断这次改变是否值得走,确保方向没有跑偏;
  • 逐词监督再把未来版本的解题方法细致地教回来,让每一步都知道怎么改。

这不是简单地把模型复制一份,也不是让模型凭空产生新知识。RISE 利用的是学生自己的训练轨迹:先做一次强化学习更新,再把这次更新的方向放大,形成一个外推教师。下一轮又用新的学生重新计算,因此形成“递归改进”。

它覆盖数学、STEM、代码和多轮工具使用任务。论文摘要称,RISE 在这些设置上持续超过只使用结果奖励的 RLVR,以及已有的在线自蒸馏方法。最大的工程吸引力是:不需要额外调用一个更强的模型,也不需要把答案直接塞进上下文里,训练可以更贴近学生当前的能力边界。

不过,“照镜子”也会放大镜子里的错误。 如果结果检查器本身有漏洞,模型发现了某种“看起来正确、实际不对”的取巧方式,外推教师可能把这种偏差越放越大。外推系数 β 也不能无限增大,太激进会跑出原本稳定的改进方向,变成发散。论文摘要和当前解读材料没有给出完整的 β 扫描表,因此工程上需要用验证集观察 KL 距离、熵变化和每阶段的分数。

RISE 的意义在于,它把“教师从哪来”这个问题换了一个角度:教师不必是更贵的外部模型,也不必是被偷偷告知答案的开卷模型,而可以是从学生自己最近一次有效进步中长出来的未来版本。强化学习负责指路,外推负责想象下一步,蒸馏负责把这一步学扎实。 这或许会让“AI 自己改进 AI”少一点口号,多一条可检查、可监控的训练路径。

三个标题变体

  1. 数字钩子版:不请更强的老师,RISE 用学生自己的下一步完成训练
  2. 拟人化版:大模型开始“照镜子学习”:RISE 让它从 60 分的自己走到 70 分
  3. 类比版:别再到处找名师了,RISE 让学生从最近一次进步里变出“未来老师”

小红书风格卡片文案(可直接发布)

🪞 大模型开始照镜子学习了!

传统强化学习像批改作业:老师只说“这份答案对/不对”,却不告诉你哪一步应该改。RISE 说:那让学生自己当老师吧。

它的做法很妙:

1️⃣ 学生先做题,用结果奖励判断“这次更新靠不靠谱”
2️⃣ 找出学生最近从 60 分到 65 分的进步方向
3️⃣ 把这个方向再向前延伸,假想一个 70 分的“未来自己”
4️⃣ 让现在的学生逐词向未来版本学习

🔁 每轮重新计算,于是变成递归改进。

也就是说,RLVR 负责指路,外推负责想象下一步,蒸馏负责把每一步学扎实。 不需要额外部署一个更强的大模型,也不用把标准答案直接塞进上下文。

论文称,这种方法在数学、STEM、代码和多轮智能体任务上,都超过了只用结果奖励的 RLVR 和既有自蒸馏方案。

但照镜子也有风险:如果结果检查器被“奖励黑客”骗了,错误方向会被 β 一起放大;β 太大还会让外推发散。工程上必须监控 KL、熵和验证集表现,不能只看训练分数。

一句话:未来的 AI 老师,可能不是更大的模型,而是学生沿着正确进步轨迹长出来的“未来自己”。

RISE #大模型训练 #强化学习 #RLVR #自蒸馏 #AI智能体 #大模型后训练 #arXiv2609.05295 #每天学点AI