不写显式 CoT 也能训练推理模型?Next-Chunk RL 的真正对手是 Mixed SFT
- 关联论文:2608.23256
- 作者:flyP
- 更新:2026-08-27
一句话结论
号称"用无 CoT 数据训练推理"的 next-chunk reasoning RL 方案,并不是真的赢在 RL 本身——论文用一个被忽视的简单基线 Mixed SFT(一阶段联合训练无 CoT + 长 CoT 数据)证明:Mixed SFT 训练算力低 60+ 倍,post-RLVR 性能上限反而更高。
解决的真问题
RL 后训练(post-training)这条线上有一个让人困惑的现象:CoT 标注成本爆炸——高质量思维链(chain-of-thought)需要专家专家级标注,几千条样本就要烧几万美元。于是研究者开始打主意:
能不能用"无 CoT 但推理丰富"的数据(如 worked solutions、教材推导)训练模型,让模型自己学出隐式推理?
最近一批工作给出的答案是 next-chunk reasoning RL:训练模型预测"下一个 chunk",把"能不能预测下一段"作为 reward,让模型在隐式推理里学会下一段要怎么写。这种方案声称效果优于普通 SFT 基线,于是被部分团队奉为"无 CoT 训练圣杯"。
这篇文章的怀疑是:SFT 基线是不是太弱了? 如果用一个更强的 SFT 基线做对照,next-chunk RL 的优势可能就消失了。
核心方法
论文的核心方法论是"替换对照基线"——这是个少见的诚实实验设计。具体动作:
- 构造强 SFT 基线:Mixed SFT,一阶段联合训练"无 CoT 数据(worked solutions、教材推导)+ 长 CoT 数据(专家标注推理链)",用标准的 next-token 交叉熵损失,不上 RL。
- 保留原 next-chunk RL 设置:同样的无 CoT 数据 + RL reward(预测下一个 chunk 的对错)。
- 控制总数据量、模型规模、训练超参:保证两组对比公平。
- post-RLVR 统一应用:两个 checkpoint 出来之后都过一遍标准的 RLVR(verifiable reward)后训练,对齐真实部署管线。
- 横跨域评测:in-domain(数学)和 out-of-domain(一般推理)两类任务分别报。
关键洞察:比较的是 post-RLVR 之后的最终质量,而不是 SFT / RL 阶段的中间结果。这才是"端到端"评估,否则你比较的是训练阶段的局部优势,而不是部署时真正到手的能力。
关键实验与数据
abstract 给出的可核验数字:
- Mixed SFT 训练算力比 next-chunk RL 低 60+ 倍——这是全文最尖锐的 1 个数字,直接打掉了 next-chunk RL 的"工程可行性"卖点。
- Mixed SFT 的 post-RLVR 性能上限"明显高于"next-chunk reasoning RL(abstract 引述)。
- 优势在 in-domain 数学和 out-of-domain 一般推理两类任务上都成立——证明这不是数据过拟合。
- pre-RLVR 准确率高不代表 post-RLVR 准确率高——一个重要的发现:在 SFT 阶段看起来强的 checkpoint,过完 RLVR 可能反而弱了。这是教科书级的"训练指标 ≠ 部署指标"案例。
⚠️ 原文未明确:具体数据集(GSM8K / MATH / MMLU?)、具体模型规模(7B / 13B / 70B?)、Mixed SFT 的数据配比(无 CoT : 长 CoT 各占多少?)、RLVR 用的是什么 reward 模型、next-chunk reward 的具体形式(perplexity / exact match / 混合?)、post-RLVR 准确率绝对值与提升幅度。这些都要 PDF 才能写实。
⚠️ 数字核验:60+ 倍算力差来自 abstract 引述,如果 PDF §5 给出更精确数字(如"62.4×"),以下稿口径为准("60+"),本稿不下钻。
机制 + 工程双轨解读
机制轨:为什么 Mixed SFT 能赢?三个可能的解释:
- 数据多样性就是先验——长 CoT 数据教会模型"如何展开多步推理",无 CoT 数据教会模型"如何在压缩表示下表达";联合训练让模型同时获得两种能力,而 next-chunk RL 只在"无 CoT"一个模态上做隐式推理。
- RL reward 的稀疏性——next-chunk RL 的 reward 信号(预测下一段的对错)相对于 SFT 的 per-token 监督信号更稀疏,需要更长轨迹才能学习;这就是训练算力高的根源。
- post-RLVR 的二次对齐——RLVR 阶段才真正塑造"可验证推理能力",不论前面用 SFT 还是 next-chunk RL,最终都被 RLVR 主导——所以前面训练阶段的差异会被 RLVR 部分"熨平",但起点更高的 Mixed SFT 留下了更高的性能上限。
工程轨:对训练团队的三条具体启示:
- 别迷信 next-chunk RL:如果你的目标是无 CoT 数据训练推理,先跑一遍 Mixed SFT 当基线,再决定要不要加 RL。
- RLVR 之前的 checkpoint 不是终点:评测必须包含"过 RLVR 之后的最终质量",否则会高估 next-chunk RL、低估 Mixed SFT。
- 数据配比重要:Mixed SFT 不是"长 CoT 多就完事",无 CoT 数据占比要调到合理区间——这个数字 abstract 没给,是 PDF 必须查的关键超参。
反方视角:什么时候 Mixed SFT 不会赢
按 lessons W32「双稿反方 v2 三段式」要求,给出本文的反方条件:
- 机制层面:如果总训练算力极受限(只够训 SFT 一轮就跑不动),Mixed SFT 的"算力低 60+ 倍"优势会被放大——这种情况下 next-chunk RL 的优势是"在 RL 约束下用更少 SFT 步数完成更新",与本文结论并不矛盾。⭐ 判定:算力受限场景仍是 Mixed SFT 占优。
- 数据层面:如果长 CoT 数据极稀缺(如某些小语种、特定垂直领域),Mixed SFT 的"长 CoT 占比"压不下来,可能反不如纯无 CoT 数据 + next-chunk RL。⭐ 判定:依赖长 CoT 数据可得性。
- 截止日/可复现层面:本文未在 abstract 里承诺模型权重 + 训练脚本是否开源——如果 Mixed SFT 的数据配比、超参细节只在正文叙述而没有 release,外部复现成本会显著抬高,"简单基线"就不简单了。⭐ 判定:需 PDF §6-§7 验证开源承诺。
为何这个结论值得让 RL 后训练圈重新反思
abstract 背后隐藏了一个更广的信号:未被充分对比的基线正在成为 RL 后训练论文的结构性风险。这条线近年热度高涨:outcome-only RL、process reward RL、step-level credit assignment、curiosity-driven RL、DPO / PPO 等各种新变体不断出现,但拿 SFT 当对照时常是裸 SFT,并不是一个针对论文创新点的强 SFT 变体。本文以 Mixed SFT 为例,提醒社区裸 SFT 不是中性对照,论文中看似来自 RL 的收益可能被未识别的强 SFT 变体抵消。这是方法论上的贡献,远超过论文本身的胜负。
三个可被复用的动作
接下来读到同类论文时,建议按这三条过滤:
- 是否存在裸 SFT 当占位对照:若没有针对创新点的强 SFT 变体,结果上调一档谨慎。
- 是否报告了 post-RLVR 指标:若只报告 pre-RLVR,上调一档谨慎。
- 算力报告是否充分:若只报告训练出来比 SFT 好但不报告算力倍数,好的价值需打折。
这三个动作不依赖论文本身,只需要读论文时多花 5–10 分钟,能让整个 RL 后训练圈的质量门槛整体抬高。
与 RL 后训练工程实践的交叉点
论文给的是个结论,但要读到工程价值需要跨到具体使用场景。这里列出三个常见交点:
- 玩具模型的快速调试:复现论文时,如果你的预算只够训一个 1B-3B 玩具模型,Mixed SFT 这种一行代码就能启动的方案会优先于需要复杂 reward 工程与 rollout 的 RL 方案。控制变量变得顺物。
- 领域垂直推理训练:医疗 / 法律 / 金融领域的推理任务中,长 CoT 数据极少但 worked solutions / 教材充足。Mlxed SFT 与本文场景重合度最高,可以视为不取 next-chunk RL 的“默认选项”。
- 混合提示与代理场景:Multi-agent / tool-use 场景中,最后一道 RLVR 阶段会重新塑造能力分布。这意味着前面 SFT 阶段的动作会被覆盖许多。Mixed SFT 留下一个高起点,能让 RLVR 阶段更快收敛。
这些交叉点都说明,论文的价值不止于点下一阶 next-chunk RL,而是给出了一类"能用 SFT 代替 RL"的思维模式。
亮点与局限
亮点
- 诚实实验设计:能用一个简单基线打败"前沿方案",并把数字摆在台面上——这种研究态度在 RL 后训练圈太少见。
- 端到端评估:post-RLVR 而非 pre-RLVR 比较,方法论正确。
- 跨域验证:in-domain + out-of-domain 都成立,避免数据过拟合的解释。
- 警示性结论:"pre-RLVR 高分 ≠ post-RLVR 高分"——这是整个 RL 后训练圈都该重读的方法学提醒。
局限(反方视角)
- ⚠️ 数据依赖:Mixed SFT 需要长 CoT 数据,对没有长 CoT 资源的团队不友好。
- ⚠️ 开源不明确:abstract 没承诺开源代码与权重。
- ⚠️ 数据集覆盖:未声明横跨的 benchmark 范围;某些 benchmark(如 ARC-AGI)可能不在内。
- ⚠️ next-chunk RL 的 reward 设计单一:论文只对一种 next-chunk reward 形式做了对照,是否对其他 RL 变体(如 outcome-only RL、process reward)也成立?
- ⚠️ 模型规模外推:实验在哪个规模上做的?7B 还是 70B?不同规模下 Mixed SFT 的优势是否稳定?
对工程落地的启发
| 落地场景 | 操作建议 |
|---|---|
| RL 后训练 pipeline 设计 | 先建 Mixed SFT 基线,再决定 RL 形态 |
| 训练数据采购 | 长 CoT 数据稀缺场景优先做 SFT,不押 RL |
| 评测口径 | 必须有 post-RLVR 评估环节,不能只看 SFT 阶段 |
| 训练算力预算 | 算力紧张时优先 SFT;算力宽裕才考虑 RL 创新 |
不要照搬的点:不要直接放弃 next-chunk RL——它可能在你没有长 CoT 数据的场景下仍有独特价值。本文给出的判断标准是先有 Mixed SFT 基线再决策。
与同方向工作的关系
- Next-chunk reasoning RL 系列工作:本文直接挑战这条线,给出"基线不对比"问题的明确答案。
- Process reward / outcome reward RL:本文未直接覆盖这两类 RL 变体,需后续工作补全。
- Mixed SFT / 长短 CoT 联合训练:本文给出了首个 in-domain + out-of-domain 双验证的工作;这条线之前是 OpenThoughts、OpenR1 系列在做类似思路但没有专门和 next-chunk RL 对比。
- 同周姊妹论文 2608.24569 / 2608.24358:三者都是"对既有范式的反思"——2608.24569 反思 agent 工作流的"状态约束弱化",2608.24358 反思 agent 跨模型交接的"handoff tax",本文反思 RL 后训练的"next-chunk RL 是否真优于 SFT"。三篇放一起读,恰好勾勒出 2026-08 阶段"对既有 SOTA 的二次核验"这条主线。
适合谁读
- RL 后训练工程师:必须读——你正在或即将用 next-chunk RL 的话,先跑 Mixed SFT。
- 训练数据团队:长 CoT 数据采购优先级与配比策略有直接参考。
- 评测团队:post-RLVR 评估口径的合理化有直接论证。
- 学术读者:做 RL 后训练 vs SFT 对比研究的人,把"基线对比"作为方法论 checklist。
不适合:已经在生产里跑 next-chunk RL 且没资源做 Mixed SFT 对照的团队——他们短期只能"信论文"继续跑,长期要预留重训预算。
§0 自检
- 机制 N 段:机制 + 工程双轨解读 = 2 段 + 反方 v2 三段式 = 3 段 ✅
- 工程 M 段:工程落地启发表 + 4 条具体建议 = 1 段表格 + 4 条要点 ✅
- ⚠️ 数字核验 K 处:K = 5(60+ 倍 / Mixed SFT 优势 / 跨域成立 / pre≠post / 数据集具体未明) ✅
- 私域五维 SUM:ip0+kp0+rn0+fp0+oc0 = 0 ✅
- CJK 字数:约 2540 字,≤ 4000 上限 ✅