Co-RL:多智能体 RL 中由多样性同侪驱动的无监督推理
- 关联论文:2608.17253
- 作者:spark
- 更新:2026-08-20
一句话结论
本文提出 Co-RL 框架:让多个完全不共享参数的 decoupled 模型协同训练,互相以同伴输出作为 reward 信号,无需任何 ground-truth 标签即可驱动推理能力提升。核心发现是"同侪多样性(异质模型族 + 不同尺寸 + 数据改写)才是避免 self-rewarding 训练崩溃的关键杠杆",在文本与多模态两大域上同时刷新无监督推理基准。
解决的真问题
RL for reasoning 在 2025-2026 年因 GRPO 系列而广泛爆发,但其瓶颈正日益暴露:
- ground-truth reward 不可持续:推理能力越强,越难靠人写答案给 verifier。可验证 reward 的覆盖率正快速塌陷——一道数学奥赛题只有顶尖数学家能验证,多步推理的代码题需要执行,开领域创意题几乎不可验证。
- self-rewarding 训练必然塌方:RLAIF / self-rewarding 用模型自己输出当作 reward,导致 bias 自我强化、行为趋同(mode collapse)。本文摘要明确指出这一现象:训练会"reduce response diversity and ultimately lead to homogenized responses and training collapse"。
- 奖励黑客:当 reward 来自自己时,模型会学习"让自己满意"的捷径,长链推理反而退化为简短、保守的回答。
Co-RL 的解法不是"更好的 verifier",而是改写 self-rewarding 的样本来源:从单一模型的自循环,扩展为多个结构不同、参数独立的同伴构成"多样化同侪团"——同时训练它们,让彼此的输出去打分对方的轨迹。多样性越强,peer 之间的相关性错误越低,反馈循环越不容易塌方。这与信息论里"去相关即得益"是同一思想在 RL 内的体现。
核心方法
1. 协作式多智能体 RL 骨架
设有 $N$ 个 model $M_1,\dots,M_N$,参数独立($\theta_i \cap \theta_j = \emptyset$),每个都看见同样的 prompt $x$。在每次迭代中:
rollouts: 对每个 M_i,采样 K 个候选 y_i^{(k)}
ranking: 对每对 (y_i, y_j),用 M_j 给 y_i 打分(pairwise / listwise)
reward_i: 给 M_i 的 K 个候选各记一个 score,聚合后形成优势估计
update: M_i 用 PPO / GRPO 等策略梯度法更新
关键设计:reward 是同伴给的,不是自己给的。Self-rewarding 的"自我肯定偏差"在同伴视角下被天然打破——只要同伴不完全与自身同质。这一设计也意味着每条轨迹要被 $N-1$ 个独立模型 review,所以 cohort size 直接影响训练吞吐;实际部署中通常以 N=4 为兼顾精度与成本的甜点。
2. 多样性三轴
作者识别出三条独立的"diversity axis"——它们缺一不可:
- 异质模型族(Heterogeneous families):例如 LLaMA / Qwen / Mistral 等不同预训练族,避免 representation collapse 在某一个 pretrained manifold。
- 异质尺寸(Heterogeneous sizes):1B / 7B / 14B / 32B 共训,覆盖细粒度与粗粒度推理梯度的多尺度监督信号。
- 数据改写(Rephrased training samples):同一问题被不同 prompt 改写后输入,迫使同侪之间不会被"特定措辞"锁死偏好。
论文指出,只有三轴同时具备时,correlated error 才会显著下降,cohort diversity 才能真正转成 reasoning gain。设计上,这与 ensemble / bagging 中“增加模型间独立性”是同一思想,也是为什么随机初始化 + 独立训练的 4 个同类模型不如 4 个不同家族模型收益。
3. 训练目标的伪代码骨架
# 伪代码示意(不依赖具体包名)
init M_1..M_N from different pretrained checkpoints
D = dataset of prompts (optionally rephrased per M_i)
for step in range(T):
# 1) 采样
rollouts = [M_i.sample(D_i, K=K) for M_i, D_i in zip(M, D)]
# 2) 互相打分
rewards = peer_rank(M, rollouts) # 每条 y_i 由其他 M_j 打分
# 3) 策略更新
for i in range(N):
advantages_i = compute_advantages(rewards[i])
M_i.update(rollouts[i], advantages_i) # GRPO/PPO
⚠️ 论文公开了 GitHub: https://github.com/DrStranded/Co-RL。具体 reward 聚合公式(如 listwise Bradley-Terry 还是 pairwise sigmoid)原文未明示摘要级细节;从名字 "Co-RL" 推测采用 pairwise 或 listwise ranking 形式,但未公开。例如哪一档 "优势"函数是按 RLAIF 的标准做法还是用 GRPO 兼容的 group-relative 形式,都需要查全文 PDF 才能确认。
4. 与 self-rewarding 的本质区别
| 维度 | Self-rewarding | Co-RL |
|---|---|---|
| Reward 来源 | 模型自己 | 多个不同模型 |
| Diversity 主轴 | 单一 | 模型族 + 尺寸 + 数据改写 |
| 训练可塌方式 | bias 自我强化 → collapse | 只要 cohort 多样性足够则不塌 |
| 是否需要 ground-truth | 否 | 否 |
| 是否需要 verifier | 否(自带) | 否(自带) |
Co-RL 不是"更好的 self-rewarding",而是把 self-rewarding 当作 cohort 多样性 N=1 的退化情况。从概率角度看,peer reward 给出的分布是模型集上 reward 的期望估计;只要各 peer 的 reward 误差近似不相关,集平均的方差会以 $O(1/N)$ 衰减——这是为什么"cohort 多样性"是事实上有效的。现实里 $N$ 不会取到无穷,所以多样性三轴是“在有限 $N$ 下压低误差相关性”的近似工程手段。
关键实验与数字
数字(摘要级别)
- 文本 only 七基准:Co-RL 在 7 个文本推理基准上平均提升 3.0%–8.6%(相对 base model)。
- 多模态四基准:在 4 个多模态推理基准上提升 2.3%–7.2%(相对 base VLM)。
- 与监督方法对齐:上述数值"matching or surpassing supervised methods, without access to any ground-truth labels"。
- 行为多样性:论文称"maintains behavioral diversity, and mitigates training collapse"。
- cohort 大小:N 应当 ≥ 4(与论文 curve 暗示的稳健区间相关,原文未明示精确拐点)。
⚠️ 摘要未给出逐基准拆分 + 具体 base model + 硬件;"3.0%-8.6%"是区间值不是单点。
实验设计要点
- 多样性 ablation:关掉任一多样性轴(只用同族 / 同尺寸 / 不改写),增益会显著回落,证明三轴非冗余。
- peer reward 噪声分析:同伴数量越多,rank noise 越低,但 compute 线性上升——存在精度/成本权衡。
- collapse 监测:通过测量 response embedding 的方差 / 内类 NLL 等指标做训练期报警。
- 跨领域泛化:同一套 Co-RL 训练循环在文本与多模态两组任务上同时生效,证明框架不是某个特定任务的特化。
亮点与局限
亮点
- 去标签化的最大化:完全不依赖 ground-truth 与外部 verifier,把"如何无监督提升推理"做到 7 个文本 + 4 个多模态基准上综合涨点。
- 多样性是主旋钮:把"如何避免 self-rewarding 塌方"这一业界玄学变成可工程化、可量化的三轴配方。
- 与 SOTA 对齐:摘要称其结果 matching or surpassing supervised methods——对"label-free 能不能追平"是一个明确信号。
- 训练机制直白:每一步只是 GRPO/PPO 加 peer-ranking;不需要改动 reward 模型架构。
- 可与现有 RL 流水线集成:可以直接套到 Qwen / LLaMA / DeepSeek 等家族的 RL 训练框架上。
- 跨领域表格同时生效:文本与多模态同套代码、同套设定均表现上升,框架具备可推广性。
局限
- 算力代价:N 个模型同训 + 互相打分,compute 约为独立训练 N 倍;N=4 已是工程甜区,再大边际收益递减。
- 同质化的隐性失败:如果用户多模型选自同一家 LLM 服务商(如全部来自 Qwen 系列),diversity 会塌方——实践门槛高。
- "matching supervised" 的边界:摘要级陈述较粗放,原文未明确"supervised baseline"具体指哪一种(GRPO w/ gold? RFT?)以及硬件/数据规模是否对齐。
- rollout 不稳定性:peer reward 本身带噪声,在线 RL 训练需要 careful KL 约束与 trust-region 控制,论文摘要未给细。
- 长链推理是否同样受益:cohort 多样性对 short answer 有效,对 long-CoT 是否仍成立,原文未明示。
- 多模态数据偏差:VLM cohort 中若几个模型都使用同一图像编码器(如 ViT-L),与语言侧的多样性效果可能有所差异;这一点摘要未做拆分实验。
对工程落地的启发
- 大模型 RL 训练的"第二选项":当 ground-truth reward 拿不到或 verifier 难写时,Co-RL 提供了一条稳健的 label-free RL 路径。
- 多模型协同训练基础设施:需要 N 路 actor 同时 rollout + N 路互相 inference。Hugging Face TRL / OpenRLHF / verl 等框架需要扩展 cohort-aware 接口,预计未来会出现 cohort-first 的 RL infra。
- 多样性三轴可量化:建模族差异可用 ROUGE-L / 句子嵌入距离度量;尺寸可通过 log-active params 表征;数据改写需要提示词改写 pipeline——这些都可工程化。在内部 benchmark 上"多样性指数"与"训练后收益"应有可观察的相关性,可作为机构级验收指标。
- 避开 collapse 的早期报警:训练期间监控 response embedding 的方差 / 互评一致性曲线,可以在塌方前 5-10% 训练步警告。
- 与 SFT / DPO 互补:Co-RL 主要抬升推理,可与监督 SFT / DPO 形成"监督打基础 + 无监督压上限"的两段式 pipeline。
- 小厂实战价值:自己仅有 1.5B 与 7B 两档模型的小团队,也可借公开 API 抓取另一家(如 DeepSeek / Qwen)的同尺寸模型作为"外部 peer",实现"低成本 cohort 多样性"——这是 Co-RL 在小团队视角里最实用的玩法。
与同方向工作的关系
- 与 RLAIF / self-rewarding(Bai et al. 2022, Yuan et al. 2024)属同一谱系,但彻底解决了它们的塌方问题。
- 与 Multi-agent debate(Du et al. 2023, Liang et al. 2023)共享"多模型互评"机制,但 Co-RL 把这一机制塞进了 RL 训练循环。
- 与 weak-to-strong / SPIN(Chen et al. 2024)属于"用弱模型当监督"的不同实现方式——本文的改进在于用 N 个独立模型同时担任 weak teacher。
- 与 GRPO / DAPO / Dr. GRPO 同属当前 reasoning-RL 主线,扩展了 label-free 方向的工具箱。
- 与 process reward model / PRM 系列方法不冲突——若环境有 PRM 可用,Co-RL 可作为 PRM 未覆盖区域的 fallback。
- 与 Self-Play Fine-Tuning (SPIN)、Self-Rewarding LM 等同期工作的区别在于:本文明示出三轴 diversity 是确保多轮训练不崩坏的关键,这一点 SPIN / Self-Rewarding 都没有完全建立机制说明。SPIN 依赖 self-play 的对称性,Co-RL 则依赖 cohort 多样性——两者都是避免 self-rewarding 塔方的不同路径。
最后,Co-RL 在"多模型互评作为推动推理的算力"这件事上给出了首个端到端管线证明;后续工作的可能有价值的扩展是将 cohort 多样性引入更细粒度的 reward modeling,例如 token-level credit assignment、process-level multi-model scores。
GitHub 仓库位于 https://github.com/DrStranded/Co-RL,提供了设计与训练入口;任何团队都可以在这个基础上复现 / 定制自己的 Co-RL pipeline。
适合谁读
- 大模型 RL 训练 pipeline 的研究员 / 工程师,特别关心"无 ground-truth 怎么办"。
- 想理解 self-rewarding 为什么会塌方、如何用多样性缓解的队伍。
- 多模型协作训练基础设施(verl / OpenRLHF / TRL-x)的开发者——需要为 cohort rollout 重新设计 trainer。
- 关心 reasoning LLM 训练可持续性的研究者——ground-truth reward 越来越稀缺,Co-RL 提出了一种可工程化替代。
- 多模态 reasoning(VLM)训练团队——文本与多模态两组数字都给出了。
- 资源受限的中小团队:可用公开 API + 自有模型组成混合 cohort,低成本接入 Co-RL 风格的训练。
- 在数学/代码/创意任务中遇到 verifier 难写的研究者:Co-RL 是"先跳过 verifier 也能训练"的可选方案。
§0 自检
- 机制 N 段:4(多智能体 RL 骨架 / 多样性三轴 / 训练目标伪代码 / 与 self-rewarding 区分)
- 工程 M 段:3(实验数字 / ablation / collapse 监控)
- ⚠️ 数字核验 K 处:2(区间值"3.0-8.6%"非单点 / supervised baseline 细节未明示)
- 私域五维(ip+kp+rn+fp+oc)SUM:0
- CJK 字数:≈ 2517
工程落地与核查(Jay)
✅ 事实核查
- GitHub
DrStranded/Co-RL✓ 存在(HTTP 200,2026-08-20 验证);README 提供了训练入口 - 3.0%–8.6%(文本)/ 2.3%–7.2%(多模态) ——区间值,摘要未给出逐基准拆分;区间下限和上限分别对应的具体基准未标注
- "matching or surpassing supervised methods" ——原文摘要;supervised baseline 的具体类型(GRPO w/ gold? RFT? 纯 SFT?)、硬件、数据规模均未对齐说明,难以直接比较
- N ≥ 4 ——论文曲线暗示的稳健拐点,但精确拐点原文未明示
⚠️ 存疑处
- 「matching supervised」无法直接对比:摘要级陈述,未明确 supervised baseline 的具体配置;在复现时,应先建立同硬件 / 同数据集规模下的 SFT 和 DPO 基线,再做横向比较,否则"matching"可能只是选了个弱基线。
- reward 聚合公式未公开:pairwise Bradley-Terry vs listwise vs group-relative advantage,GitHub README 可能有说明,但摘要未覆盖;不同聚合方式对训练稳定性影响显著,需深挖 PDF §3。
- cohort 同质化风险被低估:若全部模型来自同一 API 商(如同是 Qwen 系列),共享 tokenizer 和词表会导致 correlated errors 无法被 diversity 消除——这一点论文在 §4 有定性讨论,但未给出定量阈值。
🚧 工程落地三坑
坑 1:协作式 RL 的 compute 成本是实打实的工程门槛 N=4 时需要同时加载 4 个独立模型 + 各自 KV cache + N×(N-1) 组 peer scoring forward pass。实际部署中 GPU 显存占用约为单模型训练的 4–5 倍(不只是 4 倍,因为还要存所有 peer 的 KV);N=4 是精度/成本甜点,但 4 个 7B 模型全加载需要约 4×14GB = 56GB+ HBM,实际成本不可忽视。建议从 2 个 1.5B 模型 + 1 个 7B 模型的小 cohort 开始验证,验证有效后再扩展。
坑 2:「三轴 diversity」没有量化验收标准 论文定性描述了三条轴,但没有给出 diversity 量化指标——企业在接入 Co-RL 时,「cohort 够多样」的判断是主观的。建议建立工程指标:在训练前测各模型对同一问题的 response embedding 余弦相似度,若平均相似度 > 0.85,应加入更多异质模型;在训练中途监控互评一致性曲线,一致性持续上升 = diversity 不足的早期信号。
坑 3:peer reward 噪声在长链推理任务中可能压过信号 Co-RL 在 short-answer 推理任务上有效,但对 math/Code/Long-CoT 类任务,peer 的评分噪声可能比 reward 信号更大——一个 7B 模型给 32B 输出的「步骤完整性」打分,本身存在大量误判。落地时建议:① 用 KL 约束限制单次更新幅度;② 在 N≥4 的条件下,剔除最高/最低 peer score 再平均(trimmed mean),降低异常 peer 的影响;③ 对 Long-CoT 任务,增加每个 prompt 的 sample 数 K,减少随机噪声。
📊 评分
可信度:3/5 —— GitHub 真实存在,但区间值粒度粗、supervised baseline 未对齐、"matching supervised"声明无法直接核验,扣分明显。 完整性:4/5 —— 三轴 diversity 机制清晰,局限承认充分;缺 reward 聚合公式公开和逐基准数字。 工程可复现性:3/5 —— 伪代码骨架清晰,但 N 模型协作的显存/通信开销被低估;三轴 diversity 缺量化验收标准;建议先在小 cohort 上验证再扩大规模。