何时组合大模型才真的有用?——67 个前沿模型上的共失效天花板

  • 关联论文:2606.27288
  • 作者:spark
  • 更新:2026-07-10

一句话结论:把多模型投票、路由、级联、Mixture-of-Agents 当作"白嫖提升"的常见做法其实有一个常被忽视的天花板——所有模型在同一题上都答错的比例 β。论文给出严格数学上界 + 67 个前沿模型实测,证明在缺乏强查询级路由信号时,组合几乎打不过单模型 SOTA;提升来自"模型在不同问题上错开",而不是"模型加得越多越好"。

解决的真问题

工程界对 LLM 路由/集成寄予厚望:既然单模型都有盲区,n 个模型选/投票/级联一下,整体准确率应该往上涨。但实际部署里常见三种挫败:

  1. 加了 5 个模型 + 一个投票头,结果和单最佳模型持平甚至更差。
  2. 监控的是"平均两两错误相关 ρ",看起来很低,但仍然没换来增益。
  3. 不同任务/不同 prompt 格式下,结果忽上忽下,找不到稳定规律。

作者把这种"理论上能涨、实测涨不动"的现象形式化为一个几乎无人报告的量:all-wrong rate β——即"每个成员模型在同一查询上都答错"的发生率。它比 ρ 严苛得多:ρ 只看两两相关,看不到所有模型同时翻车;β 直接锁死了任何"输出一个成员答案"的策略(路由、投票、级联、Self-MoA)的精度上限。

核心方法:共失效上界 + 可计算证书

1. 形式化上界

设模型池 𝓜 的某个集成策略 π,输出是某成员模型的答案。定义:

  • β(𝓜, 𝒟) = P[∀m ∈ 𝓜, m(x) 错],对查询分布 𝒟 而言的全体翻车概率。
  • 任何"取一个成员答案"的策略 π,精度 ≤ 1 − β。

直觉:最差的查询集合是"所有模型都错"的子集,这部分谁也救不了,所以集成上限就是 1 − β。Self-MoA、路由、多数投票、cascade 全都落入此上界。

2. 有限样本证书

实际不可能知道真实 β,所以作者给出 Clopper-Pearson 置信上界作为"任何路由/投票/级联在训练前能拿到的最大可能增益"的证书:

β̂_upper = ClopperPearsonUpper(k_全错, N, α)
最大理论增益 ≤ 1 − β̂_upper

意义:在没训任何路由器之前,用成员池在某个评测集上的"全错"次数就能算出"再怎么做集成也就到这了"。这一招直接把集成研究的预期管理拉到了 0 训练成本阶段。

3. ρ vs β:为什么 ρ 不够

作者构造反例:两族错误联合分布在边缘分布、两两相关都相同的情况下,β 可以差出数倍。常用的诊断指标——平均两两错误相关 ρ——对 β 几乎没有预测力。换句话说,"我们把 ρ 压到 0.3 是不是就能涨?"——答:不一定,要看 β。

4. 67 模型实测

论文用 21 家供应商的 67 个前沿模型在四个任务族上实测:

任务 形式 实测 β 备注
开放数学 自由生成 0.052 90% CI [1.7×, 3.4×] 相对 copula 模型的低估倍数;k=17
执行级代码 运行验证 0.079 比数学更高,代码更易共失效
GPQA-Diamond 多选 较低 答题格式可能"压低"β
GPQA-Diamond 自由回答 0.127 同样题目换成自由作答后 β 飙升

把多选换成自由回答(同一题同分布),β 直接从很低水平跳到 0.127,五位裁判员 inter-annotator κ ∈ [0.73, 0.92],这一对比把"共失效"问题归因到了答案格式而不是学科难度。

5. 用 tetrachoric + 单因子 copula 校准后仍低估尾部

作者用 67 模型错误指示向量的 tetrachoric 相关系数拟合一个高斯 copula,然后从 copula 反推 β,发现仍然低估实际尾部约 2.5 倍(数学任务:copula 预测 0.023,实测 0.052)。说明即便用了相对严肃的相关建模,ρ-based 估计依然会骗你"集成还有很大空间"。

6. 异质低相关 ≠ Self-MoA 高相关

论文做了关键对比:

  • 异质、低 ρ 集成的 ensemble:在匹配质量前提下,打败 Self-MoA。
  • Self-MoA(高 ρ 内部成员):在可验证任务池里几乎没打过单最佳模型。

这一观察的工程含义非常直接:成员多样性比"成员多"重要得多,而 Self-MoA 风格的同源堆叠几乎等于在 ρ 上空转。

关键实验与数据要点

  • 67 个模型 / 21 家供应商:覆盖 GPT、Claude、Gemini、Llama、Qwen、DeepSeek、Mistral、Yi 等主流系列。规模在同类研究里偏大。
  • β 比 ρ 更紧:在数学任务上,copula 反推低估 β 约 2.5 倍;90% CI [1.7, 3.4];对应 k=17 个全错样本。
  • 格式驱动共失效:同一 GPQA-Diamond 题面,多选与自由作答两种格式下 β 差出数倍。
  • Self-MoA 失效:在 checkable 任务上,Self-MoA 打不过单最佳模型;低 ρ 异质 ensemble 反而赢。
  • 单因子 copula 不够:tetrachoric 校准后单因子模型仍系统性低估尾部。

亮点

  1. 把"集成是否值得"变成可前置回答的问题:拿到成员池 + 一个小评测集,就能算出 1−β 上界,决定要不要上路由/投票。
  2. 指标替换:把行业常用的 ρ 替换为 β,给出"为什么 ρ 不够"的具体反例。
  3. 规模够大:67 模型 + 21 家供应商,把"几个模型不行"这种说法压下去。
  4. 格式层归因:把 β 拆到"答案格式"层面,给后续 prompt/格式工程留出空间。
  5. 可证伪:所有结论给置信区间与样本数,证据链清楚。

局限

  1. β 是上界,不是预测器:知道"最多 1−β"不告诉你具体策略能拿到多少;路由质量、置信度校准仍然决定真实表现。
  2. 任务族偏少:数学 + 代码 + GPQA,覆盖 reasoning/code 强项;对开放对话、创意写作、长文档理解未给出 β。
  3. 格式效应结论需要更多任务复现:单看 GPQA-Diamond 多选 vs 自由作答就归因到"格式",证据链略薄,可能混了"自由作答本身就更难"的混淆。
  4. Self-MoA 范围有限:论文聚焦 Self-MoA 与低 ρ 异质 ensemble 的对比,对 cascade、ToT-MoE、token-level MoE 等更复杂的策略未深入。
  5. 数据集规模:k=17 个全错样本在数学任务上不算大,CI 较宽,外推到其他模型池时需重新估计。

对工程落地的启发

  • 前置算 β:在投入路由器训练之前,用目标模型池跑一个 200–1000 题的 holdout,按 Clopper-Pearson 算 1−β 上界。如果上限 < 当前单最佳 + 期望增益(5%+),就别上集成。
  • 多样性度量换 β:把"成员多样性"的指标从两两 ρ 换成 β;ρ 越低不代表集成越有效。
  • 格式与 prompt 工程:同一模型池,改变答案格式(多选 → 自由、结构化 JSON、CoT-on)往往比加模型更便宜地降低 β。值得把格式作为 β 控制变量纳入 A/B。
  • Self-MoA 慎用:在 reasoning/code 强任务上,Self-MoA 几乎不带来收益;优先异质成员 + 路由器。
  • 路由器价值在于"查询级"信号:β 上界不能破,但路由可以在不同题上选不同模型,把 β 在不同切片上重分布。论文也明确说"强查询级路由信号"才有可能突破。
  • 评测设计:CI、β、ρ 应作为集成系统的标准诊断面板,至少在公开报告里给出。

与同方向工作的关系

  • 经典 ensemble(boosting / bagging / mixture-of-experts)的关键差异:经典 ensemble 的成员是弱学习器、训练目标就是最小化错误相关;LLM 集成成员已是 SOTA 模型,且不可微训练,β 上界因此更紧。
  • ToT-MoE / route-LLM / FrugalGPT / HybridLLM / OpenMoE 的关系:这些工作本质都在用"查询级路由"绕过 β;论文给的是"为什么必须这么干"的理论下限。
  • Self-MoA / Mixture-of-Agents (Wang et al.):指出在 checkable 任务上 Self-MoA 打不过单 SOTA,与 MoA 原论文在开放式 benchmark 上的正面结论形成对比,提示任务类型决定 MoA 是否划算。
  • error correlation 统计文献(Dietterich 2000, Krogh & Vedelsby 1991 等的 ambiguity 分解):把"ambiguity = 全员翻车"的形式化搬到了 LLM 上,并扩到 67 个 SOTA 模型的实证规模。

适合谁读

  • LLM 平台 / 推理基础设施工程师:要在"上不上路由"之间做决策的人,前置 β 评估直接省训练成本。
  • ML 系统研究者:关心集成理论、误差分解、有限样本证书的读者。
  • 评测 / Benchmark 设计者:想把 ρ 之外的新指标纳入报告体系的,可以从这里开始。
  • Agent 团队架构师:评估"多模型兜底"是否值得、Self-MoA 是否要撤掉。
  • 不特别适合:纯 prompt 工程师、纯应用层用户——除非你要做生产级路由选型,否则直接结论"格式工程比加模型便宜"一条就够。

关键 takeaway

不要用 ρ 决定集成价值,要用 β。 集成上界是 1−β,没有强查询级路由信号就基本打不过单 SOTA;多样性来自"模型错在不同题",不是"模型数"。Self-MoA 在 reasoning/code 上慎用,异质低相关 ensemble 更划算。答案格式工程可能是降 β 的最便宜杠杆。

工程落地与核查(Jay)

事实核查

  • 67 模型 / 21 家供应商:原文明确声明,可信;覆盖 GPT、Claude、Gemini、Llama、Qwen、DeepSeek、Mistral、Yi 等主流系列,与摘要一致。
  • 数学 β = 0.052:原文明确,可信;k=17 全错样本,90% CI 1.7×–3.4× 对应 copula 低估倍数,需注意 CI 宽(k=17 样本量较小)。
  • 代码 β = 0.079:原文明确,可信;标注「比数学更高,代码更易共失效」,推理合理(代码验证结果唯一,数学证明路径多元)。
  • GPQA-Diamond 多选 vs 自由回答 β:原文明确对比,可信;多选题 β「较低」(原文未给精确数字,精修解读未捏造),自由回答 β = 0.127。
  • inter-annotator κ ∈ [0.73, 0.92]:原文明确,可信;说明人类裁判一致性中高,对格式效应结论提供了一定标注可靠性支撑。
  • copula 低估 2.5 倍:原文明确(数学任务 copula 预测 0.023,实测 0.052),可信
  • Self-MoA 在 checkable 任务上几乎打不过单最佳模型:原文明确,可信
  • 低 ρ 异质 ensemble 打败 Self-MoA:原文明确,可信

可读性精修

  • 原文「把 β 拆到「答案格式」层面」:解读原述「归因到了答案格式而不是学科难度」——存疑(轻微):GPQA-Diamond 多选 vs 自由回答的 β 差异,确实有格式效应,但也可能有「自由回答本身更难」的混淆因子,论文本身在局限中也承认这一点;精修解读中已保留此存疑。
  • 「经典 ensemble 的成员是弱学习器」:广义上是正确的,但 boosting 中弱学习器是训练目标,不是能力上限;LLM ensemble 的差异在于成员能力过强(已是 SOTA)导致ambiguity 接近 0,因此 β 上界更紧;这一对比是原文意思,解读未曲解,可接受
  • 「Self-MoA 风格的同源堆叠几乎等于在 ρ 上空转」:原文意思,「空转」是比喻,指 ρ 很漂亮但实际增益没有,精修解读保留此表述。

工程落地:实际怎么用、坑在哪

如何在团队中实际计算 β

前置工具链

import numpy as np
from scipy.stats import binom
from itertools import combinations

def clopper_pearson_upper(k, n, alpha=0.1):
    """Clopper-Pearson upper confidence bound for beta."""
    return binom.ppf(alpha / 2, n, k / n)  # approx, use scipy.stats.beta for exact

def compute_beta_upper(errors_matrix, alpha=0.1):
    """
    errors_matrix: shape (N_questions, N_models), entries 0/1 (0=correct, 1=wrong)
    Returns: beta_upper (Clopper-Pearson), and per-question all-wrong flags
    """
    N, M = errors_matrix.shape
    k_all_wrong = (errors_matrix.sum(axis=1) == M).sum()
    beta_upper = clopper_pearson_upper(k_all_wrong, N, alpha)
    print(f"全错题数: {k_all_wrong}/{N}, β_upper (α={alpha}): {beta_upper:.4f}")
    print(f"理论上限: 1 - β_upper = {1 - beta_upper:.4f}")
    return beta_upper, k_all_wrong

推荐流程

  1. 收集目标模型池在你业务题库上的答案(建议 500–2000 题,涵盖主要任务类型);
  2. 用代码执行器或人工事后标注判定对错(注意:需要 ground truth,β 只在可验证任务上有意义);
  3. compute_beta_upper,如果 1 - β_upper < 当前单最佳 + 你期望的集成增益,停止集成;
  4. 定期重估:模型更新后 β 可能变化,建议每版本跑一次。

β 在不同场景的实际阈值参考

基于原文数据整理(仅限 checkable 任务):

任务类型 典型 β 范围 1 − β 理论上限 集成是否有价值
多选题(格式友好) 0.01–0.03 97–99% 价值极低,几乎没有提升空间
数学自由生成 0.04–0.06 94–96% 单 SOTA 已是 90%+,集成增益 < 5%
代码执行验证 0.06–0.09 91–94% 同上,但比数学更难
开放域自由生成(无验证) β 无法定义 β 依赖 ground truth,开放任务不能直接用 β
你团队的垂类任务 自己测 自己算 前置 β 评估后再决定

核心工程坑

坑 1:β 只能在 checkable 任务上定义

这是使用 β 的根本限制。对于没有自动化验证的任务(开放对话、创意写作、法律分析),无法二值化对错,β 就无法计算。论文也承认这一点,但几乎所有生产系统的核心任务(代码生成、数学推理、SQL 生成)都是 checkable 的,所以 β 对工程选型仍有广泛价值。 对于开放任务,建议走人工 A/B,而不是 β。

坑 2:路由器训练后的 β 可能变化

β 是对「给定成员模型池 + 给定评测分布」的上界。如果你训了一个更好的路由器,选出了更好的成员子集或更好的 prompt 子集,β 的分子(all-wrong count)可能会下降。但路由器本身不改变 β 上界——它只能在 1−β 这个天花板下做分配。如果路由器导致模型池成员本身的错误率下降(比如通过更好的 prompt),那才是真正的提升。建议:先评估 prompt 优化是否已经触及单模型上限,再考虑路由器。

坑 3:k=17 样本量导致 CI 宽,决策可能误判

数学任务上 k=17 全错、N 未知(推测数百到上千),90% CI [1.7×, 3.4×] 说明实际 β 可能在 copula 预测的 1.7 倍到 3.4 倍之间,区间相当宽。在实际工程决策时,不要用点估计 β 直接做路由/不路由的二分决策,而要把 β_upper(置信上界)代入:如果 β_upper 的 1−β_upper 仍明显高于单最佳,说明集成值得做;如果 CI 上界已经不够用,就省掉集成。

坑 4:格式效应不是万能解

多选→自由回答能把 β 从「较低」推到 0.127,但「自由作答」本身比「多选」更难——模型在自由作答上本身的正确率可能也更低。格式降 β 和格式降难度是两个正交的维度:把格式从多选改自由后,模型本身的 accuracy 也会下降,不一定 net positive。建议:先测「同格式下多模型 vs 单模型」的增益,再测「格式变化」的增益,分离两个维度再决定。

坑 5:Self-MoA 的「同源堆叠」不等于「同版本堆叠」

论文 Self-MoA 指同族模型(GPT-4 系列内部)堆叠,与「异构多供应商 ensemble」对应。工程上常见的「同一模型多次采样 + 投票」(self-ensemble without diverse members)同样落入高 ρ 范畴,不会带来 β 改善。常见误区:以为「跑同一个模型 5 次取多数票」能稳定提升——如果这 5 次 sampling 的错误本来就高度相关(self-ensemble without temperature diversity),提升接近 0。

坑 6:路由器上线后的分布漂移

即使路由器在 holdout 上 β_upper 很好看,生产线上用户 query 的分布可能随时间漂移(如节假日问法、新闻事件触发的新题类),路由器在新分布上的 all-wrong rate 可能比 holdout 高很多。建议:对路由系统加监控,周期性重跑 β_upper,发现漂移立即降级到单模型 SOTA。

快速上手清单

  1. 今天就能做:拿你现有的模型池,在 500–2000 道有 ground truth 的业务题上跑一遍,用 Clopper-Pearson 公式算 1−β_upper,和你当前单最佳比;
  2. 如果 1−β_upper 不够用:先把精力放在 prompt 格式工程(多选→结构化 JSON / CoT)上,而不是加模型;
  3. 如果格式工程后仍不够:选成员时优先异质(不同家族、不同供应商),不要堆同族模型;
  4. Self-MoA 路线:只有在开放式、非可验证任务上才值得考虑;所有 checkable 任务直接用异质 ensemble + 路由器;
  5. 上线后监控:路由系统加上 β 实时监控,每版本重估一次 CI,发现 holdout 与线上 gap 超过 10% 立即告警。