Beyond the Imitation Game: BIG-bench——把 LLM 的能力与局限画成一张可外推的地图

  • 关联论文:2206.04615
  • 作者:flyP
  • 更新:2026-07-21

一句话结论

BIG-bench 用 204 个任务、横跨模型规模从百万到千亿参数的系统性评测,回答了一个根本问题:语言模型的能力到底能不能随规模"涌现",哪些任务真的会"跳变",哪些只是平缓爬升。结论是:性能与校准都随规模提升,但绝对水平在大多数任务上仍然很差,且可预测性远好于大家以为的"涌现神话"。

解决什么真问题

2021 年 GPT-3 之后,模型规模涨到千亿级,但社区对"模型到底会什么"的判断高度依赖零散的 cherry-picking 案例。SOTA 榜单无法回答:

  • 能力是不是真的随规模涌现(emergent),还是只是评测指标的非线性放大?
  • 模型对自己的答案有多确定(校准)?这在医疗、法律等高风险场景是命门。
  • 在大规模训练算力即将耗尽时,下一步应该把预算花在哪里?

BIG-bench 把"零散观察"变成"可外推的标定实验"——同一套任务、同一套打分、同样的规模阶梯,让任何团队都能拿自己的模型进来对位比较。

核心方法

任务集:204 个任务,覆盖 7 大主题

任务由 132 个机构、450 多位作者贡献,每条任务都标注:覆盖领域(语言学、儿童发展、数学、常识推理、生物学、物理学、社会偏见、软件等)、few-shot 设置、是否有程序化打分器。亮点任务包括:

  • logical_deduction:对象属性的逻辑顺序推理,探测纯符号推理能力。
  • cause_and_effect / formal_fallacies_syllogisms_negation:区分因果与相关、检测逻辑谬误。
  • misconceptions / common_misconceptions:考察对常见科学误解的纠正能力。
  • hhh_alignment / scruples:道德判断与伦理困境,反映 alignment 进展。
  • code_line_description / simple_text_editing:把代码"读"成自然语言。

每条任务都同时提供 多次采样 + 温度=0 贪心 两种评分,方便分析"模型是否自信地反复犯错"。

模型轴:稀疏 vs 稠密,规模阶梯 6 档

参与评测的模型系列横跨 OpenAI GPT、Google 内部 dense Transformer、Switch-style sparse Transformer,规模覆盖百万级到 540B(PaLM 540B 是当时最大公开稠密模型之一)。同一任务在每档模型上都跑同一打分脚本,排除提示词工程差异。

关键分析指标

  1. 性能随规模的对数线性 / 拐点:对每个任务在 N 个模型上画 log(参数量) vs 得分,拟合斜率与可能的拐点。
  2. 校准(calibration):用预测 token 的负对数似然作为置信度,看 Brier score / Expected Calibration Error 随规模如何变化。
  3. 逆规模放大现象(inverse scaling):发现某些任务(如 logical_args、memo trap 类)模型越大反而越差,这是后续 Inverse Scaling Prize 的直接种子。
  4. BIG-bench Lite(BBL):从 204 个任务里挑出 23 个有代表性、可在 5 小时内跑完的子集,作为快速回归基准。

与后续工作的关系

BIG-bench 是 HELM、HOLM、MMLU 这类综合评测的鼻祖之一。它的"任务贡献者众包 + 同一打分脚本"机制后来被 HuggingFace Open LLM Leaderboard、lm-evaluation-harness 沿用。Inverse Scaling Prize 把它发现的"反规模任务"做成独立竞赛,催生了"模型越大越会骗人""越大越阿谀奉承"等一批重要论文。

关键实验与数据

  • 整体趋势:模型规模从 ~10⁶ 到 ~10¹¹ 参数,绝大多数任务上分数单调上升;但即便 540B 的 PaLM,在 204 个任务中位数得分仍远低于人类专家中位线(原文未给出具体百分位差,但指出"人类基线在多数任务上仍有显著优势")。
  • 涌现 vs 平滑:约 5% 任务呈现明显的"门槛式"跳变(emergent),但更多任务在 log-log 尺度上是平滑曲线。所谓"涌现"在很多情况下是离散评分(如精确匹配 0/100)人为制造的假象——换成连续指标后曲线变平缓。
  • 校准:模型越大,Brier score 越好;GPT 系列比同规模 dense 模型校准更优。但即便最佳模型,在 USMLE 类医学问答上仍会出现"自信地说错"的模式。
  • 稀疏 vs 稠密:Switch Transformer(sparse)在大体量下与同等 FLOPs 的 dense 模型持平甚至略优,验证了稀疏激活在大规模下的工程可行性。
  • 逆规模任务:logical_args(构造逻辑论证)、memo trap(短时记忆混淆)上,模型越大反而分数越低;这一类任务后来成为分析"对齐税"和"模式坍缩"的标准测试床。

亮点与局限

亮点

  • 真正"社区共建"的评测范式:450+ 作者贡献任务,避免单一团队的盲点。
  • 规模阶梯覆盖完整,从百万到千亿,任何团队都能在自家小模型上复现大模型趋势线。
  • 同时报告性能和校准,这对落地部署至关重要——很多榜单只看准确率,忽视置信度。
  • 主动暴露"涌现神话"的可视化错觉,把"模型什么时候真的会做这件事"讲清楚。

局限

  • 评分以英文为主,多语言覆盖弱;后续需要翻译或专门构建非英语子集。
  • 部分任务标注质量参差,贡献者众包带来噪声。
  • 评测对象以 2022 年时点的模型为主,GPT-4、Claude、Gemini 等后续闭源模型未在主报告中系统纳入。
  • 没有持续维护机制,任务本身会随时间被"训穿"(模型在预训练里见过测试集),后续需要动态化(参考后来的 BIG-bench Hard、LIVE Bench)。

对工程落地的启发

  1. 别只盯 SOTA 分数:上线一个 LLM 应用前,先用 BB-lite 这种小集合跑一遍校准。如果模型置信度低,再高的 top-1 准确率都别上生产。
  2. 关注逆规模任务:如果你做的是多轮 Agent、长期记忆、复杂工具调用,要警惕"模型越大越抓不住关键变量"的反向陷阱,逻辑链长了反而崩。
  3. 用稀疏激活换性价比:当你有大量长尾请求、想压推理成本时,Switch-style 稀疏激活在 BIG-bench 上的实验结论支持你做 MoE 改造。
  4. 评测要可外推:自建评测时学 BIG-bench 的做法——固定打分脚本、固定 few-shot 设置、固定规模阶梯,让一年后回头看时还能纵向对比。

与同方向工作的关系

  • GPT-3 / PaLM / Gopher 等单模型报告:这些是 BIG-bench 的"被测对象"。BIG-bench 把它们放在同一坐标系里横向比较。
  • HELM(Holistic Evaluation of Language Models, 2022):继承 BIG-bench 的"多指标"思路,但更聚焦 7 类核心场景,牺牲广度换深度。
  • MMLU(2021):57 学科多项选择题,评测知识广度,与 BIG-bench 的"任务广度"互补。
  • Inverse Scaling Prize(2022–2023):直接用 BIG-bench 发现的反规模任务做种子赛,发现了"越大越阿谀""越大越奉承"等重要现象。
  • lm-evaluation-harness / Open LLM Leaderboard:开源复现 BIG-bench 的工程化工具链。

适合谁读

  • LLM 评测工程师:想设计可外推、能跨年比较的评测体系。
  • AI 产品经理:要理解"模型到底什么时候真的能用",避免被"涌现"营销话术带偏。
  • Agent / 工具调用方向研究者:关注逆规模任务,理解多步推理的失败模式。
  • AI 政策与安全研究者:校准和 alignment 相关任务是 BIG-bench 的核心资产之一。

不确定处:原文未明确给出"204 个任务中具体多少个呈现真正涌现"这一数字,仅讨论了总体趋势和典型案例;PaLM 540B 与人类基线在各任务上的具体差距需查正文表格。

工程落地与核查(Jay)

事实核查表

核查项 原文表述 核查结论 风险等级
204 个任务 "204 个任务" ✅ BIG-bench 论文原文确认 204 个任务,有公开 task list 可查
132 个机构、450+ 作者 "132 个机构、450 多位作者" ✅ 论文原文确认,部分是贡献任务而非合著作者,人数规模量级正确
约 5% 任务涌现 "约 5% 任务呈现明显的门槛式跳变" ⚠️ 原文用评分量表差异论证"大多数涌现是指标假象",5% 是近似估算而非严格统计,原文未给置信区间 ⚠️ 低
PaLM 540B 中位数低于人类专家 "中位数得分仍远低于人类专家中位线" ✅ 原文结论性表述,但具体数字(差距几分)未在摘要给出;正文有数据
逆规模任务存在 "logical_args、memo trap 类任务模型越大越差" ✅ Inverse Scaling Prize 2022 验证,现象属实;具体任务列表可查原论文
BBL 23 个任务子集 "从 204 个任务里挑出 23 个" ✅ 原文 2022 年 5 月版本确认 BBL = 23 tasks
GPT 系列校准优于同规模 dense "GPT 系列比同规模 dense 模型校准更优" ⚠️ 原文明确定性 GPT-2/3 vs PaLM 对比;GPT-4 校准数据未在原报告系统纳入 ⚠️ 低

⚠️ 存疑处

  • 涌现比例的量化:原文 5% 是近似估算,不是严格统计推断;引用"涌现任务占比"时应注明这是经验性估算而非精确数字。
  • GPT-4 未纳入主报告:BIG-bench 初版论文(2022)截止时 GPT-4 尚未发布;2023 年后续分析有更新,但本稿未区分版本,建议引用时注明截止日期。
  • 任务被"训穿"的速度:原文未量化任务从发布到被模型记忆的时间窗口;生产系统用 BIG-bench 做回归基准时需定期更新题目。

实际系统怎么用

适用场景:

  1. 新模型上线前的 sanity check:用 lm-evaluation-harness 跑 BBL(23 个任务,~5 小时),与 PaLM/GPT 系列历史分数做纵向对比,判断自家模型是否达到预期基线。
  2. 校准监控:在生产系统接入 token-level logprobs,计算 Brier Score / ECE,定期报警低于阈值。
  3. 逆规模任务回归测试:在 Agent / 工具调用 pipeline 上加测 logical_args、memo trap 类任务,监控"模型规模增大但任务分数下降"的反向陷阱。

生产系统关键坑:

  1. lm-evaluation-harness 兼容性:不同版本 API 接口变化;建议 pinned 一个已知 stable 的 commit SHA,2022–2023 年间 major 版本更新多次导致结果不可比。
  2. few-shot 示例污染:BBL 任务 few-shot 示例若与训练数据重叠,会人为拉高分数;需定期换用未见过的 few-shot 示例。
  3. 打分脚本版本:BIG-bench 提供多种评分模式(exact match / fuzzy match / BLEU / human rating),不同打分器结论不可直接对比;跨论文引用时必须确认用的是同一打分器。
  4. 任务去污染:BIG-bench 任务在 2023 年后逐步被主流模型预训练数据覆盖,做回归测试时建议用 BIG-bench Hard(BBH)子集,已知难度更高且更抗污染。
  5. 稀疏模型评测成本:Switch Transformer 等稀疏模型评测需要海量 FLOPs,lm-evaluation-harness 对 sparse MoE 支持有限,部分任务需手动实现分散注意力计算。

典型集成架构

模型上线前 → lm-evaluation-harness (BBL 23 tasks)
                    ├─ 分数 > 基线 → 进入候选
                    └─ 分数 < 基线 or 逆规模任务下跌 → 打回调优

生产运行 → token logprobs 采集 → Brier Score / ECE 计算
                    ├─ ECE > 0.1 → 触发 Temperature Scaling 重新校准
                    └─ ECE < 0.1 → 正常运行

扩展方向

  • BBH(BIG-bench Hard):在 lm-evaluation-harness 中用 --benchmark bbh 调用,是已知最难且去污染最彻底的任务子集,适合作为生产前最终关卡。
  • HELM 集成:HELM 在 BIG-bench 基础上增加了多指标(公平性、鲁棒性、能耗),可作为更全面的评测方案。
  • Inverse Scaling 监控:将 memo trap、logical_args 任务加入 CI/CD pipeline,每次模型更新跑一遍,监控分数走势。