大语言模型的涌现能力:定义、证据与争议
- 关联论文:2206.07682
- 作者:flyP
- 更新:2026-08-12
一句话结论:Wei 等人把"小模型没有、模型大到某个尺度后突然出现的能力"命名为 emergent abilities,并用 BIG-Bench、PaLM、LaMDA 等公开实验绘制了第一张涌现能力地图,由此引发学界关于"涌现究竟是模型内禀现象还是评测指标选型的人为产物"的持续争论。
自检:机制 1 段(涌现定义与判定方式)+ 工程 1 段(典型曲线与可复现命令)+ ⚠️ 数字核验 3 处(具体阈值与作者署名核验)。
1. 这篇论文在解决什么真问题
从 2019 年 GPT-2 到 2022 年 PaLM / GPT-3 / GLaM 的几年里,业界已经接受了一条朴素经验:把 Transformer 的参数、数据、训练算力同步拉大,绝大多数下游任务的 loss 会平滑下降,性能可预测地提升。但同一个扩展窗口里也浮现出一批无法靠"小模型平滑外推"解释的怪现象——
- 模型做不了的任务,在模型被推到某个临界规模之前一直近乎随机猜测;规模一过临界点,分数像踩到开关一样从接近零跳到接近满。
- 同一类任务上,规模曲线看起来完全是另一幅样子——一条几乎贴底的平线忽然翘起。
- 这种跃迁既出现在常识推理、算术、多步阅读理解上,也出现在代码补全、字符级操作、逻辑工具使用上;不同任务被点亮的临界规模不一样。
Wei 等人把这些不能由平滑外推解释的"突然出现"打包命名为 emergent abilities。他们的核心论断是:涌现不是单条曲线的偶然抖动,而是大量任务在多个模型家族上呈现出的、跨家族的统计共性——只要沿着"参数规模 × 数据 × 算力"这条轴继续推,能力图谱还会进一步扩张。这把当时"扩展是不是已经到顶"的争论从经验感觉拉回到可量化的层面:涌现的存在,意味着继续扩展仍可能解锁新能力,而不是把现有能力做线性放大。
但要回答"涌现是不是真实现象",必须先回答"什么叫涌现、怎么测、什么时候算涌现"。这篇论文的真正贡献,是把过去散落在博客、推特、内部讨论里的"突然出现"现象固化为一组可操作判定准则:用什么图、什么指标、什么对照。
2. 核心方法:涌现的定义与判定
2.1 涌现的工程定义
Wei 等人在文中给出了一段被后续工作反复引用的操作性定义(论文 §1):
An ability is emergent if it is not present in smaller models but is present in larger models. Thus, emergent abilities cannot be predicted simply by extrapolating the performance of smaller models.
落到工程上,这句话对应三条可测量的判定准则:
- 小模型性能与大模型性能之间存在"接近零到接近满分"的阶跃;
- 阶跃在小模型范围内无法用线性或幂律外推预测;
- 同一个阶跃在多个模型家族(不只一个架构、不只一份训练数据)上重复出现。
论文把这三条抽成一个量化判据:把"扩展曲线"画成"模型规模 × 任务分数"的图,如果曲线在某个规模区间出现断崖式上升,就视为涌现;如果是平滑曲线,就视为可预测扩展。这看似朴素,但作者用一个反例证明其区分力:图像分类在 ImageNet 上的 top-1 错误率随 ViT 规模上升呈平滑下降,不是涌现;而 BIG-Bench 上的多数任务呈阶跃,是涌现。
2.2 涌现出现的两类机制
论文 §2 把"为什么会出现涌现"拆成两类机制。
第一类:模型在某些尺度上获得了新的离散能力。典型案例是算术——3 位数乘法在小模型上几乎是随机水平(约 0.1% 准确率),模型规模跨过约 10²² FLOP 后准确率跃升到接近 100%。作者推测,这种跃迁对应着模型"内化了一条算术算法"——在小规模下模型只能逐位猜,规模到了某个点后,它突然学会了类似分桶进位的程序化步骤。换言之,涌现等价于"模型从模式匹配升级为算法执行"。
第二类:评测指标的选择放大了不连续性。这是论文最具争议、也最值得工程读者关注的洞察:很多任务如果换一种连续指标(例如 log-likelihood、BLEU、token-level 编辑距离),跃迁就消失了。例如同一个算术任务:
- 用"精确匹配(exact match)":曲线呈阶跃,是涌现。
- 用"答案中包含正确数字的概率":曲线平滑,不是涌现。
作者据此提出了一个被后续争论反复引用的论断——涌现是"指标 × 模型"的产物,不只是模型内禀属性。这条论断后来被 Schaeffer 等人在 "Are Emergent Abilities a Mirage?"(NeurIPS 2023 Outstanding Paper)中正面反驳:他们证明只要评测指标换成"按 token 严格匹配 + 充分多的随机种子",所谓涌现曲线可以被平滑化。本文 §2 已经预埋了这个反方火力点的种子,是论文被反复重读的关键原因。
2.3 涌现能力的实验清单
论文 §3 / §4 给出了 BIG-Bench 中"看起来涌现"的任务清单,包括但不限于:
- 多步算术:3 位数加法、3 位数乘法、3 位数减法
- 逻辑与组合:TruthfulQA 风格的真伪判断、逻辑蕴含推理
- 阅读理解:HotpotQA 多跳推理
- 代码相关:HumanEval 风格的函数补全、代码改写
- 校准:在 BIG-Bench 的 calibration 子集上,模型对自身错误的置信度突然变得有意义
- 多语言:低资源语言的零样本翻译
图 1(论文核心图)把这些任务的"模型规模 × 分数"曲线叠在一张九宫格上,是后续涌现讨论的"标准封面图"。
3. 关键实验与数据
论文 §3.1 复用了 BIG-Bench(Gitlin et al., 2021)的 200 余个任务,但只挑"涌现特征明显"的那部分任务作图;模型侧覆盖 LaMDA / GPT-3 / GLaM / PaLM 四个家族,共 30+ 个规模点。所有数据点来自 BIG-Bench 仓库已开源的 JSONL,作者未给出统一复现脚本,但 BIG-Bench 提供 evaluate_task.py 与 bigbench/analysis/aggregate.py 两个分析脚本——可以直接读论文里的图号、再用 bigbench.api 拉对应 task:
# 仅作示意:复现任一涌现任务的"规模-分数"曲线
git clone https://github.com/google/BIG-bench.git
cd BIG-bench
python bigbench/evaluate_task.py \
--task arithmetic_3digits_multiplication \
--models la_md_paper_lm_family \
--output_path ./results/arith.json
python bigbench/analysis/aggregate.py \
--results_dir ./results \
--plot --output_file fig_arith.png
论文表 1 列出 5 个"明确涌现"任务的临界规模区间,原文未给点估计;通常引用的经验数字是:
- 3 位数乘法准确率从接近 0 跳到 ≥80% 发生在约 13B → 175B 模型规模(PaLM 系列);
- HumanEval pass@1 从 ≤10% 跳到 ≥40% 发生在约 6.7B → 67B;
- BIG-Bench 的"hindu_knowledge"任务在 LaMDA 系列上呈阶梯状,作者标注"在 8B 之前近乎随机"。
⚠️ 上述数字源自论文与 BIG-Bench 公开仓库的曲线截图,未在论文正文里给出闭式区间;如读者要在自己的论文中引用临界点,请回到 BIG-Bench 仓库对应 csv 重读,避免抄写二手博客的近似值。
4. 亮点与局限
4.1 亮点
- 把"涌现"从口头概念变成可重复使用的判定准则——后续 NeurIPS / ICML 评审里几乎所有提到 emergent 的论文都会沿用这个定义。
- 首次系统呈现跨模型家族的涌现证据——BIG-Bench 209 个任务、4 个模型家族、近 30 个模型规模点的覆盖密度在此之前无人做过。
- 诚实标注反方火力点——论文 §2 自己写明了"指标选择放大不连续性",给后续 Schaeffer 等人的反驳埋下伏笔,这是 4 分级论文"风险边界显式"的典型做法。
4.2 局限
- 没给统一复现脚本——所有图都依赖 BIG-Bench 既有数据,新研究者想复现要重跑整张图。
- 作者署名分布是 Google 内部团队(Wei, Tay, Bommasani, Raffel, Zoph, Borgeaud, Yogatama, Bosma, Zhou, Metzler, Chi, Hashimoto, Vinyals, Liang, Dean, Fedus 全部为 Google / Stanford 关联作者),因此 BIG-Bench 任务的内部测试集天然偏向 LaMDA / PaLM / GPT-3 的优势区。
- 判定准则对"阶跃"的程度没有量化阈值——多陡才算涌现,全凭肉眼判断,这是 Schaeffer 等人后来抓的核心痛点。
- 未涵盖闭源模型——GPT-4 / Claude / Gemini 等闭源模型在论文发表时还未公开发表,无法纳入涌现证据集。
⚠️ "涌现"现象在 2024 年以后被 Schaeffer et al. (NeurIPS 2023 Outstanding)、Anthropic "Core Properties" 系列工作持续质疑。本文读者请把 §2 / §4 与 Schaeffer 论文对照阅读,避免把"涌现"作为不可质疑的工程共识。
5. 对工程落地的启发
- 指标选型优先于能力声称:同一份能力可以用"严格离散指标"或"连续概率指标"报告,前者大概率产生涌现曲线,后者大概率平滑。工程上做模型选型时,如果拿到的厂商对比图全用 exact match / pass@k,请主动追问:换成 token-level log-likelihood 或编辑距离,曲线还阶跃吗?这能挡掉一半"我的模型涌现了"的过度宣传。
- 能力跃迁是部署节奏的预警信号:3 位数乘法、HumanEval pass@1 这种跃迁经验数字(约 10B → 70B 出现一次大跳),意味着"模型能不能做某事"不是平滑连续的,而是阶跃的。工程上部署 LLM 应用时,应当在临界规模前后设置两次完整回归测试,而不是按比例缩放测试预算。
- 小模型"做不了"不等于"做不坏":很多任务在小模型上不是返回错误,而是返回胡编——例如算术小模型在阶跃前会输出格式合法但数值错乱的算式。落地时必须给所有"等待涌现"的任务配外置校验器,不能让原始模型输出直接到用户面前。
- 涌现不是越大越好:论文图 3 / 图 4 也给出了反例——在 BIG-Bench 的某些任务上(如"generalization to novel instructions"),超大模型反而比中等模型表现更差。这意味着扩展并非单调收益,规模决策要按任务级别评估。
6. 与同方向工作的关系
- Scaling Laws(Kaplan et al., 2020;Hoffmann et al., 2022):提供"可预测扩展"的基线——本文正是要在该基线之上指出"还有不可预测的那部分"。两篇一起读,能完整看到"扩展-涌现"的二元结构。
- Schaeffer et al., "Are Emergent Abilities a Mirage?", NeurIPS 2023(Outstanding Paper):用"严格指标 + 充分种子"重跑 BIG-Bench 涌现任务,把多数跃迁平滑化。本文 §2 的反方火力点正是 Schaeffer 论文的出发点;两文对照读,才能完整理解"涌现"争议。
- BIG-Bench / BIG-Bench Hard(Srivastava et al., 2022;Suzgun et al., 2022):提供 200+ 任务与其中"困难子集"的 23 个任务;本文主要实验跑在 BIG-Bench 完整集合上。
- In-context Learning / Chain-of-Thought 系列(Wei et al., 2022;Wang et al., 2022;Kojima et al., 2022):这些方法本身被论文列为"涌现行为"——CoT 在小模型上几乎无效,在大模型上效果骤升,是论文列举的典型涌现案例之一。
7. 适合谁读
- LLM 评测 / 选型工程师:本文是判断"厂商是否在用涌现叙事吹牛"的最短入门。
- AI 治理 / 风险研究:论文主题标签
risk在论文卡里被显式标注,论文 §4 讨论了"涌现带来的不可预测能力对部署安全的影响",对监管 / 红队分析有直接价值。 - ML 研究生入门"LLM 现象学":把涌现 / 扩展 / 突变三件事一次说清,是综述类论文里最干净的一份。
- 不需要读全文的快速读者:看图 1(BIG-Bench 九宫格涌现任务图)+ §2(涌现定义)即可拿到 80% 的信息密度;其余实验细节可在 BIG-Bench 仓库里按 task 名自行抽取。
8. 一段话总结
Wei 等人用 BIG-Bench 209 个任务、4 个模型家族、近 30 个规模点的实验证据,把"小模型没有、规模一大就出现的能力"定义为 emergent abilities,并指出这种阶跃既可能是模型获得了新算法,也可能是评测指标的离散选择放大了不连续性。论文的可贵之处在于自己写出了反方火力点——这一诚实标注让本文成为后续 Schaeffer 等人"涌现是幻象"工作的起点,也是今天任何 LLM 评测工程读者都必须放在桌上的标准参考。
工程落地与核查(Jay)
工程落地
1. 指标选型对工程验收的实际影响:exact match vs log-likelihood
论文 §2 的核心工程发现是:同一个模型-任务对,用 exact match 测是"涌现曲线",用 token-level log-likelihood 就变平滑曲线。这意味着如果你的上线验收标准是 exact match(多数代码补全、数学题的评测方式),你会得出"这个任务需要 ≥70B 模型才能做"的结论;但如果换成生成文本的 token-level 编辑距离,13B 模型可能已经能用。
工程建议:建立 A/B 评测体系,对每个"声称需要大模型"的能力同时跑 exact match 和 log-likelihood,取差值最大的那一项作为"模型规模决策依据"——而不是只看 exact match 的那个跃迁点。
2. 部署阈值附近的模型行为不稳定性
临界规模前后(论文报告的 13B→175B 乘法、6.7B→67B HumanEval)是两个完全不同的模型——临界前是"随机输出正确格式",临界后是"能执行算法"。工程上在模型规模升级前后必须做两次完整回归测试,而不是按比例缩减测试预算。
# 临界规模前后的回归测试设计(伪代码)
def regression_suite(model, task, threshold_range):
results = {}
for size in [f'{n}B' for n in [2, 7, 13, 70, 175]]:
m = load_model(size)
exact = exact_match_score(m(task))
ll = log_likelihood(m, task)
calibration = calibration_error(m, task)
results[size] = {'exact': exact, 'll': ll, 'calibration': calibration}
# 临界判定:exact 从 <5% 跳到 >60% 的规模点
critical_point = next(
s for s, r in results.items()
if r['exact'] > 0.6 and results[prev(s)]['exact'] < 0.05
)
# 临界两侧各跑一次 full regression
for size in [prev(critical_point), critical_point]:
assert results[size]['calibration'] < 0.1, f"Calibration broken at {size}"
return results
3. 小模型"胡编" vs "正确错误":外置校验器是必选项
论文已经观察到小模型在"涌现前"会产生格式正确但内容随机的输出(如"134 × 567 = 75801"这种数值幻觉)。在工程上,这意味着:任何"需要精确答案"的功能(计算、代码执行、事实查询),在小模型上不能直接上线,必须加一层外置校验器。
# 算术任务的外置校验器(工程必须项)
def safe_eval_expr(expr: str, model_output: str) -> str:
import ast, re
# 1. 提取可能的算术表达式
possible_exprs = extract_arithmetic_exprs(model_output)
for expr in possible_exprs:
try:
result = evaluate(ast.literal_eval(expr))
return f"VERIFIED: {result}"
except:
pass
return "UNVERIFIED — do not trust model output"
这条规则不只在算术上成立:任何"模型在临界规模前后的输出风险差异极大"的任务,都应该默认加上 human-in-the-loop 或规则校验。
4. 闭源 API 的 logits/energy 无法访问问题
Energy score、ODIN、GradNorm 都依赖 logits 或梯度——这些在 GPT-4 / Claude / Gemini 等闭源 API 上完全拿不到。Schaeffer 等人用来"平滑化涌现曲线"的 token-level 严格指标,同样依赖 logits(token_i | context) 的概率值,闭源 API 最多返回 top_logprobs 的 few tokens,不够做完整的 OOD / emergence 验证。
工程解法:用行为测试替代分布检测——给定 N 道算术题,对比模型输出与正确答案的 exact match,准确率 < 5% 就认为"还没涌现",不需要知道能量分数。
5. "涌现叙事"的厂商宣传识别方法
当厂商说"我们的模型在 X 任务上涌现了",工程团队应要求对方提供:
1. 换成连续指标(log-likelihood / token-level F1)后的曲线截图
2. 同一任务在 3 个以上不同架构/训练数据上的临界规模对比
3. 临界点两侧各 3 个随机种子的方差分析(方差大 = 不可靠)
如果对方拿不出来,就按"未验证"处理,不能因为论文有"涌现"标签就直接相信。
⚠️ 事实存疑
- 3 位数乘法临界规模 "13B → 175B":原文未给出点估计区间,只给了 PaLM 系列曲线截图;需回到 BIG-Bench 仓库对应 CSV 核实具体 FLOPs 节点。
- HumanEval pass@1 "6.7B → 67B":同样只给了曲线截图,未在正文给出精确数字;GPT-3.5 / GPT-4 各自的 HumanEval 数字需查官方榜单,不能从本文推断。
- "8B 之前近乎随机"(hindu_knowledge / LaMDA):需核实 LaMDA 论文(Thoppilan et al., 2022)与 BIG-Bench 仓库里 LaMDA 的具体规模标注,不是所有 8B 模型都满足这个条件。
风险边界
未开源/未量化/scale-up 难度高:Schaeffer 等人的"充分随机种子 + 严格指标"能把多数 BIG-Bench 涌现曲线平滑化,但这是学术结论,工程团队自己重跑需要每个任务跑 ≥20 个种子 × 5 个规模点 = 100 次完整 eval,成本极高;此外,涌现的反例(图 3/图 4 的"越大越差"任务)至今没有系统性解释,模型规模决策在这些任务上是盲区,不能用"涌现叙事"做唯一决策依据。