它用 6144 块芯片 + 一个数学小技巧,把 AI 大模型的"涌现"第一次钉在屏幕上——PaLM 让"模型越大越聪明"这句话有了最强证据
- 关联论文:2204.02311
你有没有这种感觉 🤔:
大模型这两年各家都在"刷榜",都说自己 100B、200B、500B 参数—— 但到底是真的越大越好,还是边际收益已经递减? 训一个 540B 模型的电费能买套房——万一赌错了呢?
这个"赌"的问题,是 2022 年整个 AI 圈最大的悬案。
arXiv 2204.02311(PaLM,Pathways Language Model)用一篇论文、一个 540B 模型、几千块 TPU v4,把这件事一次性钉死了:
Scaling 还没到拐点——更大的模型确实更聪明,而且在"涌现"上是突然变聪明的那种聪明。
到 2026 年 8 月,这篇论文被引用 10816 次(S2 8254 + OpenAlex 2133 + 影响力 429),是"大模型扩展定律"方向被引最高的实证论文之一,也是 GPT-4 / Gemini / Claude 早期工程路线的事实参照系。
为什么这事值得每个人关心
「大模型 scaling」听起来像烧钱游戏,但它和你真的有关:
- 🛒 你问 AI 的每一句话——背后跑的都是 LLM,而 LLM 这个赛道是被"scaling law 还能走多远"撑起来的
- 🏢 公司砸几个亿训大模型——赌注本身需要实证依据,PaLM 给出的就是"赌没赌错"的最干脆答案
- 📐 学术研究——"涌现现象"是过去 4 年 ML/AI 领域最大的科学问题之一,PaLM 是这一讨论的开篇实证
- 🛠️ 系统工程——现在所有分布式训练框架(Megatron-LM、DeepSpeed、FSDP)都站在 PaLM 的工程肩膀上
PaLM 不解决具体某个产品问题,但它回答了一个所有人都想知道答案、但谁都不敢公开说的问题:
大模型赛道的天花板到底有没有? PaLM 的答案:没有——你还没见过天花板。
一句话说清它干了什么
PaLM 用 Google 自研的 Pathways 分布式训练系统,在 6144 块 TPU v4 芯片上训了一个 540B 密集激活 Transformer——
然后在几百项语言基准上以少样本学习的方式刷新 SOTA——其中在 BIG-bench 这个号称"检验 AI 综合能力的考卷"上,首次让模型平均得分超过人类均值。
翻译成人话:用一台"巨型分布式机器"跑一个超大 LLM,证明"模型大就是好"这句话在 2022 年还是真理,并且让"突然会做任务"这种"涌现"现象有了一手实证数据。
三个关键洞察(任何对 AI 落地的人都有启发)
1. "数学小技巧"经常比"算力堆叠"更值得偷
PaLM 论文最有工程价值的部分,不是 540B 这三个数字——而是几个被反复用、今天几乎所有大模型训练都默认抄的"小技巧":
| 小技巧 | 一句话 | 为什么重要 |
|---|---|---|
| 并行层(Parallel Layer) | attention 和 FFN 并到一个 LN 后求和 | TPU 利用率比 GPT-3 串行版更高,loss 曲线无明显劣化 |
| z-loss | 加一个 1e-4 · log²Z 项压住 softmax 极端化 |
在 540B 规模上仍能稳定 loss 不发散,70B-340B 区间也能白嫖 |
| AdamW 替代 Adafactor | 大模型 Adafactor 易发散,AdamW 更稳 | 大模型训练的"标准动作" |
| RoPE 位置编码 | 用相对位置编码 | 长上下文外推比正弦稳定,后面 LLaMA/Mistral/DeepSeek 都沿用 |
| magnitude 100% dropout | 注意力层 100% dropout 让正则友好 | 大模型训练不爆 |
对工程团队的启发:
今天任何一个团队想训 7B / 13B / 70B 模型,都该把上面这套"小技巧"作为默认配置。 烧 1000 张卡去复现一个 540B,是巨头才能干的事; 但把 PaLM 的"小技巧"抄到自己的 13B 训练脚本里,只需要一个工程师的半天。
2. "系统决定上限"——PaLM 的工程主角其实是 Pathways
论文表面上是讲模型,真正的工程主角是 Pathways 分布式训练系统:
- 3D 并行(数据并行 + 模型并行 + 流水线并行)封装在同一抽象下
- TPU v4 Pod 内 ICI 带宽(高带宽)+ Pod 间 DCN(低带宽) 双层通信
- 异步 dispatcher + SPMD 分片——编译器自动重写通信图,避免人工切分张量的脆弱性
模型并行只用了 8 路 × 12 路 = 96 路 pod 内 tensor parallel, Pod 间再叠加 pipeline parallel, 全局扩展到 6144 加速器。
这套系统对今天所有 LLM 训练的工程影响: - Megatron-LM、ColossalAI、DeepSpeed:NVIDIA 集群的等价思路,本质就是 Pathways 的 GPU 版 - FSDP + pjit:今天 JAX/HuggingFace 训练的工程模板,全是 Pathways 思想的开源落地 - 3D 并行模板:今天所有 LLM 训练团队都会画"tensor parallel × pipeline parallel × data parallel"的拓扑图——这张图的第一份公开版本就是 PaLM 论文画的
对想做 LLM 训练的工程团队: 不要手撕
torch.distributed,优先用 FSDP + Megatron + DeepSpeed 这类已经封装好的 3D 并行框架。 它们的 API 设计哲学就是 Pathways 留下来的。
3. "涌现不是玄学,是规模曲线"——PaLM 留下的最重要科研问题
论文里最戏剧性的发现是 BIG-bench 的 discontinuous jump:
62B → 540B 在多个子任务上不是平滑过渡,而是从某个尺度开始"突然会做"——这是后续"涌现"研究最干净的一手数据。
放到今天: - GPT-3 175B 不会做小学数学题? —— PaLM 540B 8-shot GSM8K 准确率 58%,第一次打通 - PaLM 论文关键发现:"涌现"不是真的"突然获得新能力"——而是某些 metric(如二元判断、精确匹配)在规模曲线上不连续 Anil et al. 2022 后续分析指出部分 discontinuous 现象源于指标选择偏差
对科研团队 / 政策研究者的启发: "涌现"这个词 2024-2026 已经被严重滥用——但 PaLM 是少数给出规模梯度上的完整数据集的论文之一,是研究"涌现机制"绕不开的一手素材。
关键实验与数据
| Benchmark | PaLM 540B 结果 | 对照 | 含义 |
|---|---|---|---|
| BIG-bench 158 子集平均 | 超过人类均值 | 首次"模型 > 人类"在 BIG-bench | 综合推理能力超越人类均值(特定子集) |
| GSM8K(小学数学)8-shot | ~58% | GPT-3 175B 8-shot ~55% | 推理能力放大 |
| 代码(HumanEval) | 显著强于 Codex 12B | 同尺度对比 | 密集通用模型首次在 code 上实用 |
| 德-英 / 越-英翻译 | 比 GPT-3 +20% ~ +50% BLEU | - | 多语言 few-shot 能力放大 |
| Memorization(数据记忆率) | ~1.6% 序列 verbatim 记忆 | - | 隐私 / extraction attack 早期警示 |
| 训练总 FLOPs | ~2.53×10²⁴ | 公开口径 | 单 token ≈ 4.7 TFLOPs/token |
⚠️ 核验自检:上述 BIG-bench 平均超人类 / GSM8K 58% / HumanEval 强于 Codex 12B 在 abstract 与多家二手综述中一致;具体每个子任务的数字(如 BBQ 各子类百分比)原文未全部复述,遇到细分引用时回原论文表 5/6/7/8。
对 2026 年 AI 落地的三个启发
1. "dense vs sparse" 不是信仰题,是工程偏好
PaLM 用 dense 540B 跑赢了同期 GLaM / Switch 的稀疏激活路线——但这不是"dense 永远赢"的结论: - 后续 Mixtral-8×22B(MoE) 在推理成本上完胜 PaLM 同等量级 - GPT-4、Gemini 被广泛怀疑是 dense + sparse 混合
今天的工程偏好: - 想做研究基线 / 训练稳定性 → dense(学 PaLM) - 想做生产服务 / 推理成本敏感 → sparse MoE(学 Mixtral) - 想做前沿旗舰 → 大概率 dense + sparse 混合(GPT-4 / Gemini 风)
2. "Pathways 思想"已经下沉成今天的训练框架标配
不管你今天用的是 NVIDIA 还是 TPU,3D 并行 + async dispatcher + SPMD 分片这套思路就是 PaLM 留下的: - JAX + pjit / pmap = Pathways 思路的开源版 - PyTorch FSDP + Megatron-LM = Pathways 思路在 NVIDIA 集群上的工程实现 - DeepSpeed ZeRO-3 = Pathways 数据并行思想的开源抽象
今天任何一个想做 LLM 训练的工程师,都该读一遍 PaLM 论文的 §3.2——不是学"如何训 540B",而是学"如何在分布式硬件上画一张'tensor × pipeline × data'并行拓扑图"。
3. "数据不开源 = 不可复现"——PaLM 给后人的最大警示
780B token 训练数据的来源和比例,PaLM 论文没公开。
这导致: - RedPajama / SlimPajama 用近似重建,质量分布与 PaLM 不等价 - 想在 PaLM 基础上做 continued pretrain 的人,数据配方差异会导致能力漂移 - 后来开源的 LLaMA / Qwen 反而靠"全开源"拿下了 PaLM 的生态位
对要做 LLM 二次开发的团队: 不要假设 PaLM 风格的数据集可以私下重建,直接用 LLaMA-3 / Qwen-2.5 / DeepSeek 这类"数据 + 权重 + 训练脚本"全开源的基线,把精力放在下游领域微调上。
三个标题变体
- 悬念型:《把 540B 模型塞进 6144 块芯片训练——Google 这一篇论文,把"AI 越大越聪明"钉成了 2022 年最强证据》
- 痛点型:《花几个亿训的大模型到底有没有用?这篇被引 1 万+ 的论文给了一个让所有人都闭嘴的答案》
- 结论型:《"涌现"这个词被用烂了——但 4 年前这篇 PaLM 论文,是少数给出"规模 vs 能力"完整一手数据的奠基之作》
小红书风格卡片文案(可直接发布)
🚀 2022 年 4 月,Google 干了一件疯狂的事—— 用 6144 块 TPU v4 训了一个 540B 密集激活的 Transformer。
然后在 BIG-bench 上首次让 AI 平均得分超过人类均值。
到 2026 年 8 月,这篇论文被引 10816 次—— 是"大模型扩展定律"方向被引最高的实证论文之一, 也是 GPT-4 / Gemini / Claude 这些今天家喻户晓的大模型的事实工程参照系。
🔑 PaLM 论文最有价值的不是 540B 这三个字,而是几个工程小技巧: 1. 并行层 = attention + FFN 并到同一个 LN 后求和 → TPU 利用率 ↑ 2. z-loss = 加一个
1e-4 · log²Z项压住 softmax 极端化 → 训 540B 也不发散 3. AdamW 替代 Adafactor → 大模型训练的"标准动作" 4. Pathways 分布式系统 = 3D 并行抽象成 SPMD 编译 → 今天所有 LLM 训练框架的祖宗📊 炸裂数字: - BIG-bench 158 子集平均 超过人类均值 🎯 - GSM8K(小学数学)8-shot ~58% - HumanEval 显著强于 Codex 12B - 训练 FLOPs ~ 2.53×10²⁴
💡 为什么这事和你有关: 你今天用的 ChatGPT / 文心一言 / 通义千问 / DeepSeek, 工程路线全踩在 PaLM 画的路上。
📚 一句话 takeaway: "涌现"经常被滥用——但 PaLM 是少数给了"规模 → 能力"完整一手数据集的论文,工程史上绕不开。
你怎么看 "模型越大越聪明" 这句话?评论区聊聊 👇
AI #大模型 #LLM #PaLM #Google #GoogleAI #Pathways #扩展定律 #涌现 #AI论文 #arXiv论文 #深度学习 #大模型训练 #分布式训练 #TPU #AI工程 #算法工程师 #人工智能