当所有人都在堆大模型时,这篇论文说"小一点、多喂点"才是真相

  • 关联论文:2203.15556

2022 年初,AI 圈有一种近乎狂热的信仰:模型越大越聪明。于是各家开始堆参数——GPT-3 175B、Gopher 280B、Jurassic-1 178B、Megatron-Turing NLG 530B——动辄几百 B 参数,训练数据相对抠门,几千亿 token 就算"丰富"。

然后 DeepMind 的一篇论文,啪地打在了所有大模型的脸:你们全都训练错了。

这就是 Chinchilla 论文——一个看似平淡、实则颠覆整个行业的"训练预算分配法则"。

它的故事:把同样预算花在"训练"上才划算

先说个直觉:训练一个大模型就像养孩子。

一种养法是:生个巨婴,少喂饭。参数搞得巨大,但训练数据相对少,结果是孩子虽然块头大,"脑子里的真东西"不多,下游任务跑分不理想。

另一种养法是:生个正常体型,喂充足。参数不堆那么狠,但训练数据量大幅增加,让模型在更丰富的语料里充分"读书"。结果呢?同样花差不多的钱,"正常体型 + 营养均衡"那个孩子,考试分数反而更好。

Chinchilla 实验的故事就是这么朴素:DeepMind 用 400+ 个不同尺寸(70M 到 16B 参数)、不同训练量(5B 到 500B tokens)的 Transformer 模型做系统性消融,画出了"训练算力 vs. 模型损失"的三维曲面。

它发现的秘密:参数和数据要 1:1 同步放大

具体公式不复杂。任何 Transformer 训练一次前向+反向的 FLOPs ≈ 6 × 参数量 × 训练 token 数。把"算力预算"固定,就要在"参数 N"和"训练数据 D"之间做分配。

DeepMind 通过对 400+ 模型拟合一条"损失函数",最后得到一个清晰的结论:

N_opt(算力) ∝ 算力^0.50
D_opt(算力) ∝ 算力^0.50

翻译成人话:模型参数每翻一倍,训练数据也应当翻一倍——这就是所谓的"1:1 法则"(更具体地说是大约 20 个 token / 每参数)。

按这条规则,他们把原本 280B 参数、400B tokens 训练的 Gopher,用同等算力预算换成了一个 70B 参数、1.4T tokens 训练的 Chinchilla。模型小了 4 倍,数据多了 3.5 倍。

然后呢?Chinchilla 70B 在 MMLU 等关键基准上反超 Gopher 280B 七个百分点——而且因为模型小了 4 倍,推理成本暴跌,部署门槛断崖式下降。

这为什么重要:从此开源社区有了"训练圣经"

Chinchilla 之前,"训练大模型"是模糊的工程艺术。Chinchilla 之后,开源社区几乎所有主流模型都按"1:1"或"略高"的比例设计训练数据规模:

  • Llama 1 65B:1.4T tokens,刚好命中 Chinchilla 比例
  • Llama 2 70B:2T tokens,符合
  • Llama 3.1 405B:15T tokens,远超但靠"高质量数据"补偿
  • Qwen 系列 / DeepSeek 系列 / Mistral:全部在 Chinchilla 比例附近或往高质量方向调整

可以说:没有 Chinchilla,就没有今天你能在本地跑得起的 7B/13B/70B 开源大模型生态。它把"训练大模型"从"烧钱游戏"变成了"算账游戏"。

它也直接重新定义了"竞争维度"——参数堆到 500B 没什么用了,关键是"算力预算怎么切"。

给工程团队的实际启示

第一条:训练预算分配要按公式做。给定 X FLOPs 的训练预算,先用 Chinchilla 公式算出"参数 N 应该是多少 + 训练 token D 应该是多少"。两步决定一切。

第二条:推理成本反过来约束训练预算。如果只能部署 7B 推理,训练时就该把算力堆在 D(数据)而不是 N(参数)。

第三条:微调与对齐也要按比例喂数据。Chinchilla 风格的小模型 + 大量 SFT/RLHF 数据,比"小模型 + 很少 SFT 数据"显著更强——这条后来在 Alpaca、Vicuna、Llama-Chinese 等项目里都被反复验证。

第四条:Chinchilla 比例是下限,不是上限。2024 年后主流模型普遍超出这个比例,靠的是"高质量精选数据"——一份精选书籍或高质量论文 token,等效价值是普通网页 token 的 3-5 倍。所以今天的工程实操不是死守 20 token/param,而是按数据质量动态调整。

边界与争议

Chinchilla 也有它的局限。第一,所有实验都在 70M–16B 区间拟合,外推到 70B 以上靠"假设 scaling law 仍然成立"——论文本身没在 100B+ 直接验证。第二,它只考虑纯文本,多模态联合训练的比例如何配,没有给出。第三,数据质量维度缺位,所以 2024+ 的主流路线实际上是在 Chinchilla 基础上的质量升级版。

但这不影响它的核心结论在 2026 年的今天仍然成立:"算力预算应该怎么分"这件事,Chinchilla 给出的 1:1 法则至今没有被推翻

一句话总结

Chinchilla 是 AI 训练从"烧钱竞赛"走向"算账工程"的转折点——它用 400+ 次实验证明了"小而多训"在同等算力下稳定击败"大而少训"。这条原则已经被开源社区全面内化,成为今天所有主流大模型的设计基线。


三个标题变体

  1. 把大模型做小一点、多喂一点:这条法则颠覆了整个 AI 行业——把"1:1 法则"翻译成大众类比
  2. 没人想看的 2022 年论文,却重写了整个开源大模型生态——强调"看似平淡、影响深远"的反差
  3. Chinchilla 法则:为什么你今天能本地跑 70B 模型,要感谢这篇论文——直接对工程用户喊话

小红书风格卡片文案

🤯 所有人都在堆参数,这篇论文说:你们都错了

2022 年 AI 圈盛行一句话:"模型越大越聪明"。于是各家开始卷参数——GPT-3 175B、Gopher 280B、MT-NLG 530B,参数量一个比一个吓人。

然后 DeepMind 慢悠悠丢出一篇 Chinchilla 📜: · 400+ 个实验模型 · 5 个数量级的参数 + 3 个数量级的训练数据 · 一句结论:参数每翻倍,训练数据也要翻倍(1:1 法则)

结果如何?😱 同样算力预算,把 Gopher 280B 改成 Chinchilla 70B(参数缩 4 倍,训练数据涨 3.5 倍),下游任务反超 7 个百分点!推理成本还暴跌。

为什么重要 💡 · 这条法则被 Llama / Qwen / DeepSeek 全家采用 · 没有 Chinchilla 就没有今天本地能跑的 70B 开源模型 · 它把"训练大模型"从烧钱游戏变成算账工程

工程实操 4 条 📋 1️⃣ 预算分配按公式 N_opt ∝ C^0.5, D_opt ∝ C^0.5 2️⃣ 推理成本反推训练预算:扛不起 280B,训练就别往 N 堆 3️⃣ 微调数据也按比例喂,别只训个位数 K 4️⃣ Chinchilla 比例是下限不是上限,高质量数据可以再激进

⚠️ 必须看清的边界 · 拟合来自 70M–16B 区间,外推到 100B+ 有 10-20% 误差 · 仅适用纯文本,多模态联合训练比例未给 · 数据质量维度缺位——Llama 3 405B 已在 20x 基础上加"质量系数"

你训练模型时,会按这条法则切算力吗?🧮 评论区聊聊你踩过的"参数堆太大 / 数据喂不够"的坑 👇

📌 论文:arXiv:2203.15556 🔖 标签:#Chinchilla法则 #LLM训练 #算力分配 #ScalingLaw #开源大模型 #DeepMind #AI工程 #训练预算 #AI科普 #论文精读