大模型做数学题,2022 年这条 Google 路线告诉你:不用外挂计算器也能 SOTA

  • 关联论文:2206.14858

你让 ChatGPT 解一道「鸡兔同笼」或者「微积分」题,它能答对吗?很多时候能,但偶尔会算错或者「编一个不存在的公式」骗你。能不能让大模型像人一样一步步推、不靠 Python 计算器、也不用 Wolfram Alpha,依然做出大学水平的定量推理题?

2022 年 6 月 Google 的一篇论文(arXiv:2206.14858)给出了一个让人意外的答案:能,但要让模型在「对的数据」上学

这篇论文叫 Minerva。它用三个不同规模的 PaLM 模型(最大 540B 参数),在「数学公式密集的网页 + arXiv 论文 + 技术教科书」上继续做预训练,然后用「带完整解题步骤」的数据做监督微调——全程不调用任何外部工具——在 MATH、GSM8K 等数学竞赛题上拿到了 2022 年的 SOTA,并且在一份 200+ 道本科级物理/生物/化学/经济题的自建测试集上,答对了约三分之一

为什么这件事值得大众关注

定量推理(quantitative reasoning)是大模型「能不能像人一样思考」的关键试金石。它离每个用 AI 干活的人都很近:

  • 📚 教育:AI 能不能当数学/物理老师?靠不靠「偷偷调计算器」?
  • 💼 金融:让 AI 算贷款、估值、风险,能不能信?
  • 🏥 医疗:让 AI 算药量、读化验单,能不能不靠外部数据库?
  • 🔬 科研:让 AI 推公式、验证明,能不能不调 SymPy?

Minerva 的核心主张是:问题不在模型大小,而在训练数据里有没有「技术语料」——如果训练数据里充斥着营销文、社交媒体,模型自然学不会「一步步推」;如果塞入 5–10% 的高质量数学/物理/代码语料,纯模型就能在数学上做到 SOTA

一句话核心机制

纯模型做定量推理的「两步走」配方

  1. 继续预训练:在 arXiv 风格的技术语料上做 domain-adaptive pretraining
  2. 推理微调:用「带完整解题步骤」的样本做监督微调(SFT)
  3. 推理时majority voting(对同一题采 64 次,按最终答案多数票选)显著提升准确率

一个影响至今的细节:和「工具增强」路线的根本分歧

2022 年前后,定量推理有两条路线: - Minerva 路线:纯模型,不调任何工具,端到端部署 - OpenAI/DeepMind 路线:LLM + Python interpreter + Wolfram Alpha

Minerva 证明纯模型路线可行且上限高,但代价是:模型权重大(540B 部署门槛高)、算错没有兜底、没有严格算术保证。这场路线之争至今未结束——生产环境里,工具路线更稳;学术研究里,纯模型路线仍被沿用。DeepSeek-Math、Qwen-Math、DeepSeek-R1 的训练数据配方都直接抄了 Minerva 的两步走骨架。

2026 年视角

Minerva 2022 年的 SOTA 已被 DeepSeek-Math、Qwen2.5-Math 等在 MATH 上超越 90%。但 Minerva 留下的「技术语料 pretrain + 推理 SFT」两步配方,至今仍是所有数学 LLM 的训练起手式。它解决了「数据配比怎么选」这个工程界最头疼的问题。

⚠️ 落地硬约束

  • majority voting 64 次采样成本高:单题 64 次推理 = 64 倍成本,生产场景必须做两阶段(先贪婪解码,低置信度再投票)
  • 错误类型无法自动识别:计算错、逻辑跳步、幻觉公式、单位错这四类错误没有标准检测方案
  • 校准差:模型对自己的置信度几乎没有可靠信号,常常「自信地答错」
  • 需要高算力:540B 模型在 8×A100 上才能复现,小模型保留推理能力有限

一句话总结

Minerva 给整个「LLM 做数学」方向定了调:模型本身能学会推,但纯模型路线在生产环境里几乎必然会回到工具增强——因为错的代价太高。


三个标题变体

  1. 数字钩子版:200+ 本科题答对三分之一、540B 不调工具拿下 2022 数学 SOTA——Minerva 的两步走配方
  2. 拟人化版:让大模型「先看对书、再练步骤」,Google 这条 Minerva 路线催生了 DeepSeek-Math
  3. 类比版:Minerva 就像让 AI 上了一年的「数学系预科」——只读书、不作弊,考试照样拿高分

小红书风格卡片文案(可直接发布)

🧮 让 AI 做数学题,2022 年这条路线告诉你:不靠计算器也能 SOTA

你以为大模型做数学题,一定得偷偷调 Python 或 Wolfram Alpha

🤔 2022 年 Google 说:不一定。

📚 Minerva(arXiv:2206.14858)做了什么?

拿三个不同规模的 PaLM 模型(最大 540B),在「数学公式密集的网页 + arXiv 论文 + 技术教科书」上继续做预训练,然后用「带完整解题步骤」的样本做监督微调——

🔑 全程不调用任何外部工具

📊 结果: - 2022 年 MATH、GSM8K 上拿到 SOTA - 200+ 道本科级物理/生物/化学/经济题,答对约三分之一

🧠 核心配方(三步走)

1️⃣ 技术语料继续预训练:塞入 5–10% 高质量数学/物理/代码语料 2️⃣ 推理微调:用「完整解题步骤」的样本做 SFT 3️⃣ majority voting:同一题采 64 次,多数票选答案

🔍 和「工具增强」路线的根本分歧

  • Minerva 路线:纯模型,端到端,可私有部署
  • ⚠️ 代价:540B 部署门槛高、算错没兜底、无严格算术保证

🎯 2026 年位置: - DeepSeek-Math、Qwen-Math、DeepSeek-R1 全部沿用 Minerva 配方 - Minerva 2022 年 SOTA 已被超越 90% - 但「数据配比怎么选」这个工程问题,被它一劳永逸地回答了

⚠️ 生产环境三大硬约束: 1. majority voting 64 次 = 64 倍成本(生产必须做两阶段) 2. 错误类型自动识别无标准方案(计算错/跳步/幻觉公式/单位错) 3. 校准差:模型常常「自信地答错

💡 一句话: Minerva 证明模型本身能学会推,但生产环境里几乎必然会回到工具增强——错的代价太高。

👇 互动话题:你让 AI 做过最难的一道数学题是什么?评论区聊聊 👇

Minerva #大模型数学 #定量推理 #LLM数学 #GoogleAI #PaLM #DeepSeekMath #QwenMath #AI教育 #MATH #GSM8K #AI科普 #每天学点AI #arXiv