大模型做数学题,2022 年这条 Google 路线告诉你:不用外挂计算器也能 SOTA
- 关联论文:2206.14858
你让 ChatGPT 解一道「鸡兔同笼」或者「微积分」题,它能答对吗?很多时候能,但偶尔会算错或者「编一个不存在的公式」骗你。能不能让大模型像人一样一步步推、不靠 Python 计算器、也不用 Wolfram Alpha,依然做出大学水平的定量推理题?
2022 年 6 月 Google 的一篇论文(arXiv:2206.14858)给出了一个让人意外的答案:能,但要让模型在「对的数据」上学。
这篇论文叫 Minerva。它用三个不同规模的 PaLM 模型(最大 540B 参数),在「数学公式密集的网页 + arXiv 论文 + 技术教科书」上继续做预训练,然后用「带完整解题步骤」的数据做监督微调——全程不调用任何外部工具——在 MATH、GSM8K 等数学竞赛题上拿到了 2022 年的 SOTA,并且在一份 200+ 道本科级物理/生物/化学/经济题的自建测试集上,答对了约三分之一。
为什么这件事值得大众关注
定量推理(quantitative reasoning)是大模型「能不能像人一样思考」的关键试金石。它离每个用 AI 干活的人都很近:
- 📚 教育:AI 能不能当数学/物理老师?靠不靠「偷偷调计算器」?
- 💼 金融:让 AI 算贷款、估值、风险,能不能信?
- 🏥 医疗:让 AI 算药量、读化验单,能不能不靠外部数据库?
- 🔬 科研:让 AI 推公式、验证明,能不能不调 SymPy?
Minerva 的核心主张是:问题不在模型大小,而在训练数据里有没有「技术语料」——如果训练数据里充斥着营销文、社交媒体,模型自然学不会「一步步推」;如果塞入 5–10% 的高质量数学/物理/代码语料,纯模型就能在数学上做到 SOTA。
一句话核心机制
纯模型做定量推理的「两步走」配方:
- 继续预训练:在 arXiv 风格的技术语料上做 domain-adaptive pretraining
- 推理微调:用「带完整解题步骤」的样本做监督微调(SFT)
- 推理时用 majority voting(对同一题采 64 次,按最终答案多数票选)显著提升准确率
一个影响至今的细节:和「工具增强」路线的根本分歧
2022 年前后,定量推理有两条路线: - Minerva 路线:纯模型,不调任何工具,端到端部署 - OpenAI/DeepMind 路线:LLM + Python interpreter + Wolfram Alpha
Minerva 证明纯模型路线可行且上限高,但代价是:模型权重大(540B 部署门槛高)、算错没有兜底、没有严格算术保证。这场路线之争至今未结束——生产环境里,工具路线更稳;学术研究里,纯模型路线仍被沿用。DeepSeek-Math、Qwen-Math、DeepSeek-R1 的训练数据配方都直接抄了 Minerva 的两步走骨架。
2026 年视角
Minerva 2022 年的 SOTA 已被 DeepSeek-Math、Qwen2.5-Math 等在 MATH 上超越 90%。但 Minerva 留下的「技术语料 pretrain + 推理 SFT」两步配方,至今仍是所有数学 LLM 的训练起手式。它解决了「数据配比怎么选」这个工程界最头疼的问题。
⚠️ 落地硬约束
- majority voting 64 次采样成本高:单题 64 次推理 = 64 倍成本,生产场景必须做两阶段(先贪婪解码,低置信度再投票)
- 错误类型无法自动识别:计算错、逻辑跳步、幻觉公式、单位错这四类错误没有标准检测方案
- 校准差:模型对自己的置信度几乎没有可靠信号,常常「自信地答错」
- 需要高算力:540B 模型在 8×A100 上才能复现,小模型保留推理能力有限
一句话总结
Minerva 给整个「LLM 做数学」方向定了调:模型本身能学会推,但纯模型路线在生产环境里几乎必然会回到工具增强——因为错的代价太高。
三个标题变体
- 数字钩子版:200+ 本科题答对三分之一、540B 不调工具拿下 2022 数学 SOTA——Minerva 的两步走配方
- 拟人化版:让大模型「先看对书、再练步骤」,Google 这条 Minerva 路线催生了 DeepSeek-Math
- 类比版:Minerva 就像让 AI 上了一年的「数学系预科」——只读书、不作弊,考试照样拿高分
小红书风格卡片文案(可直接发布)
🧮 让 AI 做数学题,2022 年这条路线告诉你:不靠计算器也能 SOTA
你以为大模型做数学题,一定得偷偷调 Python 或 Wolfram Alpha?
🤔 2022 年 Google 说:不一定。
📚 Minerva(arXiv:2206.14858)做了什么?
拿三个不同规模的 PaLM 模型(最大 540B),在「数学公式密集的网页 + arXiv 论文 + 技术教科书」上继续做预训练,然后用「带完整解题步骤」的样本做监督微调——
🔑 全程不调用任何外部工具。
📊 结果: - 2022 年 MATH、GSM8K 上拿到 SOTA - 200+ 道本科级物理/生物/化学/经济题,答对约三分之一
🧠 核心配方(三步走):
1️⃣ 技术语料继续预训练:塞入 5–10% 高质量数学/物理/代码语料 2️⃣ 推理微调:用「完整解题步骤」的样本做 SFT 3️⃣ majority voting:同一题采 64 次,多数票选答案
🔍 和「工具增强」路线的根本分歧:
- ✅ Minerva 路线:纯模型,端到端,可私有部署
- ⚠️ 代价:540B 部署门槛高、算错没兜底、无严格算术保证
🎯 2026 年位置: - DeepSeek-Math、Qwen-Math、DeepSeek-R1 全部沿用 Minerva 配方 - Minerva 2022 年 SOTA 已被超越 90% - 但「数据配比怎么选」这个工程问题,被它一劳永逸地回答了
⚠️ 生产环境三大硬约束: 1. majority voting 64 次 = 64 倍成本(生产必须做两阶段) 2. 错误类型自动识别无标准方案(计算错/跳步/幻觉公式/单位错) 3. 校准差:模型常常「自信地答错」
💡 一句话: Minerva 证明模型本身能学会推,但生产环境里几乎必然会回到工具增强——错的代价太高。
👇 互动话题:你让 AI 做过最难的一道数学题是什么?评论区聊聊 👇