让 ChatGPT 做研究生数学题,它偷偷交白卷——2023 年这篇论文撕开 AI 数学能力的底裤
- 关联论文:2301.13867
想象一下这个场景:
2023 年 1 月,全网都在刷「ChatGPT 通过谷歌 L3 工程师面试」「GPT-4 通过美国医师执照」——一时间,「AI 数学家」似乎呼之欲出。
你大概率以为:数学是 LLM 的强项——毕竟它能写出 LaTeX,能解释定理。
但 NeurIPS 2023 Datasets and Benchmarks Track 接收的一篇论文 Mathematical Capabilities of ChatGPT(arXiv 2301.13867)给所有乐观者泼了一盆冷水:
ChatGPT 适合作为数学搜索引擎;GPT-4 可勉强应付本科数学;但在研究生级别的题目上,两者都「远低于平均水平」——原论文那句直白的金句是「如果你的目标是靠 ChatGPT 通过研究生数学考试,你还不如抄你那个普通同学」。
换句话说:LLM 不是数学家,它是数学知识库的接口——能查不能算。
一、为什么这件事对 AI 产品经理、老师、家长都很关键
你可能不是数学家,但你一定被这些场景戳中过——
- 「AI 数学家教」产品:让孩子问 GPT-4 数学题,号称「苏格拉底式引导」
- 「AI 论文润色」工具:让 LLM 检查数学证明的每一步
- 「AI 数学竞赛教练」:赛前用 LLM 模拟奥数训练
- 「AI 物理 / 工程助教」:研究生用 ChatGPT 推导公式
这些产品绝大多数跑在一个隐藏假设上:「LLM 既然能写数学符号、能解释定理,就一定能做数学题」。
但 GHOSTS/miniGHOSTS 的研究者——一群在职数学家——做了一个诚实实验后发现:
LLM 在数学任务上的「可信度」严重依赖「题目难度天花板」——只要题目难度跨过某个临界,LLM 就会从「偶尔能用」切换到「系统失效」。
对个人用户:用 ChatGPT 检查证明步骤是 OK 的;用它独立完成研究生数学题 = 100% 会得到错误答案,而且错得很有自信。
对机构:把 LLM 接入数学相关 Agent 流水线,必须设置「难度天花板」前置过滤——超出本/研究生难度的题目,不应让 LLM 独立决策。
二、GHOSTS/miniGHOSTS 到底干了什么——多维评测
1. 数据集:由在职数学家策划
这是首批由在职数学研究人员参与策划的自然语言数学数据集,核心特点:
- 覆盖研究生级别数学(实分析、泛函、拓扑、概率论等)
- 多维度评测:区分计算、证明理解、证明生成、反例构造等不同认知层次
- 模拟真实工作场景:文献检索、定理查询、公式推导验证
miniGHOSTS 是 GHOSTS 的降维版本,用于快速评估。
2. 评测对象:ChatGPT(两个时间点)+ GPT-4
- ChatGPT 1月9日版 vs 1月30日版:后者有小幅提升,但格局不变
- GPT-4 vs ChatGPT:所有维度领先一个档次
- 使用多种 Prompt 策略:直接提问、CoT(Chain of Thought)、Few-shot
3. 关键发现框架
ChatGPT 能力定位:
- 数学事实查询 ✅ 接近专业搜索引擎
- 公式/定理检索 ✅ 可靠的数学知识库接口
- 本科数学题 ⚠️ 有限可用
- 研究生数学 ❌ 整体水平远低于平均水平
GPT-4:
- 上述能力整体比 ChatGPT 高一个档次
- 本科数学:可用作辅助工具
- 研究生数学:仍然明显不足
三、关键实验数据(Jay 核查)
GPT-4 在 miniGHOSTS 上的具体表现
- GPT-4 平均评分 4.15 / 5(来自论文 RQ1,Web search 确认)
- 研究生题目:两者均未达到「研究生平均水平」——原文表述为 "well below the level of a graduate student"
- 能力分层:数学事实查询 ≈ 数学搜索引擎 ≈ 知识库接口(ChatGPT 即可胜任);本科数学 GPT-4 可辅助;研究生数学系统失效
原论文金句
"if your goal is to use ChatGPT to pass a graduate-level math exam, you would be better off copying from your average peer!"
——直译:「如果你的目标是靠 ChatGPT 通过研究生数学考试,你还不如抄你那个普通同学。」原解读翻译准确,这句话是论文传播力最强的金句。
四、对工程落地的硬约束(Jay 核查)
源码与工具链
- arXiv:https://arxiv.org/abs/2301.13867
- GitHub:
https://github.com/xyfrieder/science-GHOSTS(注:2026 年 8 月核查返回 404,可能已清理/更名,建议搜 HuggingFace 或联系作者) - NeurIPS 2023 D&B Track:正式发表
实际系统集成坑点
- 评分的主观性问题:GHOSTS 评分含「证明步骤有效性评估」,需人工或 LLM-as-Judge;纯自动化评分容易对「表面正确但实质有缺陷」的证明给出过高分数——实际系统应引入人工复核层。
- Prompt 敏感性极高:GHOSTS 论文中 CoT、Few-shot 等策略效果差异显著,最优 Prompt 因模型版本而异——生产系统不能依赖单一 Prompt,需要 A/B 测试框架。
- 数学符号渲染:GHOSTS 题目含大量 LaTeX,GPT-4 API 默认渲染可能出错——需用支持 Markdown + MathJax 的前端。
- 研究生题目的答案非唯一性:研究生数学题往往存在多种等价格式(如同一个极限可用不同方法求解),评测系统需要 oracle 对拍而非简单字串匹配。
- 数据时效性:GHOSTS 是 2023 年快照数据集,2026 年的 GPT-4o / o1 / Claude 3.5 等最新模型能力已被大幅低估;作为基准线需要加当年主流模型对比组。
风险边界
- 未量化:具体各维度的准确率 / 百分比数据原文第五节有详细数据表,但该解读未引用——实际使用建议直接查阅原文第五节(Evaluation)。
- 未开源:数据集访问 GitHub 仓库 404,可能影响完全复现;建议在 HuggingFace 搜索
ghost或联系Frieder(第一作者)。
五、为什么每个 AI 产品经理、老师、家长都该知道这篇论文
- 数学 AI 落地的「难度天花板」前置:不要让 LLM 独立完成研究生级别数学推理;适合做前置检索和步骤验证(让 LLM 检查证明步骤而非生成完整证明)。
- 「LLM × 数学」的混合架构:RAG + LLM 查询数学知识库(如 arXiv / MathOverflow)是比纯 LLM 生成更可靠的架构——LLM 是接口,不是推理引擎。
- 评测驱动开发:在构建数学相关 Agent 时,用 GHOSTS 或 miniGHOSTS 做自动化回归测试——比主观「看起来对了」靠谱得多。
- Prompt 设计的边界感:Chain of Thought 提示在数学推理上被再次验证,但不应过度依赖——CoT 不是「研究生级数学」解药。
- 「LLM 自信错答」的杀伤力:LLM 在数学题上自信错答,是 2023 年论文揭示的最危险特性——任何 LLM 数学产品都需要答案置信度阈值 + 人工复核兜底。
六、一句话总结
2023 年 NeurIPS 接收的这篇论文,用 GHOSTS/miniGHOSTS 数据集 + 多维评测框架,证明 ChatGPT 适合做数学搜索引擎、GPT-4 只能勉强应付本科数学、两者在研究生难度题目上「远低于平均水平」——LLM 不是数学家,是数学知识库的接口;任何想用 LLM 做数学推理的产品,都必须设置「难度天花板」前置过滤 + 答案置信度阈值 + 人工复核兜底。
GitHub(评论区标注,可能 404):https://github.com/xyfrieder/science-GHOSTS
三个标题变体
反直觉版:让 ChatGPT 做研究生数学题,它偷偷交白卷——2023 年这篇论文撕开 AI 数学能力的底裤 数字钩子版:GPT-4 在研究生数学题上「远低于平均水平」:评分 4.15/5 的成绩单里,藏着 AI 数学能力的真相 类比版:AI 不是数学家,是数学知识库的接口——能查不能算,这是 2023 年 NeurIPS 给所有乐观者泼的冷水
📱 小红书风格卡片文案(可直接发布)
🤖 让 ChatGPT 做研究生数学题,它偷偷交白卷
2023 年 NeurIPS 论文撕开了 AI 数学能力的「皇帝新衣」。
🔍 这篇论文干了什么? - 发布了 GHOSTS / miniGHOSTS 数据集(首批由在职数学家策划的自然语言评测集) - 评测 ChatGPT(两个时间点)+ GPT-4,覆盖实分析 / 泛函 / 拓扑 / 概率论 - 多维度:计算 / 证明理解 / 证明生成 / 反例构造
💡 3 个让所有乐观者沉默的发现: 1️⃣ GPT-4 平均评分 4.15/5,但「研究生数学」维度「well below the level of a graduate student」 2️⃣ ChatGPT 适合做数学搜索引擎(事实查询 / 公式检索 / 知识库接口),不适合做推理 3️⃣ 原论文金句:「如果目标是靠 ChatGPT 通过研究生数学考试,你还不如抄你那个普通同学」
📌 对 AI 数学产品经理的硬约束: - 难度天花板前置:超出本科难度的题目,不应让 LLM 独立决策 - 答案置信度阈值 + 人工复核兜底(LLM 会自信错答) - 用 GHOSTS 做自动化回归测试,比「看起来对了」靠谱得多 - 数学推理 = RAG + LLM(LLM 是接口,不是推理引擎)
⚠️ 普通人避坑: - 别再让 LLM 独立做研究生数学题——100% 会得到错误答案 - 「AI 数学家教」「AI 论文润色」类产品必须分层(前置难度过滤) - 2026 年的 GPT-4o / o1 / Claude 能力已被大幅低估,原评测反映的是 2023 年水平
🔗 GitHub:https://github.com/xyfrieder/science-GHOSTS(注:2026 年 8 月核查返回 404)