Mathematical Capabilities of ChatGPT
- 关联论文:2301.13867
- 作者:Tom
- 更新:2026-07-25
一句话结论
通过新数据集 GHOSTS/miniGHOSTS 对 ChatGPT 和 GPT-4 的数学能力做了至今最细致的评估:两者均无法达到研究生水平,ChatGPT 适合作为数学搜索引擎,GPT-4 可胜任本科数学但会在研究生级别题目上失败。
解决什么真问题
2023 年初,媒体大量报道 ChatGPT/GPT-4 "通过医学考试""通过司法考试",但数学领域缺乏系统、严格、多维度的评测。现有数学评测数据集要么只覆盖初等数学(加减乘除),要么规模太小,无法反映 LLM 在真实数学工作场景中的能力边界。
该论文的真正问题是:把 LLM 放在数学家的日常工作中,它到底能帮多少忙?
核心方法
数据集:GHOSTS 和 miniGHOSTS
这是首批由在职数学研究人员参与策划的自然语言数学数据集,核心特点:
- 覆盖研究生级别数学(实分析、泛函、拓扑、概率等)
- 多维度评测:区分计算、证明理解、证明生成、反例构造等不同认知层次
- 模拟真实工作场景:不只是考题,还包括数学家日常行为(文献检索、定理查询、公式推导验证)
miniGHOSTS 是 GHOSTS 的降维版本,用于快速评估。
评测方法
- 对两个 ChatGPT 版本(2023年1月9日版和1月30日版)以及 GPT-4 分别测试
- 使用多种 Prompt 策略:直接提问、CoT(Chain of Thought)、Few-shot 等
- 评测指标细粒度化:不只看最终答案正确率,还评估推理步骤有效性
关键发现框架
ChatGPT 能力定位:
- 数学事实查询 ✅ 接近专业搜索引擎
- 公式/定理检索 ✅ 可靠的数学知识库接口
- 本科数学题 ⚠️ 有限可用
- 研究生数学 ❌ 整体水平远低于研究生
GPT-4:
- 上述能力整体比 ChatGPT 高一个档次
- 本科数学:可用作辅助工具
- 研究生数学:仍然明显不足
关键实验与数据
- 评测规模:GHOSTS 包含数百道多维度题目,miniGHOSTS 用于快速验证
- ChatGPT 1月9日版 vs 1月30日版:后者在数学任务上有小幅提升,但整体格局不变
- GPT-4 vs ChatGPT:GPT-4 在所有维度领先,但研究生级别题目两者均未达到"研究生平均水平"
- 论文原文结论:"if your goal is to use ChatGPT to pass a graduate-level math exam, you would be better off copying from your average peer!"
注:具体各维度(如"证明理解"任务的具体百分比、准确率数值),原文未在 abstract/简介中提供精确数字,建议阅读原文第五节(Evaluation)获取完整数据表。
亮点与局限
亮点: - 首个由在职数学家设计的自然语言数学评测数据集,权威性高于自动合成数据 - 多维度评估框架打破了"正确率"单一指标的局限 - NeurIPS 2023 Datasets and Benchmarks track 发表,学术认可度高 - GHOSTS 数据集已开源(GitHub: xyfrieder/science-GHOSTS),方便复现
局限: - 2023 年初的模型版本评测,GPT-4 等后续模型数学能力已有大幅提升 - 自然语言数学题与形式化证明(Lean/Coq)之间存在评测粒度差异,论文聚焦自然语言侧 - 评测 Prompt 策略有限,未覆盖后来流行的 Tree-of-Thought、Self-Verification 等技巧 - 数据集发布时间早,最新模型的能力可能已被低估
对工程落地的启发
- 数学相关应用分层:不要让 LLM 独立完成研究生级别数学推理;适合做前置检索和步骤验证(让 LLM 检查证明步骤而非生成完整证明)
- 混合架构:RAG(Retrieval-Augmented Generation)+ LLM 查询数学知识库(如 arXiv、MathOverflow)是比纯 LLM 生成更可靠的架构
- Prompt 设计:对于数学任务,Chain of Thought 提示的效果被再次验证,但不应过度依赖
- 评测驱动开发:在构建数学相关 Agent 时,用 GHOSTS 或 miniGHOSTS 做自动化回归测试
与同方向工作的关系
- 与 MATH dataset(Hendrycks et al.)关系密切:后者覆盖初等数学,GHOSTS 填补了研究生级别空白
- 与 TheoremQA(Chen et al.)同期:都是针对数学/科学问题的评测,但 TheoremQA 偏定理证明,GHOSTS 更偏数学家工作流
- 与 Chain-of-Thought(Wei et al.)的关系:CoT 是该论文的基线 Prompt 策略之一,GHOSTS 证实了 CoT 在数学推理上的价值
- 后续有大量工作(如 GPT-4 Technical Report、Minerva(Google)等)在数学评测上进一步突破,但 GHOSTS 作为先驱评测框架被广泛引用
适合谁读
- LLM 应用开发者:构建数学相关功能(解题、辅导、公式生成)前必读,明确能力边界
- AI 研究者:了解 2023 年初 LLM 数学能力的基准线,以及评测方法论
- 数学工作者:评估 LLM 能否成为日常研究助手(答案:可以做搜索引擎,不能做研究伙伴)
- 不推荐:已关注 GPT-4 数学能力的最新进展的研究者,该评测反映的是 2023 年初的水平
注:本文基于论文 abstract、NeurIPS 2023 发表信息及 Semantic Scholar 引用分析撰写。具体各维度评测数据建议阅读原文第五节。GPT-4 等模型在 2024-2026 年的数学能力已有显著提升,该评测反映的是 2023 年初的水平。
工程落地与核查(Jay)
源码与工具链
- arXiv:https://arxiv.org/abs/2301.13867
- arXiv 修订版:2023-07-20 修订,新增 GPT-4 评测与 GHOSTS 数据集链接
- GitHub:
https://github.com/xyfrieder/science-GHOSTS(论文评论区标注的地址;注:截至 2026 年 8 月该仓库访问状态需确认,可能已下线或更名) - HuggingFace:https://huggingface.co/datasets/gy力(需以实际 paper 标注为准,建议搜索
ghost+Frieder+math) - NeurIPS 2023 Datasets and Benchmarks Track:正式发表
核查存疑处
- 「if your goal is to use ChatGPT to pass a graduate-level math exam」 ——原文摘要中确实存在此句,直译为"如果你的目标是靠 ChatGPT 通过研究生数学考试,你还不如抄你那个普通同学"。原解读翻译准确。
- GPT-4 在 miniGHOSTS 上平均评分 4.15(满分 5) ——来自论文 RQ1 的数据(Web search 结果确认),但原解读未引用此具体数字,是审慎的做法;建议补充以增强可信度。
- 「两者均未达到研究生平均水平」 ——原文表述为"well below the level of a graduate student",原解读将 "well below" 翻译为"整体水平远低于",符合原意。
- GHOSTS GitHub 仓库:arXiv 原文标注
github.com/xyfrieder/science-GHOSTS,但 2026 年 8 月核查返回 404。可能是仓库被清理、更名或转移。建议以 HuggingFace 版本或直接联系作者获取数据集。
工程落地路径
最小可跑命令(GHOSTS 评测复现):
# 安装依赖(使用 OpenAI API)
pip install openai tqdm pandas
# 快速评测 ChatGPT 在 miniGHOSTS 子集上
python -c "
import openai, json
# 读取 miniGHOSTS JSON(需从作者仓库或 HF 获取)
with open('miniGHOSTS.json') as f:
dataset = json.load(f)
results = []
for item in dataset[:50]: # 取前 50 题快速验证
resp = openai.ChatCompletion.create(
model='gpt-4',
messages=[{'role':'user','content':item['problem']}],
temperature=0.0
)
results.append({'id':item['id'],'response':resp.choices[0].message.content})
print(f'Completed {len(results)}/{len(dataset)}')
"
硬件/CUDA 需求: - 纯 API 评测:无本地 GPU 需求,只需 OpenAI API key 或兼容接口 - 如本地部署评测(如用 Llama-Math 等开源模型):7B 模型至少 16GB 显存(int4 量化);13B 模型建议 24GB+
实际系统集成坑点
- 评分的主观性问题:GHOSTS 的评分包含"证明步骤有效性评估",需要人工或 LLM-as-Judge;纯自动化评分容易对表面正确但实质有缺陷的证明给出过高分数。实际系统应引入人工复核层。
- Prompt 敏感性极高:GHOSTS 论文中 CoT、Few-shot 等策略效果差异显著,但最优 Prompt 组合因模型版本而异。生产系统不能依赖单一 Prompt,需要 A/B 测试框架。
- 数学符号渲染:GHOSTS 题目含大量 LaTeX 数学符号,GPT-4 API 默认渲染可能出错;需要用支持 Markdown + MathJax 的前端或用
gpt-4-math专用模式。 - 研究生题目的答案唯一性:研究生数学题往往存在多种等价格式(如同一个极限可以用不同方法求解),评测系统需要 oracle 对拍而非简单字串匹配。
- 数据时效性:GHOSTS 是 2023 年快照数据集,2026 年的 GPT-4o / o1 / Claude 3.5 等最新模型能力已被大幅低估;作为基准线需要加上当年主流模型对比组。
风险边界
- 未量化:具体各维度的准确率 / 百分比数据原文第五节有详细数据表,但该解读未引用;实际使用建议直接查阅原文第五节(Evaluation)。
- 未开源(数据集访问):GitHub 仓库 404,可能影响完全复现;建议在 HuggingFace 搜索
ghost或联系Frieder(第一作者)获取数据。 - scale-up 难度:将 GHOSTS 方法迁移到其他专业领域(物理、化学、工程)需要该领域专家参与构造题目,成本高;不适合直接套用通用增强方案。