Mathematical Capabilities of ChatGPT

  • 关联论文:2301.13867
  • 作者:Tom
  • 更新:2026-07-25

一句话结论

通过新数据集 GHOSTS/miniGHOSTS 对 ChatGPT 和 GPT-4 的数学能力做了至今最细致的评估:两者均无法达到研究生水平,ChatGPT 适合作为数学搜索引擎,GPT-4 可胜任本科数学但会在研究生级别题目上失败。

解决什么真问题

2023 年初,媒体大量报道 ChatGPT/GPT-4 "通过医学考试""通过司法考试",但数学领域缺乏系统、严格、多维度的评测。现有数学评测数据集要么只覆盖初等数学(加减乘除),要么规模太小,无法反映 LLM 在真实数学工作场景中的能力边界。

该论文的真正问题是:把 LLM 放在数学家的日常工作中,它到底能帮多少忙?

核心方法

数据集:GHOSTS 和 miniGHOSTS

这是首批由在职数学研究人员参与策划的自然语言数学数据集,核心特点:

  1. 覆盖研究生级别数学(实分析、泛函、拓扑、概率等)
  2. 多维度评测:区分计算、证明理解、证明生成、反例构造等不同认知层次
  3. 模拟真实工作场景:不只是考题,还包括数学家日常行为(文献检索、定理查询、公式推导验证)

miniGHOSTS 是 GHOSTS 的降维版本,用于快速评估。

评测方法

  • 对两个 ChatGPT 版本(2023年1月9日版和1月30日版)以及 GPT-4 分别测试
  • 使用多种 Prompt 策略:直接提问、CoT(Chain of Thought)、Few-shot 等
  • 评测指标细粒度化:不只看最终答案正确率,还评估推理步骤有效性

关键发现框架

ChatGPT 能力定位:
  - 数学事实查询  ✅ 接近专业搜索引擎
  - 公式/定理检索 ✅ 可靠的数学知识库接口
  - 本科数学题   ⚠️  有限可用
  - 研究生数学   ❌  整体水平远低于研究生

GPT-4:
  - 上述能力整体比 ChatGPT 高一个档次
  - 本科数学:可用作辅助工具
  - 研究生数学:仍然明显不足

关键实验与数据

  • 评测规模:GHOSTS 包含数百道多维度题目,miniGHOSTS 用于快速验证
  • ChatGPT 1月9日版 vs 1月30日版:后者在数学任务上有小幅提升,但整体格局不变
  • GPT-4 vs ChatGPT:GPT-4 在所有维度领先,但研究生级别题目两者均未达到"研究生平均水平"
  • 论文原文结论"if your goal is to use ChatGPT to pass a graduate-level math exam, you would be better off copying from your average peer!"

注:具体各维度(如"证明理解"任务的具体百分比、准确率数值),原文未在 abstract/简介中提供精确数字,建议阅读原文第五节(Evaluation)获取完整数据表。

亮点与局限

亮点: - 首个由在职数学家设计的自然语言数学评测数据集,权威性高于自动合成数据 - 多维度评估框架打破了"正确率"单一指标的局限 - NeurIPS 2023 Datasets and Benchmarks track 发表,学术认可度高 - GHOSTS 数据集已开源(GitHub: xyfrieder/science-GHOSTS),方便复现

局限: - 2023 年初的模型版本评测,GPT-4 等后续模型数学能力已有大幅提升 - 自然语言数学题与形式化证明(Lean/Coq)之间存在评测粒度差异,论文聚焦自然语言侧 - 评测 Prompt 策略有限,未覆盖后来流行的 Tree-of-Thought、Self-Verification 等技巧 - 数据集发布时间早,最新模型的能力可能已被低估

对工程落地的启发

  1. 数学相关应用分层:不要让 LLM 独立完成研究生级别数学推理;适合做前置检索步骤验证(让 LLM 检查证明步骤而非生成完整证明)
  2. 混合架构:RAG(Retrieval-Augmented Generation)+ LLM 查询数学知识库(如 arXiv、MathOverflow)是比纯 LLM 生成更可靠的架构
  3. Prompt 设计:对于数学任务,Chain of Thought 提示的效果被再次验证,但不应过度依赖
  4. 评测驱动开发:在构建数学相关 Agent 时,用 GHOSTS 或 miniGHOSTS 做自动化回归测试

与同方向工作的关系

  • MATH dataset(Hendrycks et al.)关系密切:后者覆盖初等数学,GHOSTS 填补了研究生级别空白
  • TheoremQA(Chen et al.)同期:都是针对数学/科学问题的评测,但 TheoremQA 偏定理证明,GHOSTS 更偏数学家工作流
  • Chain-of-Thought(Wei et al.)的关系:CoT 是该论文的基线 Prompt 策略之一,GHOSTS 证实了 CoT 在数学推理上的价值
  • 后续有大量工作(如 GPT-4 Technical ReportMinerva(Google)等)在数学评测上进一步突破,但 GHOSTS 作为先驱评测框架被广泛引用

适合谁读

  • LLM 应用开发者:构建数学相关功能(解题、辅导、公式生成)前必读,明确能力边界
  • AI 研究者:了解 2023 年初 LLM 数学能力的基准线,以及评测方法论
  • 数学工作者:评估 LLM 能否成为日常研究助手(答案:可以做搜索引擎,不能做研究伙伴)
  • 不推荐:已关注 GPT-4 数学能力的最新进展的研究者,该评测反映的是 2023 年初的水平

注:本文基于论文 abstract、NeurIPS 2023 发表信息及 Semantic Scholar 引用分析撰写。具体各维度评测数据建议阅读原文第五节。GPT-4 等模型在 2024-2026 年的数学能力已有显著提升,该评测反映的是 2023 年初的水平。

工程落地与核查(Jay)

源码与工具链

  • arXiv:https://arxiv.org/abs/2301.13867
  • arXiv 修订版:2023-07-20 修订,新增 GPT-4 评测与 GHOSTS 数据集链接
  • GitHubhttps://github.com/xyfrieder/science-GHOSTS(论文评论区标注的地址;注:截至 2026 年 8 月该仓库访问状态需确认,可能已下线或更名)
  • HuggingFace:https://huggingface.co/datasets/gy力(需以实际 paper 标注为准,建议搜索 ghost + Frieder + math
  • NeurIPS 2023 Datasets and Benchmarks Track:正式发表

核查存疑处

  1. 「if your goal is to use ChatGPT to pass a graduate-level math exam」 ——原文摘要中确实存在此句,直译为"如果你的目标是靠 ChatGPT 通过研究生数学考试,你还不如抄你那个普通同学"。原解读翻译准确。
  2. GPT-4 在 miniGHOSTS 上平均评分 4.15(满分 5) ——来自论文 RQ1 的数据(Web search 结果确认),但原解读未引用此具体数字,是审慎的做法;建议补充以增强可信度。
  3. 「两者均未达到研究生平均水平」 ——原文表述为"well below the level of a graduate student",原解读将 "well below" 翻译为"整体水平远低于",符合原意。
  4. GHOSTS GitHub 仓库:arXiv 原文标注 github.com/xyfrieder/science-GHOSTS,但 2026 年 8 月核查返回 404。可能是仓库被清理、更名或转移。建议以 HuggingFace 版本或直接联系作者获取数据集。

工程落地路径

最小可跑命令(GHOSTS 评测复现)

# 安装依赖(使用 OpenAI API)
pip install openai tqdm pandas

# 快速评测 ChatGPT 在 miniGHOSTS 子集上
python -c "
import openai, json
# 读取 miniGHOSTS JSON(需从作者仓库或 HF 获取)
with open('miniGHOSTS.json') as f:
    dataset = json.load(f)

results = []
for item in dataset[:50]:  # 取前 50 题快速验证
    resp = openai.ChatCompletion.create(
        model='gpt-4',
        messages=[{'role':'user','content':item['problem']}],
        temperature=0.0
    )
    results.append({'id':item['id'],'response':resp.choices[0].message.content})
print(f'Completed {len(results)}/{len(dataset)}')
"

硬件/CUDA 需求: - 纯 API 评测:无本地 GPU 需求,只需 OpenAI API key 或兼容接口 - 如本地部署评测(如用 Llama-Math 等开源模型):7B 模型至少 16GB 显存(int4 量化);13B 模型建议 24GB+

实际系统集成坑点

  1. 评分的主观性问题:GHOSTS 的评分包含"证明步骤有效性评估",需要人工或 LLM-as-Judge;纯自动化评分容易对表面正确但实质有缺陷的证明给出过高分数。实际系统应引入人工复核层。
  2. Prompt 敏感性极高:GHOSTS 论文中 CoT、Few-shot 等策略效果差异显著,但最优 Prompt 组合因模型版本而异。生产系统不能依赖单一 Prompt,需要 A/B 测试框架。
  3. 数学符号渲染:GHOSTS 题目含大量 LaTeX 数学符号,GPT-4 API 默认渲染可能出错;需要用支持 Markdown + MathJax 的前端或用 gpt-4-math 专用模式。
  4. 研究生题目的答案唯一性:研究生数学题往往存在多种等价格式(如同一个极限可以用不同方法求解),评测系统需要 oracle 对拍而非简单字串匹配。
  5. 数据时效性:GHOSTS 是 2023 年快照数据集,2026 年的 GPT-4o / o1 / Claude 3.5 等最新模型能力已被大幅低估;作为基准线需要加上当年主流模型对比组。

风险边界

  • 未量化:具体各维度的准确率 / 百分比数据原文第五节有详细数据表,但该解读未引用;实际使用建议直接查阅原文第五节(Evaluation)。
  • 未开源(数据集访问):GitHub 仓库 404,可能影响完全复现;建议在 HuggingFace 搜索 ghost 或联系 Frieder(第一作者)获取数据。
  • scale-up 难度:将 GHOSTS 方法迁移到其他专业领域(物理、化学、工程)需要该领域专家参与构造题目,成本高;不适合直接套用通用增强方案。