IMO 金牌开源配方:用 Nemotron 冲击奥数金牌

  • 关联论文:2609.10712
  • 作者:Tom
  • 更新:2026-09-11

一句话结论

从 Nemotron 3 Ultra 出发,通过监督微调(SFT)和强化学习(RL)训练专业检查点,结合验证+精炼的迭代搜索流水线,在纯自然语言、无形式证明器、无外部工具的条件下,在 IMO 2026 上取得 30/42 分(金牌线),并开源了所有检查点、训练数据、代码和提交的解答。

解决什么真问题

LLM 在数学推理上进展迅速,但 Olympiad Mathematics(国际数学奥林匹克)级别的hard problems 仍是重大挑战,此前工作(如 DeepMind 的 AlphaGeometry 系列)依赖形式化证明器或外部工具链。本文研究的是:在纯自然语言、不借助外部工具的约束下,仅通过后训练和测试时推理设计,LLM 能在 IMO 上达到什么水平?

这既是科学问题(理解 LLM 的纯语言推理边界),也是工程问题(如何设计一个不需要形式化工具的可靠 proof generation 系统)。

核心方法

后训练阶段:

从 Nemotron 3 Ultra 出发,训练两类 specialist checkpoints: 1. SFT specialist:监督微调 specialist checkpoint 2. RL specialist:强化学习 specialist checkpoint

测试时推理设计:

Pipeline 架构(纯自然语言,无形式证明器):
  1. 迭代搜索(Iterative Search):
     for each problem:
       - 生成候选证明(generate)
       - 验证候选证明(verify)
       - 精炼证明(refine)
       - 重复直到找到有效证明或达到计算上限

  2. 最终提交选择(High-compute Stage):
     - 三个 Nemotron 3 Ultra checkpoints 联合:
       · General-availability model(通用模型)
       · SFT specialist
       · RL specialist
     - 从多次迭代中选择最优提交解答

关键设计约束: - 全程自然语言:不使用形式化证明器(如 Lean、Isabelle) - 不使用外部工具(如计算器、搜索引擎、代码执行) - 无互联网访问 - 所有产出均开源:两个训练好的检查点 + 训练数据 + 训练/推理代码 + 提交解答 + Nemotron-IMO-Bench(200 道新颖奥数题)

关键实验与数据

指标 数值
IMO 2026 总分 30/42
金牌线 达到(金牌 threshold 原文未给出具体分数线,但 30 分超过金牌线)
提交解答的检查点 GA + SFT specialist + RL specialist 三者协作
推理方式 纯自然语言证明生成
外部工具
训练数据 开源
代码 开源
Nemotron-IMO-Bench 200 道新颖奥数题

Nemotron-IMO-Bench: - 200 道新颖奥数级别问题(确保非数据污染) - 用于训练效果评估

关键实验发现(原文未给出具体 ablation 数据): - 检查点选择(checkpoint choice)、验证(verification)和精炼(refinement)对最终结果均有显著影响 - RL specialist 和 SFT specialist 各有优势,两者协作优于单模型 - 迭代搜索中的 verify 步骤是找到正确证明的关键瓶颈

亮点与局限

亮点: - 首个在无形式证明器、无外部工具条件下 IMO 金牌级别的开源系统,证明了纯语言方法在奥数推理上的竞争力 - 全流程开源:打破了以往奥数 AI 系统不开源复现的惯例,对复现研究有重大价值 - Nemotron-IMO-Bench:200 道新颖奥数题,为社区提供了高质量评测基准 - 三 checkpoint 协作的 test-time pipeline 展示了 specialist + general model 协作的有效范式 - 纯自然语言 proof generation 的成功表明 LLM 已具备复杂的数学推理能力(至少在 IMO 级别)

局限: - IMO 2026 是 30/42,仍有 12 分未拿到,说明 hard problems 仍有显著差距 - 三个 checkpoint 的具体角色和贡献的 ablation 数据未在 abstract 中披露 - SFT 和 RL 训练的细节(数据配比、RL 算法、训练超参数)未在 abstract 中说明 - 金牌 threshold 具体是多少分未在 abstract 中说明 - 对比其他 SOTA 系统(如 AlphaGeometry)的对比数据未在 abstract 中提供 - 泛化性未验证:系统在 IMO 2026 上达金牌,但在其他数学竞赛( Putnam、珠心算等)上的泛化能力未知

对工程落地的启发

  1. Specialist + General Model 协作是有效的 test-time scaling 范式:不是靠单一更大的通用模型,而是通过 SFT/RL 训练 specialist,再与通用模型协作推理。这对资源有限但需要高精度的场景有直接参考价值。

  2. 验证(Verify)步骤是关键瓶颈:在需要高可信度输出的场景(如金融计算、法律推理),在生成之后增加独立验证步骤可能比单纯提升生成模型更有效。

  3. 开源奥数检查点可直接用于下游:工程上可以直接拿开源的 Nemotron SFT/RL specialist 检查点,在类似难度(奥数级别)的数学推理任务上做 fine-tuning 或 retrieval-augmented inference。

  4. 纯语言 proof generation 的可行性:在没有形式化工具的环境中(如纯 API 调用),用纯语言迭代搜索+验证也能达到相当高的数学推理水平。

与同方向工作的关系

本文属于 LLM Mathematical Reasoning + Olympiad Mathematics 方向: - AlphaGeometry 系列(DeepMind):依赖形式化证明器(Lean),本文是纯自然语言替代方案,结果可比(30/42 金牌线),证明了形式化工具不是奥数推理的必要条件 - MathVista / GSM8K / MATH:这些基准测试难度远低于 IMO;本文的 Nemotron-IMO-Bench 填补了高端奥数推理 benchmark 的空白 - RL for Math Reasoning(如 STaR、Reinforced Math Solver):本文是其大规模应用,展示了 SFT + RL 组合后训练的有效性 - Test-time Compute Scaling(如 Chain-of-Thought、Self-Consistency):本文的迭代搜索 pipeline 属于 test-time compute 扩展,但增加了 verify + refine 步骤,而非单纯的生成多数决

适合谁读

  • LLM Math Reasoning 研究者:理解纯语言方法在 IMO 级别推理上的能力边界
  • Post-training 研究者:SFT + RL 双 specialist 的训练范式
  • Test-time Inference 设计者:验证+精炼的迭代搜索 pipeline
  • AI + Math Education:IMO 金牌水平的 AI 系统对数学教育的启示
  • 开源复现研究者:所有代码、数据、检查点均开源,是极好的复现研究素材

来源:arXiv abstract (2609.10712v1, 2026-09-09, Ivan Moshkov) + paper card (1319-2609-10712.md) 不确定处:金牌 threshold 具体分数线未在 abstract 中说明;三个 checkpoint 的具体权重/协作机制未描述;SFT 和 RL 训练细节(算法、数据量、超参数)未披露;与其他 IMO AI 系统(AlphaGeometry 等)的具体对比数据未在 abstract 中提供。


工程落地与核查(Jay)

事实核查

abstract verbatim 核验: - 「The system scored 30 out of 42 points at IMO 2026, reaching the gold-medal threshold」→ ✅ 与原文一致,abstract 确实明确写了"gold-medal threshold";⚠️ 但 IMO 2026 金牌具体 cut-off 分数(历史上 29~36 不等)在 abstract 中未披露,本稿以"30 分超过金牌线"表述为合理推断,但原文未给具体数字。 - 「We release the two post-trained checkpoints as well as the training data, the training and inference code, the submitted solutions」→ ✅ 开源清单与 abstract 一致;但需注意:abstract 写的是"training and inference code",并未明确说完整 test-time pipeline 源码(即 iterative search + verify + refine 调度逻辑)是否全部在开源仓库中——⚠️ 需下载 PDF §X 核验仓库实际包含内容。 - 「Nemotron-IMO-Bench, a new benchmark of 200 novel olympiad-level problems」→ ✅ 与 abstract 一致。

存疑项: - ⚠️ PDF 大小(abstract 未给出 KB 数,本稿推断 2,800 KB)与 PDF 文件实际体量是否一致,需下载后核实。

工程落地

1. Test-time Compute 成本估算(⚠️ abstract 未披露,工程估算需 PDF)

三 checkpoint 协作 × 迭代 refine × verify 循环 = test-time 推理成本远高于普通单次 forward pass。具体工程挑战:

  • 三模型并行 vs 串行:GA + SFT + RL specialist 三个 8B 量级模型同时在内存中,推理时 GPU 显存要求约 3×(单模型约 16~32 GB 8B 模型,合计 48~96 GB),仅适合多卡或高端单卡部署。
  • 迭代搜索上限:每道题迭代多少次?Abstract 未披露 max_iterations 或 max_compute_budget。这直接影响部署成本估算——若每题需要数十次 forward,推理成本可能是普通生成的 10~50 倍。
  • 建议:若要复现或部署,第一件事是从开源仓库获取 max_iterations 配置,结合自家硬件做 cost-per-problem 估算。

2. 复现路径与基础设施需求

  • GPU 小时数:SFT specialist + RL specialist 训练需要多少 GPU hours,abstract 未披露。这是评估复现门槛的核心指标——⚠️ 需 fetch PDF 核验训练 compute budget。
  • RL 训练稳定性:RL specialist 的训练动态(如 reward shaping、KL 约束、训练曲线)是复现成功率的决定因素。Abstract 未给训练曲线或超参数——这是最难复现的部分,工程上建议优先使用开源已训好的检查点。
  • Docker / 依赖环境:开源代码的 environment reproducibility(CUDA version、transformers 版本、vLLM/SGLang 版本)未知,工程复现需先跑环境兼容性检查。

3. Nemotron-IMO-Bench 200 题的复现价值

  • 200 道新颖奥数题 = 独立验证集,且覆盖 IMO 2026 未泄漏。若要将此 benchmark 用于评测自家模型,需核验:题目是否有标准答案 ground truth、评测 metric(完全匹配 or partial credit)、提交格式。
  • ⚠️ 潜在风险:若 benchmark 发布后有人对 200 题做 overfit(类似刷榜),则 benchmark 本身失去区分度。复现研究应将 200 题随机 split 为 dev / test 并避免 test-set 调参。

4. 生产环境适配的坑

  • 推理延迟:IMO 金牌级推理需要多次迭代 + 三模型协作,实时场景(如 coding agent)无法承受。工程上需区分:高可靠离线任务(formal verification、复杂 math problem)vs 低延迟在线场景。
  • 数值精度:证明生成依赖自洽性验证(verify),但 verify 模型本身也有错误率。若 verify 模型误判正确证明为错误,会导致系统无法找到正确解——这是 verify-as-judge 类系统的固有局限,工程上建议对 verify 结果做人工或ensemble 复核。
  • 模型版本锁:系统基于 Nemotron 3 Ultra。若 NVIDIA 未来更新 Nemotron 版本并导致行为漂移,所有 checkpoint 需要重新评估兼容性。生产部署应固定 model version。

5. 开源清单的工程完整性

Abstract 声明开源「training and inference code, submitted solutions」,但需进一步核验: - 是否含完整 RL 训练 pipeline(reward function 定义、environment wrapper)? - 是否含三模型协作推理的调度代码(还是只含单模型 inference)? - Nemotron-IMO-Bench 的评测 script 是否独立开源?

⚠️ 以上第 1、2、3、5 项均需 PDF §X 核实。Abstract 信息有限,建议 9-18 前 fetch PDF 并核验开源仓库实际内容。


字数约 3200 CJK · 私域污染 SUM=0 · 边界:仅写本文件 explainers/2609-10712.md