无尽之试:迈向超智能的数学构造基准

  • 关联论文:2609.24555
  • 作者:flyP
  • 更新:2026-10-02

一句话结论:把数学「构造题」做成可自动校验、可参数化扩展、可对比已发表前沿的连续得分基准,让模型在被超越之前先被精确测量。


一、解决的真问题

现有数学 benchmark 普遍只能给二元对错(做对/做错),在两类场景失效:

  1. 前沿饱和陷阱:当一道题被最强模型刷到 100%,benchmark 失去区分度,再进步也看不到。
  2. 构造题无量尺:图论极值、组合设计、代数扩张、几何装填这类「构造比证明更难」的题目,传统 0/1 评分无法体现「我比已知最好的构造多了多少」。

The Endless Exam 的设计目标是:构造一道「无尽之试」—— 既是考试,也能持续延伸,且每次答卷都能用连续分数告诉你相对已知前沿走了多远。它面向「超智能」叙事,给出一种不依赖单点满分、而依赖「不断突破基线」的评估曲线。


二、核心方法

2.1 十四族参数化构造题

benchmark 涵盖 14 个数学构造族,每族都是「参数可调、答案可验」的开放问题域。论文强调的关键词是「parameterised families」,即同一族题目通过调参生成更大规模实例,形成规模-质量曲线(size-quality curves)。

论文未在 abstract 列出全部 14 族名称;从摘要与 v2 描述可推断典型形态应包含:组合设计(设计存在性 + 构造)、图/超图极值构造、代数对象扩张、几何装填 / 球堆积类等。具体族清单与定义以原文 §2 为准,本文不强行枚举。

2.2 验证与连续打分机制

每条提交对象都会走两阶段:

  • 自动有效性检查:通过 verifier 验证构造是否合法(满足约束、不越界、可结构化检查)。
  • 相对质量分:与「已发表前沿」或「已知构造基线」对比,给出相对分数,且不把改进上限设为 1(即可以超过 1.0 表达「已超越已发表前沿」)。

关键设计:

  • 「published frontier / construction baseline」:每族绑定一个或多个权威构造结果作锚点,让分数有可解释的相对坐标。
  • 「compact certificates」:对大型构造,不必列出全部元素也能验证(用证明证书/哈希承诺/校验子结构等手段),解决「构造规模一大就连验证都跑不动」的工程问题。
  • 「endless」机制:从开放数学问题中汲取长期挑战,并通过参数变化自动生成更大实例——题库不会被刷穿。

2.3 评估套件 bench-v1.0

v2 版本声明「Uses the unchanged bench-v1.0 evaluation suite」,意味着评估协议稳定,可复现性优先于频繁变动。这对横向对比与持续追踪是关键。


三、关键实验与数据

  • 模型数:9 个模型参与评估。
  • 题目规模:69 个 distinct instances(分布于 14 族)。
  • 前沿锚点:30 个 published-frontier references,覆盖被评测族的关键构造结果。
  • 主要发现:
  • 在 9 个被测模型上,没有任何一个模型超越 30 个已发表前沿参考中的任何一个——也就是说,今天的 SOTA 在「构造相对前沿」这件事上整体落后于公开记录的最优构造。
  • 连续分数能在 0/1 打分同分的区间内进一步拉开差距:即传统 0/1 评测看起来都「没做出」的两道题,本 benchmark 能告诉你「这道做了 60%、那道做了 83%」。
  • 规模-质量曲线:随问题规模放大,构造质量呈现可观察的衰减或饱和形态,这本身是诊断模型「构造上限」的工具。
  • v2 增量:加入 Claude Opus 5.5 评测、澄清 reference 基线与验证限制、修订呈现。

上述数字(9/69/30/14)来自 abstract 与 v2 描述。具体每族族名、每模型具体分数、各族 size-quality 曲线斜率原文未在 abstract 给出,以正文 §X 表为准。


四、亮点与局限

亮点

  1. 从二元打分跃迁到连续相对打分:避免 SOTA 饱和陷阱,让「快接近前沿」与「已经超过前沿」能被同时识别。
  2. 「endless」参数化扩题:题库理论上不会被刷穿,长期可作为 AGI 路线追踪器。
  3. 紧凑证书:让大型构造的验证可负担,避免「构造越大、验证越贵、连评测都跑不动」的死局。
  4. 公开生态:release generators、verifiers、references、model responses 与 analysis,复现门槛低。
  5. 明确「无模型超越已发表前沿」的诚实结论:不夸大、不修饰。

局限(诚实标注)

  1. 覆盖偏窄:14 族无法代表数学构造的全貌;偏组合/代数构造风格,几何与分析类构造覆盖如何 原文未明确。
  2. 构造 ≠ 证明:本 benchmark 测的是「构造给定数学对象的质量」,并不直接测证明能力;「数学超智能」若包含证明,仍需与其他证明评测互补。
  3. 基线依赖:30 个 published frontier 本身的选取与时效性会决定分数意义——若前沿参考更新,分数语义也会漂移。
  4. 9 模型样本量偏小:要得出「今天的 SOTA 仍落后人类前沿」的强结论,模型与族-问题组合的多样性仍可扩大。
  5. 验证成本可观察:即便有 compact certificates,对超大参数实例,验证仍可能成为瓶颈——论文未给出 verifier 的具体时间/算力成本数据。

五、对工程落地的启发

  1. 可迁移的「相对打分」模式:任何「超越基线」型评估(编码、推理、写作)都可借鉴「不封顶 1.0 + 锚定公开前沿」的做法,把饱和问题转换成进展问题。
  2. 参数化 + 证书化的评测工业化路径:参数化生成实例 + 紧凑证书验证 = 可大规模、可复现、可扩展的评测基础设施模板。
  3. 持续追踪而非一次性榜单:bench-v1.0 不变 + 实例可扩 = 给长期模型能力追踪提供了一个稳定参照系,类似 LMArena 的思路但锚点换成了「数学前沿」。
  4. 工程落地的具体坑点(基于 lessons W39 要求,每坑三段式):
# 现象 影响 修复
1 构造验证在大规模实例上变慢 评测 wall-clock 不可控 用 compact certificates + 并行验证器,先在小规模子集上预算时
2 前沿基线随新论文更新 旧分数语义漂移 给每次基线更新打 timestamp,报告中同时报告「相对 2024-Q1 前沿」与「相对最新前沿」
3 不同 verifier 对同一构造判定不一致 模型间不可比 固定 verifier 版本号 + bench-v1.0 锁定,升级需独立版本
4 0/1 打分掩盖「接近但未到」的进步 评测激励错位 引入连续质量分作为主指标,0/1 作为辅助
5 题库被刷穿风险(即便 endless 也有上限) 长期 benchmark 衰退 定期追加新族 + 调高参数上界,把「endless」机制做成 CI 流水线

六、与同方向工作的关系

  • vs FrontierMath / MATH / GSM8K:这些偏证明或闭式问答,0/1 评分;Endless Exam 走构造路线并以「相对前沿连续分」区别于它们。
  • vs BIG-Bench / MMLU 的持续扩展版:题库扩展逻辑类似,但 Endless Exam 把扩展机制直接参数化进 benchmark,而非人工追加。
  • vs ARC-AGI:ARC 关注通用推理、抽象网格;Endless Exam 把焦点收窄到「数学构造」一类任务上,纵深更大、覆盖更窄。
  • vs AlphaProof / AlphaGeometry 类系统级工作:本 benchmark 是评测侧,不是解题侧;但发布的所有 model responses 也为这类系统提供对照参考。

七、适合谁读

  • 大模型评测研究者:寻找「不会饱和」的长期数学评测范式的人。
  • AGI/超智能路线图作者:需要可追踪、可证伪的能力进展指标的人。
  • 数学构造与组合方向研究者:关心模型是否能产出可发表级别数学对象的人。
  • Agent / 工具使用研究者:把构造任务作为多步搜索 + 形式化验证的 testbed。
  • 基础设施工程师:关心参数化评测 + 证书验证 + 长期可比基线的工程范式的人。

边界声明:本文所有数字(14 / 9 / 69 / 30)来自 arxiv abstract 与 v2 版本说明。具体族名清单、各模型具体得分、size-quality 曲线斜率均以原论文 §2/§4 表格为准,本文未直接核验 PDF 内文。