DiG-bench:纯文本科学发现能力评测基准 · 干货攻略

  • 链接: https://x.com/tri_dao/status/2087677140410290302
  • 分类: x-tips
  • 来源: X @tri_dao
  • 作者: Jay
  • 更新: 2026-08-19
  • 仓库: discos-research/dig-bench

这是什么

DiG-bench(Discovery in Games)是 2026 年 8 月 12 日由 James C.R. Whittington(牛津大学)联合多位学者发布的新型 AI 评测基准,全称 Discovery in Games

核心设计:70 个纯文本互动游戏,每个游戏内部有隐藏的「变换规则」,AI 智能体必须通过主动交互和实验来发现这些规则,然后将规则应用于解决关卡挑战。游戏目标本身也不告诉玩家——必须自己推断出来。

类比来说,这是一个「AI 科学家」评测:给模型一个陌生的文本环境,观察它能否像科学家一样提出假设、设计实验、验证规律。

为什么值得关注

Tri Dao(Flash Attention 作者、著名 AI 研究员)在 X 上评价 DiG-bench 时说:

"I really like this new benchmark. Has the flavor of ARC-AGI3 but it's pure text so you don't have to worry about the vision capability."

这精准点出了 DiG-bench 的价值:

  • 填补了发现能力评测的空白:现有 AI 基准大多测试「应用已有知识」的能力,而 DiG-bench 测试「通过实验发现新知识」的能力——这才是科学发现的核心。
  • 纯文本,绕过视觉 confound:与 ARC-AGI 3 的视觉谜题不同,DiG-bench 全部是文字游戏,直接测语言模型的推理与探索能力,不被视觉 SOTA 水平干扰。
  • 7 级难度梯度:最低级多个模型能解决,最高级连最强模型都有困难,动态范围大,适合区分能力边界。
  • 所有游戏人类首次尝试即可破解:说明题目本身对人类是可解的,基准不是「难题」,而是测「AI 是否具备真正的发现能力」。

核验过程

官方来源:

  1. arXiv 论文(2608.12593):确认 benchmark 名称、70 个游戏规模、7 级难度、公私分布(21 公开 + 49 私有 held-out)、所有游戏均经人类首次尝试验证可解。
  2. GitHub 仓库(discos-research/dig-bench):确认 MIT 许可证、baseline-harness 实现、支持 Gemini/Anthropic/OpenAI/SGLang 多提供商。
  3. digbench.ai 官网:确认 leaderboard 成绩和评测方法说明。

交叉验证:

  • BenchLM.ai 的 DiG-bench 专项页面(2026-08-14 更新)显示 Claude Opus 5 Basic Harness 以 68.5% 排名第一,与官网 leaderboard 数据一致(两者均显示 68.5%)。
  • Digg 科技频道和 LinkedIn 多位研究员(Michal Valko、Clare Maguire 等)转发了该 benchmark 发布公告,内容与官方描述吻合。

与原帖对照:

  • 原帖称「ARC-AGI3 风格但无视觉负担」——论文摘要明确说明测试「发现能力(discovery)」而非「视觉推理」,Tri Dao 本人也在论文作者列表中,此描述直接来自权威来源,原帖说法与官方一致

上手步骤

1. 安装基础评测工具

git clone https://github.com/discos-research/dig-bench.git
cd dig-bench

# 安装依赖(Python 3.10+)
pip install -e .

2. 运行基础 Harness 评测

仓库提供 baseline-harness,一个最小化的多提供商智能体:

cd baseline-harness
pip install -e .

# 配置 API key
export OPENAI_API_KEY="your-key"
export ANTHROPIC_API_KEY="your-key"

# 运行评测(以 Opus 5 为例)
python -m baseline_harness run \
    --model claude-opus-5 \
    --games P-1 P-2 P-3

3. 通过 API 评测(推荐用于大批量)

参考 digbench.ai 的 API 文档:

from digbench import DiGBench

benchmark = DiGBench(api_key="your-key")
result = benchmark.evaluate(
    model="claude-opus-5",
    games=["P-1", "P-5", "P-10"],  # 指定公开游戏
    max_steps=50
)
print(result.win_rate)

4. 查看公开 Leaderboard

访问 digbench.ai/leaderboard 可直接查看各模型在 Basic Harness 和 Agentic Harness(含 Prime Agent、Claude Code 等)下的成绩排名。

坑与适用边界

说明
私有游戏无法复现 70 个游戏中 49 个为 held-out private,论文仅在公开 21 个游戏上报告结果,大规模复现受限
API 访问可能限速 评测涉及多次交互(发现规则需要多轮),每个游戏可能消耗大量 token,建议提前确认 API 配额
step budget 影响结果 benchmark 对每个游戏有步数限制;不同 harness 的 budget 设置不同,跨 harness 横向比较需谨慎
Creative Mode 不计入步数 部分游戏提供「创意模式」允许无代价试错,合理利用此特性可提升胜率;需在 prompt 中告知模型此选项
人类基线并非全员可达 虽然所有游戏都有「至少一人」首次尝试通过,但不代表任意人类都能通过,评测设计偏向有科学思维的玩家

适用边界:

  • 适合评估「需要探索未知规则的 agentic LLM 系统」,不适合评测纯知识问答或固定任务执行。
  • 如果你的场景是「从已知的知识库中检索」,DiG-bench 不相关;如果是「在未知环境中通过实验学习」,DiG-bench 是目前最接近的评测。

一句话结论

DiG-bench 是目前最纯粹的「AI 发现能力」评测基准——70 个纯文本科学发现游戏,7 级难度,ARC-AGI3 的精神但去掉了视觉干扰,是检验 agent 是否真正具备主动探索与假设验证能力的硬核试金石。