DiG-bench:纯文本科学发现能力评测基准 · 干货攻略
- 链接: https://x.com/tri_dao/status/2087677140410290302
- 分类: x-tips
- 来源: X @tri_dao
- 作者: Jay
- 更新: 2026-08-19
- 仓库: discos-research/dig-bench
这是什么
DiG-bench(Discovery in Games)是 2026 年 8 月 12 日由 James C.R. Whittington(牛津大学)联合多位学者发布的新型 AI 评测基准,全称 Discovery in Games。
核心设计:70 个纯文本互动游戏,每个游戏内部有隐藏的「变换规则」,AI 智能体必须通过主动交互和实验来发现这些规则,然后将规则应用于解决关卡挑战。游戏目标本身也不告诉玩家——必须自己推断出来。
类比来说,这是一个「AI 科学家」评测:给模型一个陌生的文本环境,观察它能否像科学家一样提出假设、设计实验、验证规律。
为什么值得关注
Tri Dao(Flash Attention 作者、著名 AI 研究员)在 X 上评价 DiG-bench 时说:
"I really like this new benchmark. Has the flavor of ARC-AGI3 but it's pure text so you don't have to worry about the vision capability."
这精准点出了 DiG-bench 的价值:
- 填补了发现能力评测的空白:现有 AI 基准大多测试「应用已有知识」的能力,而 DiG-bench 测试「通过实验发现新知识」的能力——这才是科学发现的核心。
- 纯文本,绕过视觉 confound:与 ARC-AGI 3 的视觉谜题不同,DiG-bench 全部是文字游戏,直接测语言模型的推理与探索能力,不被视觉 SOTA 水平干扰。
- 7 级难度梯度:最低级多个模型能解决,最高级连最强模型都有困难,动态范围大,适合区分能力边界。
- 所有游戏人类首次尝试即可破解:说明题目本身对人类是可解的,基准不是「难题」,而是测「AI 是否具备真正的发现能力」。
核验过程
官方来源:
- arXiv 论文(2608.12593):确认 benchmark 名称、70 个游戏规模、7 级难度、公私分布(21 公开 + 49 私有 held-out)、所有游戏均经人类首次尝试验证可解。
- GitHub 仓库(discos-research/dig-bench):确认 MIT 许可证、baseline-harness 实现、支持 Gemini/Anthropic/OpenAI/SGLang 多提供商。
- digbench.ai 官网:确认 leaderboard 成绩和评测方法说明。
交叉验证:
- BenchLM.ai 的 DiG-bench 专项页面(2026-08-14 更新)显示 Claude Opus 5 Basic Harness 以 68.5% 排名第一,与官网 leaderboard 数据一致(两者均显示 68.5%)。
- Digg 科技频道和 LinkedIn 多位研究员(Michal Valko、Clare Maguire 等)转发了该 benchmark 发布公告,内容与官方描述吻合。
与原帖对照:
- 原帖称「ARC-AGI3 风格但无视觉负担」——论文摘要明确说明测试「发现能力(discovery)」而非「视觉推理」,Tri Dao 本人也在论文作者列表中,此描述直接来自权威来源,原帖说法与官方一致。
上手步骤
1. 安装基础评测工具
git clone https://github.com/discos-research/dig-bench.git
cd dig-bench
# 安装依赖(Python 3.10+)
pip install -e .
2. 运行基础 Harness 评测
仓库提供 baseline-harness,一个最小化的多提供商智能体:
cd baseline-harness
pip install -e .
# 配置 API key
export OPENAI_API_KEY="your-key"
export ANTHROPIC_API_KEY="your-key"
# 运行评测(以 Opus 5 为例)
python -m baseline_harness run \
--model claude-opus-5 \
--games P-1 P-2 P-3
3. 通过 API 评测(推荐用于大批量)
参考 digbench.ai 的 API 文档:
from digbench import DiGBench
benchmark = DiGBench(api_key="your-key")
result = benchmark.evaluate(
model="claude-opus-5",
games=["P-1", "P-5", "P-10"], # 指定公开游戏
max_steps=50
)
print(result.win_rate)
4. 查看公开 Leaderboard
访问 digbench.ai/leaderboard 可直接查看各模型在 Basic Harness 和 Agentic Harness(含 Prime Agent、Claude Code 等)下的成绩排名。
坑与适用边界
| 坑 | 说明 |
|---|---|
| 私有游戏无法复现 | 70 个游戏中 49 个为 held-out private,论文仅在公开 21 个游戏上报告结果,大规模复现受限 |
| API 访问可能限速 | 评测涉及多次交互(发现规则需要多轮),每个游戏可能消耗大量 token,建议提前确认 API 配额 |
| step budget 影响结果 | benchmark 对每个游戏有步数限制;不同 harness 的 budget 设置不同,跨 harness 横向比较需谨慎 |
| Creative Mode 不计入步数 | 部分游戏提供「创意模式」允许无代价试错,合理利用此特性可提升胜率;需在 prompt 中告知模型此选项 |
| 人类基线并非全员可达 | 虽然所有游戏都有「至少一人」首次尝试通过,但不代表任意人类都能通过,评测设计偏向有科学思维的玩家 |
适用边界:
- 适合评估「需要探索未知规则的 agentic LLM 系统」,不适合评测纯知识问答或固定任务执行。
- 如果你的场景是「从已知的知识库中检索」,DiG-bench 不相关;如果是「在未知环境中通过实验学习」,DiG-bench 是目前最接近的评测。
一句话结论
DiG-bench 是目前最纯粹的「AI 发现能力」评测基准——70 个纯文本科学发现游戏,7 级难度,ARC-AGI3 的精神但去掉了视觉干扰,是检验 agent 是否真正具备主动探索与假设验证能力的硬核试金石。