5,000 小时人类玩家录屏 + 47 个 AI 模型对打 100 万次:这套「游戏 AI 高考」凭什么改变一切

  • 关联论文:2609.25001

一句话故事

arXiv 2609.25001 (GameHorizon Suite) 是第一份把"AI 打游戏到底会什么"做成公开标准化考试的工程级 benchmark——用 21 款 AAA 游戏、5,000 小时人类专家录屏、47 个模型 × 100 万次推理的实测,告诉你"今天的 AI 在游戏里哪一步会崩、哪一段会骗人"。

如果你今天正在评测 AI 是不是"真的会玩游戏",你大概率被骗过——

你以为跑一个 Atari 就知道 AI 行不行,实则那是 1970 年代的游戏; 你以为模型能在 Reddit 上答出游戏攻略就懂游戏,实则攻略写得很溜,实际玩起来一秒死; 你以为跑个在线对战就能评测,实则网络抖动一次结果就不一样了; 你以为有 47 个模型都跑过同一套游戏就能排名,实则没人公开过录屏数据,你自己跑不起。

GameHorizon 一次解决三条: - 21 款当代 3A 大作 - 5,000 小时人类专家录屏 + 自动配齐自然语言指令 - 47 个模型 × 100 万次推理的离线 + 在线双轨评测

为什么这件事值得你关注

这事对以下几类人直接相关:

  • 🎮 游戏 AI 团队:想知道"我们的智能体到底在游戏哪一段会出错",而不是只拿一个聚合分数
  • 🤖 多模态 / VLM 研究员:需要测"长程决策 + 视觉 + 语言"结合能力,而不是单帧 VQA
  • 📊 AI 基准 / 评测方法学:学习"离线标准化题 + 步骤级在线回放"两轨评测设计
  • 🛠️ 数据工程:学习"自动标注管线 + 对齐数据集 + 评测套件"三件套范式
  • 🎓 学生 / 自学者:不用自己爬录屏、自己写 evaluator,直接拿现成数据 + 题库跑

GameHorizon 的三件套到底是什么

第一件套:GameHorizon-Annotator(自动标注管线)

录屏本身只是「像素+按下了什么键」。要变成 AI 能学的数据,需要给录屏贴上自然语言指令——「这局的目标是 5 分钟内收集 8 个金币」「30 秒内绕到敌人后方」「别在第三分钟换弹夹」。

这些指令有"短/中/长"三种时域粒度: - 短:下一秒动作(「左移 + 开火」) - 中:本局一段目标(「第 3 关先清完小怪再打 BOSS」) - 长:跨多局剧情(「这次练枪法是为了下周主线打最终 BOSS」)

Annotator 自动给录屏打齐这三个时域的指令,人类不用逐帧手标。

第二件套:GameHorizon-Data(数据集)

维度 数值
游戏数 21 款 AAA
录屏时长 5,000 小时
玩家人数 100 位人类专家
内容 时间对齐的视频 + 玩家动作 + 多时域指令

论文强调这是首个同量级的 AAA 游戏对齐数据——之前要么只能玩 Atari / Procgen 这种小老游戏,要么录屏里没自然语言指令。

第三件套:GameHorizon-Bench(双轨评测)

轨道 测什么 怎么测
离线轨 AI 对游戏机制的理解 几千道标准化题,三个主任务 + 一系列 diagnostic 变体
在线轨 AI 实际打游戏的水平 步骤级在线回放,定位"AI 在哪一步失败"

关键设计:两轨互补。离线轨分数高但在线轨上玩不好?——经典"高分低能"。GameHorizon 的在线轨就是专门抓这种"作弊分"。

关键数字:47 个模型 × 100 万次推理

论文实测了 47 个多模态 AI 模型,跑了超过 1,000,000 次推理调用,覆盖: - 闭源旗舰(GPT / Claude / Gemini 系) - 开源主流(Qwen / Llama / InternVL 系)

跑出来的东西有两个用途: 1. 难度谱:这 21 款游戏、几千道题,哪些简单、哪些难、难度怎么分布 2. 能力谱:这 47 个模型,在哪一类任务上强、哪一类弱,差距多大

—— 这两个谱系之前都是空白,今天起任何团队都可以拿来对照。

对工程落地的三条启发

1️⃣ 评测要"数据 + 自动标注 + 双轨"三件套:光有题库不够,要能自动从录屏生成数据;光有数据不够,要双轨(标准化题 + 在线回放)防止"高分低能"。

2️⃣ 多时域指令决定评测深度:只测"下一秒动作"测的是反应速度,测不到"整局策略"和"跨周目剧情"——多时域指令同时存在,是这套 benchmark 区别于前人最关键的设计。

3️⃣ 100 万次推理的工程预算不是梦:47 模型 × 多步推理 × 多次重复,需要 batch inference + 推理结果持久化 + 失败恢复,任何想复用这套 benchmark 的团队都要先把这些工程做扎实。

⚠️ 三个边界坑

  1. 21 款 AAA ≠ 全部 AAA:当代 AAA 生态远超 21 款(Steam 月度活跃 AAA 估算 > 200 款),结论推广性需谨慎。
  2. 在线轨的算力门槛:100 万次推理 + 在线步骤级回放对学术组不友好,多数团队可能只能用其离线轨。
  3. 离线-在线一致性未量化:论文没直接给出"离线分数预测在线表现"的相关系数,"两轨互补"目前仍是设计意图,不是定量保证。

🎯 你能立即做的事

  • AI 评测研究员:把离线 + 步骤级在线两轨设计复用到自己的 benchmark,抓住"高分低能"模式
  • 多模态团队:用 5,000 小时对齐语料做 SFT,跑 47 模型基线对照
  • Agent / VLA 团队:把 GameHorizon-Annotator 的"多时域切片"思路借到自己的轨迹标注上
  • 学生:直接拿现成数据 + 题库跑 leaderboard,不用自己爬录屏

📌 一句话总结:5,000 小时人类玩家录屏 + 47 个 AI 模型对打 100 万次——GameHorizon 第一次把"AI 打游戏到底会什么"做成可复现、可分级的公开考试,任何团队都能拿来对照自家模型的能力。

🔔 评论区聊聊:你团队做的多模态 AI 玩过 AAA 游戏吗?让它打黑神话 / 艾尔登法环 / 只狼,会在哪一段翻车?

AIGame #多模态 #VLM #AI评测 #benchmark #LLM #大模型 #游戏AI #Agent #数据集 #arXiv