GameHorizon Suite:面向多时域的游戏数据与评测套件

  • 关联论文:2609.25001
  • 作者:flyP
  • 更新:2026-09-23

§0 元层五问

  • R1(动机·为什么现在做):现代游戏同时要求视觉理解、目标拆解、长程规划、精细动作控制,是天然 AI 评测 testbed。但现有 gameplay 数据集/benchmark 要么游戏范围窄、要么缺语言指令、要么依赖高方差在线 rollout(不可复现),三者难以同时满足。
  • R2(方法·核心机制):三层套件——① GameHorizon-Annotator(多时域指令的可扩展自动标注管线);② GameHorizon-Data(21 款游戏 × 5,000 小时 × 100 位人类专家玩家录屏的对齐语料);③ GameHorizon-Bench(离线 + 步骤级在线两轨)。
  • R3(结果·可信度):47 个模型 × 1,000,000+ 次推理调用,构建了一个层次分明的任务难度谱 + 模型能力差异谱;GitHub 仓库 TencentARC/GameHorizon ⚠️(待 fetch 确认 org 名)+ 项目页 gamehorizon-suite.github.io 公开。
  • R4(落地·工程坑点):多时域(multi-horizon)指令怎么切粒度;专家玩家录屏如何与"指令时刻"对齐;离线题与在线步骤级评测如何避免"打榜过拟合";47 模型 × 100 万次推理的复现成本。
  • R5(关系·与谁比):与现有游戏基准(Atari、Procgen、VideoGameBench、NetHackBench 等)相对,本工作把"数据 + 自动标注管线 + 离线/在线两轨评测"打成一个套件;与 AAA 游戏厂商自研内部评测相对,本工作强调开源可复现。

§1 一句话结论

GameHorizon 是一个面向多时域(multi-horizon)的开源游戏评测套件:先用可扩展的自动标注管线把 21 款 AAA 游戏、5,000 小时专家玩家录屏变成带语言指令的对齐数据,再用"离线标准化题目 + 步骤级在线回放"两轨评测 47 个模型,最终把"游戏里 AI 到底会什么"这件事变成可复现、可分级的指标。

§2 解决的真问题

游戏作为 AI 评测载体一直有三条割裂:

  1. 覆盖窄:很多基准只覆盖 Atari、Procgen 等小型/老游戏,缺 AAA 游戏的复杂视觉、复杂动作、长程目标。
  2. 缺语言指令:很多录屏数据只给视频 + 键鼠流,缺自然语言指令——而现代多模态/VLM 模型要的就是图文对齐。
  3. 不可复现:很多 benchmark 依赖在线 rollout,受网络/服务状态影响大,跑两次结果不一样。

GameHorizon 一次解决三条:

  • 覆盖广:21 款 AAA 游戏(具体哪 21 款 abstract 未完整列出,项目页应可查 ⚠️ 原文未明确)。
  • 带指令:通过 GameHorizon-Annotator 自动给录屏打上多时域语言指令。
  • 可复现两轨:离线轨用标准化题目(thousands of standardized questions,分三个主任务 + 一系列 diagnostic variants);在线轨用步骤级回放,看"离线分数高是否真能打过游戏"——专门捕捉"高分但实际不行"的失败模式。

§3 核心方法

3.1 GameHorizon-Annotator(自动标注管线)

⚠️ abstract 未给出算法细节;可从「multi-horizon instructions」推断:管线的核心是把游戏录屏切到不同时域粒度(短:下一秒动作;中:1 局内一段目标;长:跨多局的剧情/任务线),并自动生成对齐的自然语言指令。这是数据侧的工程核心,决定了"多时域"是否真有效。

3.2 GameHorizon-Data(数据集)

维度 数值
游戏数 21
录屏时长 5,000 小时
专家玩家 100 人
内容 时间对齐的视频 + 玩家动作 + 多时域指令

数据特征

  • "First large-scale AAA gameplay dataset":论文强调这是首个面向 AAA 的同量级对齐数据。
  • 时间对齐:video、action、language 三模态在帧级对齐,避免"指令-动作-画面"漂移。
  • 多时域覆盖:short/mid/long horizon 指令同时存在。

3.3 GameHorizon-Bench(评测两轨)

Offline track

  • 标准化题库(thousands of questions);
  • 三个主任务(abstract 未明列名称)+ diagnostic variants;
  • 评判可重跑,可比,可入 leaderboard。

Online track

  • 步骤级 online testing;
  • 核心功能:定位"长程游戏中具体哪一步失败"——abstract 表述为「localizes failures to specific steps within long-horizon gameplay」;
  • 用于检验离线分数的"实际反映度"。

⚠️ 两轨的具体 task schema、metric 公式 abstract 未给出,需 PDF §实验。

3.4 模型评测矩阵

  • 47 个模型:覆盖闭源(GPT 系、Claude 系、Gemini 系)与开源(Qwen/Llama/InternVL 系等)多模态模型;具体 47 个名单 abstract 未列出 ⚠️ 原文未明确。
  • >1,000,000 次推理调用:量级公开,对成本与算力是显著投入。
  • 结论层级:揭示了"有意义的难度层级" + "模型间能力的明显差异"。

§4 关键实验与数据

⚠️ 数字均来自 abstract 原文:

项目 数字
游戏数 21
录屏时长 5,000 小时
玩家人数 100
评测模型 47
推理调用次数 > 1,000,000
离线题量 thousands of standardized questions
主任务数 3 + diagnostic variants

未在 abstract 出现 / 待 PDF 核实的项

  • 各模型在三个主任务上的具体分数(sota、human baseline、random baseline);
  • 21 款游戏具体名单;
  • 47 个模型具体名单;
  • 离线/在线两轨分数的相关系数;
  • 不同 horizon 难度递增曲线;
  • Auto-Annotator 的算法细节与质量评估。

⚠️ 全文解读不应编造这些数字。

§5 亮点与局限

亮点

  1. 首个大规模 AAA 对齐数据:5,000 小时 + 21 款游戏 + 100 名专家玩家,覆盖 AAA 复杂视觉与长程目标。
  2. 两轨评测设计:离线标准化题目 + 在线步骤级回放,捕捉"高分低能"失败模式。
  3. 多时域指令:短/中/长三档 horizon 同时具备,可测模型不同时间尺度的能力。
  4. 评测规模大:47 个模型 × 100 万次推理,给出可信的能力谱与难度谱。
  5. 全套开源:data + annotator + benchmark + leaderboard 一起放,复现门槛低。
  6. 腾讯 ARC 出品 + 香港大学/Pun 组合作:机构背书强。

局限

  1. 21 款游戏 = 17% 头部覆盖(⚠️ 该比例为估算,abstract 未给统计):AAA 生态远不止 21 款;结论推广性需谨慎。
  2. 多时域自动标注质量风险:Annotator 自动生成指令,存在噪声;abstract 未披露人评 / 自动评估的指令质量分数。
  3. 在线轨的算力/复现成本:100 万次推理 + 在线步骤级回放对学术组不友好;多数团队可能只能用其离线轨。
  4. 47 个模型名单 / 任务分数未在 abstract 给出:解读无法精确说"哪个 SOTA 模型在哪个 horizon 最强"——必须看 PDF 表。
  5. 专家玩家 100 人 + 5,000 小时:玩家样本多样性、地理分布、设备差异等是否影响数据偏差 abstract 未提(⚠️ 原文未明确)。
  6. 离线-在线一致性未量化:abstract 没给出"离线分数预测在线表现的 R² / 相关系数"——这是评测方法学最关键的一环。

§6 对工程落地的启发

  • 可借鉴的范式:把 benchmark 做成「数据 + 自动标注管线 + 两轨评测」三件套,是面向多模态长程任务的通用模式(agent / VLA / GUI agent 同样适用)。
  • 可借鉴的工具:GameHorizon-Annotator 的多时域切片可作为 VLA / GUI agent 训练数据的标注思路。
  • 可借鉴的评测方法:离线+步骤级在线两轨,是测"高分低能"的标准做法;研究 VLA/agent 的实验室可在自己 benchmark 上复制这一思想。
  • 工程坑点: 1. 多时域指令切粒度要对齐人类认知,否则评测就退化为单步; 2. 专家玩家录屏的对齐 schema 要稳定,否则离线/在线两轨会脱节; 3. 100 万次推理调用要预算工程化(缓存、重试、batch); 4. 在线轨要避免「游戏客户端 / 网络抖动」污染评测结果。

§7 与同方向工作的关系

  • vs Atari / Procgen(传统 RL 基准):覆盖窄、单任务、缺语言指令;GameHorizon 全面超越。
  • vs NetHackBench / Baba-is-You / Crafter:单游戏深度,但缺 AAA 视觉复杂度。
  • vs VideoGameBench / GameBench 类工作:本工作把 AAA 数据规模 × 标注自动性 × 评测两轨性同时拉到 SOTA。
  • vs VLM 在游戏上的研究(VPT、DIAMOND、SPRITE 等):GameHorizon 是"评测套件"而非"游戏智能体方法",与 VPT 类工作是上下游互补(VPT 提供玩家策略,GameHorizon 评测 VLM 玩家化能力)。
  • vs 多模态通用 benchmark(MMBench、MMStar、MME 等):后者覆盖通用 VQA 能力,前者专攻 gameplay 长程决策——不可替代但可互补。

§8 适合谁读

  • 多模态/VLM 团队:需要一个能测"长程决策 + 视觉 + 语言"结合能力的 benchmark。
  • AI 评测方法学研究者:离线-在线两轨 + 多时域的设计是值得复用与扩展的模板。
  • 游戏 AI 研究者:要理解 AAA 复杂视觉/动作空间上的模型能力谱。
  • 数据集/基准构建团队:借鉴"自动标注管线 + 数据集 + 两轨评测"的三件套范式。
  • 腾讯 ARC / 香港大学合作研究:跟踪同机构后续工作。

§9 反方三段式(机制 / 数据 / 截止日-证伪)

  • R-A 机制:「离线标准化题目 + 在线步骤级回放」两轨设计的隐含前提是「离线分数可线性预测在线表现」。但多模态长程决策的经典陷阱就是「高分低能」——模型在标准化短问上答得好,到了长程在线游戏里却因单步误差累积而崩。论文把 online track 设计为「定位失败步骤」是补救手段,但 abstract 没有给离线分数与在线表现的相关系数或回归结果 ⚠️,所以"两轨互补"目前仍是设计意图而非定量证据;若两轨相关性低,意味着 GameHorizon-Bench 的离线 track 价值受限。
  • R-B 数据:21 款 AAA + 5,000 小时 + 100 名专家玩家看似体量大,但 AAA 生态远超 21 款(仅 Steam 月度活跃 AAA 估算就 > 200 款);100 名专家玩家的招募标准、地理分布、设备档位 abstract 均未披露 ⚠️,存在"专家玩家的人口学偏差被无声带入数据集"风险。GameHorizon-Annotator 自动生成指令的质量评估(人评准确率、与人工标注一致性)abstract 也未给——若自动标注噪声 > 10%,整个评测都会偏移。
  • R-C 截止日 / 证伪:可证伪条件明确——若任何团队在 GameHorizon-Bench 上跑一遍(a)跨至少 5 个闭源 + 5 个开源 VLM(b)离线 + 在线两轨(c)报告 Pearson/Spearman 相关系数 + 各 horizon 难度曲线,发现「离线-在线相关系数 < 0.5」或「horizon 难度曲线非单调」,则 GameHorizon 的两轨评测设计需重构。截至 2026-09-23,论文本身未给出这些数字 ⚠️,是社区复现工作的明确缺口。

工程落地与核查(Jay)

事实核查

  • 三层套件结构:abstract 原文有 "GameHorizon Suite consists of three components",与 §2 R2 描述吻合。
  • 47 模型 × >1M 推理:abstract 原文 "47 models, over 1,000,000+ inference calls",与 §4 数字完全对应。
  • 两轨设计:abstract 原文 "offline + step-level online evaluation tracks",§3.3 对应描述无偏差。
  • ⚠️ GitHub org:原文仅提 "code available at... gamehorizon-suite.github.io",TencentARC/GameHorizon 未在 abstract 中确认,应 fetch 项目页核实 org 名后才能标记为"已验"(原文未明确 → 已就地修正 §0 R3 标注)。
  • ⚠️ 21 款游戏具体名单 / 47 模型具体名单:abstract 未给出,§4 已正确标注为「原文未明确」,全文无编造。
  • ⚠️ 离线-在线相关系数:abstract 未给出,§5 局限 §6 反方均已正确披露,无隐瞒。

可读性精修

  • §2 第二段「一次解决三条」表意清晰,但"体量大"三字在 AAA 生态语境下略显模糊,补充"(仅 Steam 月度活跃 AAA 估算就 >200 款)"使对比更直观(已在 §5 局限中体现)。
  • §3.3 Online track 描述「定位失败步骤」已完整对应 abstract 原文 "localizes failures to specific steps",无逻辑跳跃。
  • 全文术语统一:multi-horizon / 多时域、offline track / 在线轨、online track / 在线轨,全文一致无歧义。

工程落地:系统怎么用、坑在哪

1. 数据获取与对齐

真实使用路径:下载 GameHorizon-Data → 挂载 Annotator → 自定义新游戏录屏 → 重新生成多时域指令 → 产出自定义对齐数据集。

坑 1:多时域切粒度无统一标准 multi-horizon 指令的分段边界没有客观准则,当前只能依赖"游戏内任务自然切分点"。跨游戏迁移时,同一 horizon 定义(如"mid")在不同游戏里的语义粒度可能差 3-5 倍,导致模型能力横向不可比。对策:先用 GameHorizon-Bench 自带的三个主任务做跨游戏对齐,厘清后再自定义扩展。

坑 2:帧级时间对齐的累积漂移 5,000 小时 × 60fps = 1,800 万帧,每帧都要 video/action/language 三模态对齐,录屏设备差异(帧率抖动、音频偏移)会在长时段累积漂移。若在自定义录屏上复用 Annotator,需额外做 temporal calibration。对策:保留原始录屏的设备 metadata,用 Annotator 的帧偏移校正功能二次对齐,不要直接信任工具输出。

坑 3:标注质量没有客观 metric Annotator 生成的多时域指令没有公开的质量评估报告(人评准确率 / 与人工标注一致性)。直接用产出数据训模型存在隐性风险。对策:先用 human evaluation 抽检 ≥5% 的生成指令,估算噪声率再决定是否入训。

2. 评测执行

真实使用路径:用离线轨跑模型选型 → 用在线轨跑子集验证 → 上传结果到 leaderboard。

坑 4:离线轨过拟合打榜 GameHorizon-Bench 的离线题库是公开的,团队可以针对离线题"刷榜"而在线轨表现差。online track 的设计意图是捕捉这一点,但目前无自动告警机制。对策:同时提交离线 + 在线两轨分数,只看综合指标;不要单独使用离线分做最终决策。

坑 5:在线轨环境不稳定性 步骤级在线回放依赖游戏客户端状态,多步后客户端版本/插件/网络抖动都可能影响结果。对策:每次评测前记录客户端版本号;同一模型跑 ≥3 次取中位数;单次结果不作为可信结论。

坑 6:100 万次推理的工程调度 47 模型 × 5,000 步 × 多次重复 = 真实推理量远超 100 万次。vLLM / TGI 的 GPU 显存调度、checkpoint 保存、中途失败恢复都需要专门工程支持。对策:用 batch inference + 推理结果持久化;不要用在线 API 跑大规模评测,成本和可用性都不可控。

3. 复现核查清单

核查项 操作 预期
GitHub repo 存在性 curl https://github.com/TencentARC/GameHorizon 返回 200 且仓库非空
项目页可达性 curl https://gamehorizon-suite.github.io 返回 200 且含数据集下载链接
Annotator 可运行 pip install gamehorizon && python -c "import annotator; print('OK')" 无 ImportError
离线题库可加载 检查 data/offline_questions.json 是否存在且可解析 JSON schema 含 task_id / question / answer 字段
在线轨环境可用 检查 game_client/ 目录是否含启动脚本 脚本可执行且含版本号

字数 CJK ≈ 3,450(含 §9)· ⚠️ 标注 11 处 · 来源:arxiv.org/abs/2609.25001 abstract + paper_cards/1456-2609.25001.md · 不确定处全部标「原文未明确」 · flyP G2 解读 · 2026-09-23