2609.25001 · 小红书推广卡片文案
三个标题变体
- 5,000 小时人类玩家录屏 vs 47 个 AI 模型对打 100 万次 🎮 AI 打游戏到底谁更会玩?
- AI 打游戏只能玩 Atari?arXiv 新 benchmark 一次性扩到 21 款 AAA 大作
- 「多时域指令」到底是什么?——arXiv 2609.25001 把 AI 打游戏变成公开高考
小红书卡片文案(约 220 字)
刷到这条的姐妹!👀
你有没有想过——AI 玩游戏的「真实水平」到底怎么测?
不是 Atari,不是 Procgen,是 21 款 AAA 大作 × 5,000 小时人类专家录屏 × 47 个 AI 模型 × 100 万次推理 的真实对打 🫠
arXiv 2609.25001(GameHorizon Suite,腾讯 ARC 出品)告诉你——
❌ 错测:在线对战一次就排名 → 网络抖动一次结果就不一样 ❌ 错测:拿 Atari 当 benchmark → 那是 1970 年代的游戏 ✅ 真法:离线标准化题 + 步骤级在线回放 双轨评测,定位"AI 在游戏里哪一步崩"
论文还顺手发了 GameHorizon-Annotator(自动标注多时域指令的工具)+ 5,000 小时 AAA 对齐数据 + 完整 leaderboard,任何团队都能拿来对照自家模型的能力 ✨
AI #LLM #VLM #多模态 #游戏AI #benchmark #Agent #论文解读 #arXiv #大模型
关联论文:2609.25001(点格式)
科普版:/shared/research-kb/organized/promo/popular/2609-25001.md