OSWorld 2.0:长程真实世界任务评测计算机使用 Agent 的新基准 · 干货攻略

  • 链接: https://huggingface.co/papers/osworld2
  • 分类: x-tips
  • 来源: X @_akhaliq
  • 作者: Jay
  • 更新: 2026-08-06
  • 仓库: xlang-ai/OSWorld-V2

本攻略核验了原帖中的所有关键数字,均来自 OSWorld 2.0 官方 GitHub(xlang-ai/OSWorld-V2)、arXiv 论文摘要页(2606.29537)及 arXiv HTML 版本原始表格数据。Benchmark leaderboard 动态更新,当前 SOTA 已随新模型提交变化,文中标注了原始 paper 结果与最新榜单的区别。


这是什么

OSWorld 2.0 是 XLANG Lab 联合多所高校于 2026 年 6 月 26 日发布的 计算机使用 Agent 评测基准,在 GitHub(xlang-ai/OSWorld-V2)、arXiv(2606.29537)和 HuggingFace Papers 页同步上线。

核心设计:108 个长程真实世界计算机使用工作流,每个任务模拟人类真实使用电脑的场景(如写文档、填表格、浏览网页完成任务),需要 Agent 在一个完整的桌面环境里自主操作、观察结果、迭代行动,直到任务完成或达到步数上限。

对比 OSWorld 1.0 的核心升级:

维度 OSWorld 1.0 OSWorld 2.0
任务数 初步设定 108 个
人类完成中位时间 未披露 约 1.6 小时
平均工具调用次数(Claude Opus 4.7 max thinking) ~30 次 ~318 次(约 10× 复杂度提升)
主要挑战类型 GUI 控制、代码调试 跨源推理、隐状态推断、视觉空间精确性、动态环境等
步数上限(默认评测配置) 500 步 500 步

为什么值得关注

2026 年计算机使用 Agent 的「刷新」时刻

2025 年中,OSWorld 1.0 最佳成绩约 34.5%,随后在 14 个月内快速升至 ~85%,一度被认为接近人类水平(~72%)。OSWorld 2.0 发布后,最佳成绩跌回 20.6%——同一个领域,在同一研究团队手中,从饱和到归零,重新定义了什么才是真正难的计算机使用任务。

这个「刷新」揭示了一个关键问题:OSWorld 1.0 测的是「基本 GUI 操作能力」,OSWorld 2.0 测的是「在真实长程工作流中自主完成复杂目标的能力」。两者所需的能力集差异巨大。

官方定义的核心挑战现象

OSWorld 2.0 论文将任务中出现的挑战分为两类:

交互设计类挑战(Interaction-design Challenges): - Streaming Interaction:信息流式出现,Agent 需要持续追踪更新 - Dynamic Environments:操作会改变环境状态,Agent 需适应变化

Agent 模式类挑战(Agent-pattern Challenges): - Cross-source Reasoning(42.6% 的任务涉及):需要从多个来源综合信息 - Visual-spatial Precision(41.7%):需要精确操作 GUI 元素位置 - Implicit-state Inference(39.8%):需要从间接证据推断隐藏状态 - Multi-item State Tracking(39.8%):需要追踪多个并发状态项

为什么现有 Agent 在 OSWorld 2.0 仍然失败

论文 Abstract 原文总结:

Agents lose track of constraints, miss information that arrives mid-task, guess rather than ask the user, and skip verification, struggling most when a task hinges on hidden state they must recover.

这四个失败模式——约束丢失、信息遗漏、盲目猜测、跳过验证——是当前 Agent 架构的根本局限,不是简单加钱加推理步数能解决的。


核验过程

官方来源

  1. GitHub README(xlang-ai/OSWorld-V2):发布信息、环境搭建步骤、评测运行命令、benchmark release 版本控制机制
  2. arXiv 论文(2606.29537):Abstract 中的任务描述、工具调用次数对比、Claude Opus 4.8 / GPT-5.5 成绩
  3. arXiv HTML 版本(2606.29537v1):Table 3 原始表格,含二进制完成率(Binary %)、部分完成率(Partial %)、每任务成本、每任务工具调用数、每任务输出 token 数、每任务步数
  4. HuggingFace Papers(osworld2):论文发布信息与摘要

交叉验证结论

关键说法 官方来源 核对结论
108 个长程工作流 GitHub README / arXiv abstract ✅ 确认
人类完成中位时间约 1.6 小时 arXiv abstract ✅ 确认
Claude Opus 4.7 平均 ~318 次工具调用 vs OSWorld 1.0 约 ~30 次 arXiv abstract ✅ 确认
Claude Opus 4.8 + batched:500 步内 20.6% 二进制完成 / 54.8% 部分完成 arXiv Table 3 ✅ 确认
GPT-5.5:~13% 二进制完成,效率更高(~39K output tokens vs ~224K) arXiv Table 3 ✅ 确认
发布日期 2026-06-26 GitHub README ✅ 确认
benchmark release: osworld-v2-2026.06.24 GitHub README ✅ 确认
Python >= 3.12 GitHub README(pyproject.toml) ✅ 确认
最新 leaderboard(August 2026):Claude Opus 5 排名第一 BenchLM.ai OSWorld 2.0 页面 ⚠️ 动态更新:原 paper 披露最高为 20.6%(Opus 4.8),8 月榜单 Opus 5 达 70.6%,反映模型能力随时间快速提升

上手步骤

1. 环境要求

  • Python >= 3.12
  • 支持的 Provider:Docker(Linux + KVM 推荐)、AWS(大规模并行评测)、VMware / Azure / GCP / Aliyun / Volcengine(镜像需自行适配)
  • 需要访问 HuggingFace gated datasets(xlangai/osworld_v2_tasksxlangai/osworld_v2_assets_gated

2. 克隆仓库并安装依赖

git clone https://github.com/xlang-ai/OSWorld-V2
cd OSWorld-V2

# 安装基础依赖
uv sync

# 如需完整依赖(OCR / 重型 Agent / V1 任务)
uv sync --extra full

3. 接受 HuggingFace Gated Access

访问以下两个 gated datasets 并接受请求(自动审批):

  • https://huggingface.co/datasets/xlangai/osworld_v2_tasks
  • https://huggingface.co/datasets/xlangai/osworld_v2_assets_gated

本地登录:

uvx --from huggingface_hub hf auth login

4. 下载任务类文件(使用指定 benchmark release)

uv run scripts/tools/download_osworld_v2_tasks.py --benchmark-release osworld-v2-2026.06.24

⚠️ 版本控制铁律:OSWorld 2.0 使用严格的版本控制。评测必须使用 osworld-v2-2026.06.24 release 的所有组件(代码 + 任务文件 + 资产 + Mock 网站),混用不同版本会导致结果不可比。

5. 配置 Provider

Docker(推荐本地评测):

# Docker provider,runner 命令加 --provider_name docker
uv run python run.py --provider_name docker --task_ids [your-task-id]

AWS:

需要在 client VM 安全组中额外开放端口 3000 和 8000(见 Provider Setup)。

6. 配置 Mock 网站(V2 部分任务需要)

使用 OSWorld 团队托管的服务:

export WEBSITE_HOST_SUFFIX="web.hku.icu"

或自托管(GitLab 任务必须自托管,因需要私有 token):

# 克隆 Mock 网站仓库
git clone https://github.com/Task-Web/OSWorld-web
cd OSWorld-web
git checkout v2026.06.24

export WEBSITE_HOST_SUFFIX="<your-host-suffix>"

7. 运行评测(示例:跑单个任务)

uv run python run.py \
  --provider_name docker \
  --task_ids example \
  --agent_config "claude-opus-4.8" \
  --max-steps 500

8. 查看轨迹

  • 在线可视化:https://osworld-v2-monitor.xlang.ai/
  • 轨迹下载:https://huggingface.co/datasets/xlangai/osworld2.0-trajectory

坑与适用边界

1. 版本混用是结果不可比的最常见原因

OSWorld 2.0 的 benchmark release 机制极为严格。README 明确警告「Do not mix releases or replace a pinned tag with main or latest」。即便主分支代码更新了,只要做正式评测,就必须 checkout 到 v2026.06.24 并配合对应版本的 task files、assets 和 mock 网站。

2. HuggingFace Gated Access 首次使用需申请

xlangai/osworld_v2_tasksxlangai/osworld_v2_assets_gated 是 gated datasets,不登录 HuggingFace 或不 accepted access request,评测脚本会静默失败。先申请 access,再运行评测

3. GitLab 任务无法使用团队托管服务

README 明确:GitLab 任务必须自托管,因为 GitLab-backed tasks 需要私有 token,共享 token 有安全风险。相关环境变量:

export GITLAB_URL="<your-gitlab-url>"
export GITLAB_PRIVATE_TOKEN="<your-private-token>"

4. 生产级评测的云成本

每个任务平均需要 ~244K output tokens(Claude Opus 4.8 batched),按 $25/M output tokens 计算,每任务约 $6.1(仅模型成本),加上 Docker/AWS 基础设施费用,大规模评测成本不可忽视。GPT-5.5 每任务 ~$0.98,更适合初步快速实验。

5. 评测结果 ≠ 真实场景表现

OSWorld 2.0 评测的是特定任务集下的计算机使用能力。论文中提到的四大失败模式(约束丢失、信息遗漏、盲目猜测、跳过验证)在论文环境下被充分暴露,但具体数字(20.6% vs 54.8% partial)是 500 步、batch action 等特定配置下的结果。生产系统评估需要结合实际场景。

6. Leaderboard 动态更新

原 paper(June 2026)最高分为 Claude Opus 4.8 的 20.6%(batched,500 步),但截至 2026 年 8 月,Claude Opus 5 已达 70.6%,GPT-5.6 Sol 达 62.6%。这说明:1)模型能力快速提升;2)排行榜本身在随新提交更新。引用 OSWorld 2.0 结果时须注明是哪一版、哪个模型的结果


一句话结论

OSWorld 2.0 用 108 个平均需 1.6 小时、318 次工具调用的真实长程工作流,把计算机使用 Agent 的评测难度重新拉回到 20.6% 的「未解决」区间——在这个基准被攻破之前,任何在 OSWorld 1.0 上自称「接近人类水平」的 Agent 系统都需要打上一个大大的问号。