OSWorld 2.0:长程真实世界任务评测计算机使用 Agent 的新基准 · 干货攻略
- 链接: https://huggingface.co/papers/osworld2
- 分类: x-tips
- 来源: X @_akhaliq
- 作者: Jay
- 更新: 2026-08-06
- 仓库: xlang-ai/OSWorld-V2
本攻略核验了原帖中的所有关键数字,均来自 OSWorld 2.0 官方 GitHub(xlang-ai/OSWorld-V2)、arXiv 论文摘要页(2606.29537)及 arXiv HTML 版本原始表格数据。Benchmark leaderboard 动态更新,当前 SOTA 已随新模型提交变化,文中标注了原始 paper 结果与最新榜单的区别。
这是什么
OSWorld 2.0 是 XLANG Lab 联合多所高校于 2026 年 6 月 26 日发布的 计算机使用 Agent 评测基准,在 GitHub(xlang-ai/OSWorld-V2)、arXiv(2606.29537)和 HuggingFace Papers 页同步上线。
核心设计:108 个长程真实世界计算机使用工作流,每个任务模拟人类真实使用电脑的场景(如写文档、填表格、浏览网页完成任务),需要 Agent 在一个完整的桌面环境里自主操作、观察结果、迭代行动,直到任务完成或达到步数上限。
对比 OSWorld 1.0 的核心升级:
| 维度 | OSWorld 1.0 | OSWorld 2.0 |
|---|---|---|
| 任务数 | 初步设定 | 108 个 |
| 人类完成中位时间 | 未披露 | 约 1.6 小时 |
| 平均工具调用次数(Claude Opus 4.7 max thinking) | ~30 次 | ~318 次(约 10× 复杂度提升) |
| 主要挑战类型 | GUI 控制、代码调试 | 跨源推理、隐状态推断、视觉空间精确性、动态环境等 |
| 步数上限(默认评测配置) | 500 步 | 500 步 |
为什么值得关注
2026 年计算机使用 Agent 的「刷新」时刻
2025 年中,OSWorld 1.0 最佳成绩约 34.5%,随后在 14 个月内快速升至 ~85%,一度被认为接近人类水平(~72%)。OSWorld 2.0 发布后,最佳成绩跌回 20.6%——同一个领域,在同一研究团队手中,从饱和到归零,重新定义了什么才是真正难的计算机使用任务。
这个「刷新」揭示了一个关键问题:OSWorld 1.0 测的是「基本 GUI 操作能力」,OSWorld 2.0 测的是「在真实长程工作流中自主完成复杂目标的能力」。两者所需的能力集差异巨大。
官方定义的核心挑战现象
OSWorld 2.0 论文将任务中出现的挑战分为两类:
交互设计类挑战(Interaction-design Challenges): - Streaming Interaction:信息流式出现,Agent 需要持续追踪更新 - Dynamic Environments:操作会改变环境状态,Agent 需适应变化
Agent 模式类挑战(Agent-pattern Challenges): - Cross-source Reasoning(42.6% 的任务涉及):需要从多个来源综合信息 - Visual-spatial Precision(41.7%):需要精确操作 GUI 元素位置 - Implicit-state Inference(39.8%):需要从间接证据推断隐藏状态 - Multi-item State Tracking(39.8%):需要追踪多个并发状态项
为什么现有 Agent 在 OSWorld 2.0 仍然失败
论文 Abstract 原文总结:
Agents lose track of constraints, miss information that arrives mid-task, guess rather than ask the user, and skip verification, struggling most when a task hinges on hidden state they must recover.
这四个失败模式——约束丢失、信息遗漏、盲目猜测、跳过验证——是当前 Agent 架构的根本局限,不是简单加钱加推理步数能解决的。
核验过程
官方来源
- GitHub README(xlang-ai/OSWorld-V2):发布信息、环境搭建步骤、评测运行命令、benchmark release 版本控制机制
- arXiv 论文(2606.29537):Abstract 中的任务描述、工具调用次数对比、Claude Opus 4.8 / GPT-5.5 成绩
- arXiv HTML 版本(2606.29537v1):Table 3 原始表格,含二进制完成率(Binary %)、部分完成率(Partial %)、每任务成本、每任务工具调用数、每任务输出 token 数、每任务步数
- HuggingFace Papers(osworld2):论文发布信息与摘要
交叉验证结论
| 关键说法 | 官方来源 | 核对结论 |
|---|---|---|
| 108 个长程工作流 | GitHub README / arXiv abstract | ✅ 确认 |
| 人类完成中位时间约 1.6 小时 | arXiv abstract | ✅ 确认 |
| Claude Opus 4.7 平均 ~318 次工具调用 vs OSWorld 1.0 约 ~30 次 | arXiv abstract | ✅ 确认 |
| Claude Opus 4.8 + batched:500 步内 20.6% 二进制完成 / 54.8% 部分完成 | arXiv Table 3 | ✅ 确认 |
| GPT-5.5:~13% 二进制完成,效率更高(~39K output tokens vs ~224K) | arXiv Table 3 | ✅ 确认 |
| 发布日期 2026-06-26 | GitHub README | ✅ 确认 |
| benchmark release: osworld-v2-2026.06.24 | GitHub README | ✅ 确认 |
| Python >= 3.12 | GitHub README(pyproject.toml) | ✅ 确认 |
| 最新 leaderboard(August 2026):Claude Opus 5 排名第一 | BenchLM.ai OSWorld 2.0 页面 | ⚠️ 动态更新:原 paper 披露最高为 20.6%(Opus 4.8),8 月榜单 Opus 5 达 70.6%,反映模型能力随时间快速提升 |
上手步骤
1. 环境要求
- Python >= 3.12
- 支持的 Provider:Docker(Linux + KVM 推荐)、AWS(大规模并行评测)、VMware / Azure / GCP / Aliyun / Volcengine(镜像需自行适配)
- 需要访问 HuggingFace gated datasets(
xlangai/osworld_v2_tasks和xlangai/osworld_v2_assets_gated)
2. 克隆仓库并安装依赖
git clone https://github.com/xlang-ai/OSWorld-V2
cd OSWorld-V2
# 安装基础依赖
uv sync
# 如需完整依赖(OCR / 重型 Agent / V1 任务)
uv sync --extra full
3. 接受 HuggingFace Gated Access
访问以下两个 gated datasets 并接受请求(自动审批):
- https://huggingface.co/datasets/xlangai/osworld_v2_tasks
- https://huggingface.co/datasets/xlangai/osworld_v2_assets_gated
本地登录:
uvx --from huggingface_hub hf auth login
4. 下载任务类文件(使用指定 benchmark release)
uv run scripts/tools/download_osworld_v2_tasks.py --benchmark-release osworld-v2-2026.06.24
⚠️ 版本控制铁律:OSWorld 2.0 使用严格的版本控制。评测必须使用
osworld-v2-2026.06.24release 的所有组件(代码 + 任务文件 + 资产 + Mock 网站),混用不同版本会导致结果不可比。
5. 配置 Provider
Docker(推荐本地评测):
# Docker provider,runner 命令加 --provider_name docker
uv run python run.py --provider_name docker --task_ids [your-task-id]
AWS:
需要在 client VM 安全组中额外开放端口 3000 和 8000(见 Provider Setup)。
6. 配置 Mock 网站(V2 部分任务需要)
使用 OSWorld 团队托管的服务:
export WEBSITE_HOST_SUFFIX="web.hku.icu"
或自托管(GitLab 任务必须自托管,因需要私有 token):
# 克隆 Mock 网站仓库
git clone https://github.com/Task-Web/OSWorld-web
cd OSWorld-web
git checkout v2026.06.24
export WEBSITE_HOST_SUFFIX="<your-host-suffix>"
7. 运行评测(示例:跑单个任务)
uv run python run.py \
--provider_name docker \
--task_ids example \
--agent_config "claude-opus-4.8" \
--max-steps 500
8. 查看轨迹
- 在线可视化:https://osworld-v2-monitor.xlang.ai/
- 轨迹下载:https://huggingface.co/datasets/xlangai/osworld2.0-trajectory
坑与适用边界
1. 版本混用是结果不可比的最常见原因
OSWorld 2.0 的 benchmark release 机制极为严格。README 明确警告「Do not mix releases or replace a pinned tag with main or latest」。即便主分支代码更新了,只要做正式评测,就必须 checkout 到 v2026.06.24 并配合对应版本的 task files、assets 和 mock 网站。
2. HuggingFace Gated Access 首次使用需申请
xlangai/osworld_v2_tasks 和 xlangai/osworld_v2_assets_gated 是 gated datasets,不登录 HuggingFace 或不 accepted access request,评测脚本会静默失败。先申请 access,再运行评测。
3. GitLab 任务无法使用团队托管服务
README 明确:GitLab 任务必须自托管,因为 GitLab-backed tasks 需要私有 token,共享 token 有安全风险。相关环境变量:
export GITLAB_URL="<your-gitlab-url>"
export GITLAB_PRIVATE_TOKEN="<your-private-token>"
4. 生产级评测的云成本
每个任务平均需要 ~244K output tokens(Claude Opus 4.8 batched),按 $25/M output tokens 计算,每任务约 $6.1(仅模型成本),加上 Docker/AWS 基础设施费用,大规模评测成本不可忽视。GPT-5.5 每任务 ~$0.98,更适合初步快速实验。
5. 评测结果 ≠ 真实场景表现
OSWorld 2.0 评测的是特定任务集下的计算机使用能力。论文中提到的四大失败模式(约束丢失、信息遗漏、盲目猜测、跳过验证)在论文环境下被充分暴露,但具体数字(20.6% vs 54.8% partial)是 500 步、batch action 等特定配置下的结果。生产系统评估需要结合实际场景。
6. Leaderboard 动态更新
原 paper(June 2026)最高分为 Claude Opus 4.8 的 20.6%(batched,500 步),但截至 2026 年 8 月,Claude Opus 5 已达 70.6%,GPT-5.6 Sol 达 62.6%。这说明:1)模型能力快速提升;2)排行榜本身在随新提交更新。引用 OSWorld 2.0 结果时须注明是哪一版、哪个模型的结果。
一句话结论
OSWorld 2.0 用 108 个平均需 1.6 小时、318 次工具调用的真实长程工作流,把计算机使用 Agent 的评测难度重新拉回到 20.6% 的「未解决」区间——在这个基准被攻破之前,任何在 OSWorld 1.0 上自称「接近人类水平」的 Agent 系统都需要打上一个大大的问号。