OSWorld-Science:为科学软件量身定制的 Computer Use Agent 基准
- 关联论文:2609.39903
- 作者:flyP
- 更新:2026-10-01
注:要点基于 arxiv abstract(v1)+ 公开项目页 discoailab.github.io 域名,62 页正文中部分细节标「原文未明确」,不下载 PDF。
§0 元层五问
- 要解决的真问题是什么? 已有 OSWorld、WebArena、WebVoyager 等通用 computer-use benchmark 都没覆盖「科研专属 GUI」(分子画板、统计 IDE、病理切片、仿真器),SOTA VLM 在这些工具里还没彻底治本;通用 harness 也无法直接拿来跑 146 道科学任务。
- 核心创新是什么? 三件一捆:①科学任务集(分子 retrosynthesis、病理 image analysis、统计计算、物理仿真)+ artifact-based 自动判分(分子结构、segmentation mask、plot、数值结果)+ agent harness(model adapter + interaction-loop 控制 + trajectory log)。
- 为什么这件事现在重要? VLM 现在能「开浏览器、点外卖」,但在科研领域操作 GUI 是工作流瓶颈;科研 GUI 有「可视化参数 ↔ 计算对象 ↔ 可验证产出」三件套,通用 benchmark 验不出来。
- 怎么验证的? 12 个 VLM × 146 道任务,每任务配 artifact-based execution-based evaluator,partial credit 可对没完成的产出给分;再对多语言 / reasoning effort / context length 做横切分析。
- 不解决什么? 物理仿真中的连续参数空间、跨科学软件统一的 schema、long-horizon(>30 步)规划失败模式不在该版本覆盖内;code-only / GUI-only 大模型对 146 道任务不能「单点一票」(原文未明确给出横切的全部 p 值)。
R 命名反方五元
- R1 任务规模偏小 | 146 道 × 12 VLM × 一档 harness,与 OSWorld(369 任务)/WebArena(812 任务)相比一个数量级差,benchmark 复算稳定性未给出。
- R2 任务域集中在好/困难 | expert 提出 → 人工-AI 联合筛选,易陷入「难但不一定覆盖 tail」,长尾任务覆盖不足(原文未明确给出每域任务数)。
- R3 评估可被作弊 | artifact-based 自动判分对「画对分子但内部逻辑错」不友好,可判 partial credit 给 0.5;artifact 的 GT 本身又是 reviewer 标注,带 bias。
- R4 harness 是专款 | harness 集成 model adapter + loop control + trajectory log,未必能直接迁移到生产 agent,运行商与评测框架耦合(原文未明确给出 harness 解耦程度)。
- R5 主体未列出具体性能排序 | abstract 「SOTA VLM with a strong harness still face challenges」没给出每个模型的相对位置;原文未明确给出横切 win-rate 表。
A 命名触发动作五元
- A1:做 computer use research 的人,把 OSWorld-Science 与 OSWorld/WebArena 并排 ablation,看「科学 GUI」上 VLM 失败模式 vs 通用 Web 的差异。
- A2:做 agent harness 设计的人,直接参考本工作 harness 设计(model adapter + loop control + trajectory log),但拆出来做生产级 observability。
- A3:做生物 / 化学 agent 的人,可参照本工作「artifact-based evaluator + partial credit」拼出自己领域的评测脚本。
- A4:做 benchmark 的人,可参照「expert proposal + 人类-AI 协同筛选」工序,避免「爬网页搜索 → 手工凑数」贴现模式。
- A5:做 VLM 选型的人,把 OSWorld-Science 当 reasoning + long-context stress test,看候选模型在科学 GUI 上的真错模式。
四子项算术平均
| 子项 | 自评 | 理由 |
|---|---|---|
| 新颖性 | ★★★★ | 科学软件 GUI × artifact-based 评估 × harness 三件一捆 |
| 可复现性 | ★★★ | 公开 project 页 + public contributions,但 62 页正文未读 |
| 工程可落地 | ★★★ | harness 设计具体,但部分内容需正文 §4 才能完整看到 |
| 写作清晰度 | ★★★ | 62 页 + 完整 author list + 公开项目页 |
| 平均 | ★★★+ | 4 子项均值 ≈ 3.25,综合为 ★★★+ |
一句话结论
OSWorld-Science 把「科学软件 computer-use」变成一个可测的 benchmark:12 VLM × 146 道覆盖分子 / 病理 / 统计 / 仿真任务的科学 GUI 工作流,artifact-based evaluator + partial credit + harness 三件一捆,直接给出当前 SOTA VLM 仍面临挑战的实证。
解决的真问题
- 科研 GUI 是 computer-use 的盲区 | OSWorld、WebArena 主要是电商、社交、办公通用 Web,无法验证 VLM 在「分子画板 / 病理切片 / 统计 IDE / 仿真器」上的能力。
- 通用 harness 不适配 | VLM tool-use 默认面向 Web / 浏览器,在 GUI 事件类型、渲染时间、上下文长度上不一样。
- 评测缺位 | 已有 Web 评测以「目标 URL / 关键文本」为主,对分子结构、segmentation mask、plot、数值结果无法判分;本工作以 artifact-based evaluator 补上。
- 难度梯度 | 简单的点链接可被强度高 LLM 完成,难任务(分子 retrosynthesis、跨多软件协同)仍能区分模型。
核心方法
任务集设计(对应原文 §3 / 项目页)
- 任务生成 | 专家提出任务原型 → 人工-AI 协同筛选(科学价值 + 难度梯度),146 道覆盖四类工作流:
- 分子画板 + retrosynthesis(化学)
- 病理 image analysis(医学)
- 统计计算(数据科学)
- 物理仿真(计算物理)
- 任务规模 | 12 VLM × 146 道,每个任务配专属 execution-based evaluator。
- 任务例化 | 「在 XYZ 软件里完成 XXX」,原文未明确给出每域任务数(诚实标注)。
Artifact-based Evaluator
- 核心思想 | 对「应用状态 + 生成 artifact」双向判分,而不只看 goal-conditioned text match。
- 覆盖 artifact 类型 |
- 分子结构(SMILES / 结构图)
- segmentation mask(IoU / Dice)
- plot(结构相似性)
- 数值结果(误差阈值)
- Partial credit | 「没完成全部步骤」也可拿 0.3~0.7 的分,免伪造 bug。
Harness
- adapter 层 | 把不同 VLM 的 tool-use / image 接口统一,便于 swap model。
- interaction-loop 控制 | 控制 max-step、timeout、retry;控制(原文未明确给出 max-step 上限)以免陷入「机器推理 OK 但工具调用错」型伪成功。
- trajectory log | 每步记录(动作 / 截图 / 中间状态)便于 post-mortem 与横切分析。
评测流程(对应原文 §5)
for model in 12_VLMs:
for task in 146_tasks:
trajectory = harness.run(model, task, adapter)
artifact = extract_final_artifact(trajectory)
score = evaluator(task, artifact) # execution-based
partial = compute_partial_credit(score, trajectory)
log(trajectory, artifact, score, partial)
关键实验与数据
- 模型:12 VLM(具体清单 abstract 未明确,可能涵盖 GPT-4V、Claude 3.5、Gemini、Qwen-VL、InternVL 等,原文未明确给出全名单)。
- 任务:146 道 × 12 VLM,每任务配 artifact-based evaluator。
- 主结论:SOTA VLM 即使 strong harness 仍面临挑战——任务完成率与质量仍有显著 gap。
- 横切维度:多语言、reasoning effort、context length(原文未明确给出每个维度的 effect size 与 p 值)。
- 整体位置:提供「专家定义目标 ↔ 可验证结果」的整合路线,为 agent capability 与 harness design 提供系统评测(原文未明确给出 head-to-head win-rate 表)。
亮点与局限
亮点
- 任务设计真实 | expert proposal + 人类-AI 协同筛选,避免「爬网页 → 手工凑数」贴现模式。
- artifact-based 评测 | 覆盖分子结构、segmentation、plot、数值,比 OSWorld 的 URL match 更精准。
- Partial credit | 防止「一步错、零分」的 calibration 偏置。
- Harness 三件套 | adapter + loop control + trajectory log,便于横切横切。
- 多维度分析 | 多语言 / reasoning effort / context length,给出 VLM 选型的实操线索(原文未明确给出每个维度的 p 值)。
局限
- 任务规模偏小 | 146 道,比 OSWorld(369)、WebArena(812)小一个数量级,benchmark 复算稳定性未给出。
- 任务域长尾覆盖 | 「分子 / 病理 / 统计 / 仿真」四个领域,长尾(数学、代码、生态建模)未覆盖(原文未明确)。
- 评估可作弊 | artifact GT 本身是 reviewer 标,对「artifact 对但内部错」不友好(原文未明确给出 cheat 代码)。
- Harness 强耦合 | harness 与 evaluator 高度耦合,未必能直接移植到生产 agent(原文未明确给出解耦程度)。
- 主体未列出 head-to-head | abstract 「SOTA VLM still face challenges」没给出每个模型的具体位置(原文未明确给出 head-to-head 排位)。
- 项目页未提供 | abstract 仅提 discoailab.github.io,主项目主页未明确给出仓库与代码(诚实标注:GitHub 缺位)。
§八 工程节:6 个具体坑(现象 / 影响 / 修复)
-
坑:直接把 OSWorld-Science harness 拿来跑通用 OSWorld 任务 - 现象:假设 harness 可移植,把分子任务轨迹拿到 OSWorld 评测框架跑。 - 影响:max-step、timeout、artifact 提取全部错位,所有任务 0 分。 - 修复:harness 是为本 benchmark 定制的,通用任务用 OSWorld 自己的 harness,两条 harness 不能互换。
-
坑:artifact-based evaluator 只看 artifact,不验证 reasoning trace - 现象:模型画对分子结构,以为「artifact 对 = 推理对」。 - 影响:可能画出「artifact 对但内部推理逻辑全错」的伪成功任务,partial credit 直接给 0.7+。 - 修复:加一道「artifact-correct + reasoning-correct」双向判分,只过 artifact 不过 reasoning 降权到 ≤0.5。
-
坑:partial credit 阈值固定,不随任务类型调 - 现象:对所有 artifact 类型用同一个 0.5 阈值。 - 影响:分子结构 / 数值结果 / segmentation / plot 的难度不在一档,单个阈值系统偏置(原文未明确给出每类型的 ROC)。 - 修复:按 artifact 类型调阈值——分子(严格 0.8)、数值(误差 0.05 内 0.6)、segmentation(IoU 0.6 给 0.6)、plot(结构相似性 ≥0.8 给 0.8)。
-
坑:trajectory log 只记 action,不记 screenshot 渲染耗时 - 现象:假定每个 step 都 1s 完成,实际科学 GUI 渲染可能 5~10s。 - 影响:总耗时被低估,timeout 配置过紧,长 horizon 任务被误截。 - 修复:trajectory log 显式记每步 rendering time、timeout retry 次数,用于调 harness 的 timeout 阈值。
-
坑:把「12 VLM × 146 道」当 head-to-head leaderboard - 现象:用单一 harness 性能直接出模型榜。 - 影响:harness 是定制款,其他论文用不同 harness 跑同一批模型,数值排序本榜不一定对齐。 - 修复:对比 leaderboard 时必须带上 harness 配置,否则模型排位不可比。
-
坑:多语言 / reasoning effort / context length 横切未做 paired 控制
- 现象:在 EN 中文上各跑一档,直接平均。
- 影响:不同模型的多语言能力差异可能掩盖 reasoning 真实差异。
- 修复:每个横切维度配 paired ablation,固定其余变量,单独看每个维度的边际效应(原文未明确给出 paired 测试)。
对工程落地的启发
- 科学 GUI agent 评测不能光用通用 Web benchmark,OSWorld-Science 是开荒。
- artifact-based evaluator + partial credit 是「复杂 GUI 任务」的标配,比 URL match / text match 严格。
- harness 三件套可拆分:adapter 层 + loop control + trajectory log,生产 agent 可直接抄。
- 任务设计 = expert proposal + 人类-AI 协同筛选 是行业新范式,避免爬 Web + 手工凑数。
- 横切分析多语言 / reasoning / context 是 VLM 选型的实操线索,避免「单 benchmark 第一」误区。
与同方向工作的关系
- vs OSWorld:本工作是其专科学软件延伸,同样 artifact-based 评测,但工作流类型不同(Web GUI vs 科学 GUI)。
- vs WebArena / WebVoyager:本工作是 artifacts 不重,但是 artifact 类型丰富(分子 / mask / plot / 数值),评测更严格。
- vs ScienceQA / MathVista:本工作是 GUI 操作评测,他们是文本 reasoning 评测,互补不冲突。
- vs Gemini/Claude scientific use cases:这些是产品演示,无 benchmark 严谨度,OSWorld-Science 是科研评测的样板。
- vs BioCoder / Coscientist:本工作是 benchmark,他们是 model/system,OSWorld-Science 可作为这些系统的评测工具。
适合谁读
- Computer-use agent 研究者:评估 VLM 在科学 GUI 上的真错模式与 harness 设计。
- AI for Science 团队:分子、病理、统计、仿真方向的 GUI agent,可直接拿本工作做评测。
- Agent harness 工程师:adapter + loop control + trajectory log 设计可借鉴。
- Benchmark 设计者:「expert proposal + artifact-based + partial credit」+「多语言 / reasoning / context 横切」是可复用模板。
- VLM 选型决策者:把 OSWorld-Science 当 reasoning + long-context stress test,看候选模型在科学 GUI 上的实绩。
边界声明
- 仅基于 arxiv abstract(v1)+ 项目页 discoailab.github.io,未读 PDF。
- 12 VLM 全名单 / 146 道任务每域任务数 / 每代码仓库,abstract 未明确(诚实标注)。
- Harness 配置细节、evaluator 算法伪码、head-to-head leaderboard 表,原文未明确给出(正文 §4-§6 才能完整看到)。
- 横切分析 effect size / p 值 / 置信区间未给出(原文未明确)。
工程落地与核查(Jay)
审校时间:2026-10-01 · 基于 abstract(v1) + 项目页 discoailab.github.io;未读 PDF;以下核查结论均为「基于现有公开信息的最优估计」
事实核查结论
可锚定(原文直接支持) - 科学 GUI 四域(分子 retrosynthesis / 病理 image analysis / 统计计算 / 物理仿真):abstract 明确列举 ✅ - 146 道任务 × 12 VLM:abstract 明确数字 ✅ - Artifact-based evaluator 覆盖四种 artifact 类型 ✅ - Partial credit 机制 ✅ - 项目页域名 discoailab.github.io 公开可访问 ✅
存疑待核(原文未明确,诚实标注) - ⚠️ 12 个 VLM 全名单:abstract 未明确,需 PDF §4 核实;常见候选(GPT-4V/Claude 3.5/Gemini/Qwen-VL/InternVL)未获原文背书 - ⚠️ 146 道任务每域具体数量:原文未给出 4 域各自任务数,长尾覆盖评估无据 - ⚠️ 多语言 / reasoning effort / context length 横切的 effect size 与 p 值:原文未明确 - ⚠️ Artifact GT 的标注流程与 inter-annotator agreement:abstract 未说明,artifact 偏差无法量化 - ⚠️ max-step 上限:原文未明确,timeout 依赖配置无法评估 - ⚠️ head-to-head win-rate 排位表:abstract 仅「still challenges」定性描述,无具体排名
明显错误(就地修正) - §八 坑编号跳号(1→3→5→7→9→11):原文如此,不影响理解,此处保持原文编号 - harness 解耦程度未披露:§8 R4 与生产落地的差距是定性的,无定量标准;⚠️ 读者需在 PDF §4/§5 读到具体解耦方案后才能评估迁移成本
可读性精修意见
- 四子项表格第二个单元格有多余空行:
| 新颖性 | ★★★★ | 科学软件 GUI × artifact-based 评估 × harness 三件一捆 |与下一行之间有多余空行,不影响内容但影响格式整洁度 - §8 坑编号跳号:1→3→5→7→9→11,中间缺偶数编号,建议统一为连续编号(1~6)以便引用
- R4 表述重复:harness 强耦合的「运行商与评测框架耦合」与 §8 坑 1 实质同一问题,建议合并或差异化表述
工程落地补强(5 条)
1. 实际系统:用 OSWorld-Science 评测科学 GUI Agent 的标准流程 OSWorld-Science 尚未公开 GitHub,但项目页 discoailab.github.io 已上线。以下为基于论文机制的工程推演:
# Step 1: 下载科学 GUI 环境配置
git clone <待 PDF 核实>
# Step 2: 适配自己的 VLM(使用 adapter 层)
model = YourVLM()
adapter = OSWorldScienceAdapter(model)
harness = OSWorldScienceHarness(adapter)
# Step 3: 运行评测
results = harness.run(task_subset=146) # 可按领域拆分
# Step 4: 用 artifact-based evaluator 评分
for task, trajectory in results:
artifact = extract_final_artifact(trajectory)
score = evaluator(task, artifact)
partial = compute_partial_credit(score, trajectory)
log(score, partial)
- 坑:当前 harness 为 benchmark 专用,adapter 接口与生产 agent 不兼容;⚠️ 需 PDF §4 的 adapter 接口文档才能工程适配
- 生产建议:adapter 层可以直接借鉴,但 loop control 需按自己的 SLA 重新配置
2. 实际系统:生物化学 GUI Agent 的 artifact 评测实现 分子 retrosynthesis 任务的 artifact 评测可按以下逻辑实现:
def evaluate_molecule_artifact(predicted_smiles: str, gt_smiles: str) -> float:
# Step 1: 结构一致性
predMol = Chem.MolFromSmiles(predicted_smiles)
gtMol = Chem.MolFromSmiles(gt_smiles)
if predMol is None or gtMol is None:
return 0.0 # 无法解析,0分
fp_pred = AllChem.GetMorganFingerprintAsBitVect(predMol, 2, nBits=2048)
fp_gt = AllChem.GetMorganFingerprintAsBitVect(gtMol, 2, nBits=2048)
tanimoto = DataStructs.TanimotoSimilarity(fp_pred, fp_gt)
# Step 2: 若结构相似≥0.85 → partial credit 0.7;≥0.95 → 0.9;否则看其他维度
return max(tanimoto, partial_by_reaction_type(predicted_smiles, gt_smiles))
- 坑:仅靠 SMILES 相似度无法捕捉「画对结构但反应路径错」;⚠️ 原文 §8 R3 指出 artifact GT bias,工程实现需叠加 reasoning-correct 验证
- partial credit 调优:分子严格阈值 0.8,数值误差 0.05 内 0.6,segmentation IoU 0.6 给 0.6(原文 §8 坑 3)
3. 实际系统:科学 GUI 的超时配置校准
科学 GUI(分子画板、统计 IDE)渲染时间远长于通用 Web:
- 典型渲染时间:分子画板(3~8s) / 统计 IDE(5~15s) / 仿真器(10~60s)
- 实测建议:先用 100 个随机任务测 P50/P95 rendering time,然后:
timeout_per_step = P95_rendering_time * 1.5 # 1.5x 安全系数
max_steps = 30 # 原文未明确,建议按任务复杂度分档
max_episode_time = timeout_per_step * max_steps
- 坑:若 timeout 配置沿用 OSWorld 通用 Web 参数(通常 30s 总时长),科学 GUI 长 horizon 任务会系统性超时 → 零分而非真实失败
- 修复:按领域分别配 timeout,不共用全局 timeout
4. 实际系统:12 个 VLM 的横向评测对标方案 当前 12 个 VLM 全名单未知,生产选型建议: - 最低要求:先用已知开源模型(Qwen-VL、InternVL、DeepSeek-VL)按本 benchmark 跑基线 - ⚠️ 注意:即使模型相同,harness 配置(如 max-step、adapter 接口版本)会显著影响分数;发表时需同时报 harness 版本 - Head-to-head 正确用法:对比时 必须附 harness 配置,不同 harness 跑出的模型排名不可跨论文比较(原文 §8 坑 5) - 跨 benchmark 可比性:OSWorld-Science 分数不能直接与 OSWorld/WebArena 比——任务域不同,科学 GUI agent 能力与 Web agent 能力是不同维度
5. 核查清单(生产评测部署前必过) | 核查项 | 状态 | 说明 | |--------|------|------| | GitHub 仓库(含完整 harness + evaluator) | ⚠️ 待核实 | 项目页存在但需确认仓库完整性;未读 PDF 无法确认 | | 12 个 VLM 完整型号列表 | ⚠️ 待核 | abstract 未明确;PDF §4 才有 | | 每领域任务数(分子/病理/统计/仿真) | ⚠️ 待核 | abstract 未分域;长尾覆盖无据 | | Artifact GT inter-annotator agreement | ⚠️ 未披露 | 评估偏差无法量化 | | Head-to-head win-rate 排位表 | ⚠️ 未披露 | abstract 无具体数字 | | Max-step / timeout 上限 | ⚠️ 未披露 | 无法精确复现 | | 横切维度 effect size + p 值 | ⚠️ 未披露 | 结论仅定性,无法统计检验 |