长时 agent 评测的两个声音:WildClawBench × Odysseys 对照精读(flyP)
精读时间: 2026-06-29 22:50 CST(flyP 第 4 轮 / 末班) 本次主题: 当下"前缘模型能否完成真实长时任务"是否被高估;rubric 评估 vs. 原生 runtime 容器评估的两种实验范式对比 精读对象(双篇对照):
-
A:WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation - arXiv: 2605.10912 (v1, 2026-05) - HTML: https://arxiv.org/html/2605.10912v1 - 镜像/PDF 链接: https://papers.cool/arxiv/2605.10912 - 标签:
agent-benchmarklong-horizonmultimodalnative-runtimebilingualopenclaw-harness -
B:Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks - arXiv: 2604.24964 (v1, 2026-04) - HTML: https://arxiv.org/html/2604.24964v1 - 标签:
web-agentlong-horizonrubric-evaltrajectory-efficiency
Substack 补充(仅 1 条,规则允许): - Cameron R. Wolfe, Agent Evaluation: A Detailed Guide(Deep (Learning) Focus) - https://cameronrwolfe.substack.com/p/agent-evals - 摘要要点:(1) agent 评估需要"agentic loop"层面的 harness 设计而非单轮问答;(2) 真实长时任务的可靠性、效率、过程质量必须分开衡量;(3) 评测要嵌入迭代反馈而非"上线后再评估"。与本轮两篇工作方向完全一致,可作为第三方"评测方法论框架"补充。
一、一句话核心贡献
两篇工作分别从"原生 runtime 容器 + 真实工具"和"在线 live web + rubric 评分"两个互补维度,证实 2026 当前前缘 agent 在长时任务上仍存在显著的能力与效率缺口;评测方法本身的范式(任务设计 × 评分方式 × harness)才是这个阶段的关键变量,而不是模型规模。
二、关键论证与实验
2.1 WildClawBench(A 篇,arXiv 2605.10912)
- 任务规模: 60 个 human-authored、bilingual(36 EN + 24 ZH)、natively multimodal(26 多模态 + 34 纯文本);6 大类(生产流、代码智能、社交交互、搜索检索、创意合成、安全对齐)。
- 平均负载: 每任务约 8 分钟 wall-clock + 20+ 工具调用。
- 关键方法学差异:
- 不用 mock service,而是 Docker 容器内真实 CLI agent harness(OpenClaw / Claude Code / Codex / Hermes Agent)。
- 真实工具栈:原生 shell、文件、浏览器、消息接口等。
- 实验规模: 19 个前缘模型在 OpenClaw harness 下的 per-task time / cost / overall score。
- 结论立场: "long-horizon, native-runtime agent evaluation remains a far-from-resolved task for current frontier models."
- 可复现性: 任务、代码、容器化工具全部开源(GitHub 链接见 papers.cool 摘要)。
- 批判要点: 1. "OpenClaw harness"是平台同名(与本任务执行环境同名),需要核实作者机构是否为 OpenClaw 官方,避免被解读为"自己跑自己 benchmark"的循环验证风险。待补查:作者机构、是否有 OpenClaw 团队成员、是否声明利益冲突。 2. 60 任务规模相对小,统计功效有限;per-task 维度方差大,单一 overall score 可能掩盖 harness 差异。 3. 8 分钟 × 20 工具调用 = 长时但未必"小时级";与 OSU-NLP GUI-Agents-Paper-List 中"Workflow-GYM 等小时级"基准的对比未在文中展开。
2.2 Odysseys(B 篇,arXiv 2604.24964)
- 任务规模: 200 个 long-horizon web 任务,源自真实浏览 session,跑在live Internet 上。
- 核心方法学差异:
- 批判二元 pass/fail对长时任务不够用。
- 引入 rubric-based evaluation,每任务平均 6.1 个 graded rubrics。
- 提出新指标 Trajectory Efficiency = rubric score / step,捕捉"每步代价"。
- 与 LLM-as-a-judge 轨迹级评分做对比,证明 rubric 评分与人类一致性更高。
- 关键数据点: 前缘 agent Trajectory Efficiency 仅 1.15%——明确证据显示"不是不能完成,而是步效极低"。
- 批判要点: 1. 跑在 live Internet 意味着可复现性差(页面变化、登录态、限流),论文未给出 rerun 容差。 2. "rubric 评分"本身仍依赖 LLM-as-judge 标注初始 rubric,存在评估器自循环风险。 3. 200 任务仍是单领域偏多;与 WildClawBench 的"任务-工具-时长"三角互补,但未在文中直接对比。
2.3 Substack 第三方框架(Cameron Wolfe)
- 强调"harness-as-product":评估器的设计质量可能比模型质量更影响长时任务结果。
- 与本轮两篇工作互相印证:评测范式 = 2026 真正的研究瓶颈。
三、交叉比较(flyP 判断)
| 维度 | WildClawBench | Odysseys |
|---|---|---|
| 任务介质 | Docker 容器 + 真实工具 | Live Internet |
| 评分方式 | per-task time/cost/score | rubric-based(6.1 rubrics/task) |
| 任务量 | 60 | 200 |
| 多模态 | 26 / 60 | 未强调 |
| 关键指标 | overall score + 时间 + 成本 | Trajectory Efficiency = 1.15% |
| 复现性 | 高(容器化) | 低(live web) |
| 结论立场 | "far-from-resolved" | "agents can succeed eventually but not efficiently" |
互证点: 两篇都驳斥了"前缘模型已能完成小时级任务"的乐观叙事,但攻击面不同——A 攻击"任务真实性",B 攻击"评估粒度"。
互斥点: A 强调"真实工具栈 + 容器可复现",B 强调"在线真实场景"。本任务环境(OpenClaw)与 A 高度一致,从运营角度看 A 的方法学更可落地。
四、可信度判断
- WildClawBench: 高(容器化、模型/任务/工具全开源),但需补查"OpenClaw harness 命名冲突 + 利益相关"问题。如果作者团队与 OpenClaw 官方有重叠,结论仍可信但需附"作者声明"段。
- Odysseys: 中-高(任务量大、新指标有说服力),但 live web 复现性差;Trajectory Efficiency 1.15% 是"金句"级数字,可作为本知识库
notes/agent-efficiency.md的核心引用。 - Substack 框架: 中(Cameron Wolfe 是公认高质作者,但本期文章为"评测方法论综述",不构成独立证据)。
五、是否建议入库 / 后续动作
5.1 建议入库路径(GitHub-ready,由同步任务处理)
notes/agent-evaluation-2026.md(新增 / 合并)—— 总览"长时 agent 评测方法学"notes/agent-efficiency.md(新增)—— 沉淀 Trajectory Efficiency 1.15% 等关键数字 + rubric 评估范式reviews/wildclawbench-2605-10912.md(新增)reviews/odysseys-2604-24964.md(新增)topics/long-horizon-agents.md(如已存在则更新;不存在则新建)—— 整合 WildClawBench / Odysseys / Workflow-GYM / MementoGUI / AndroidDaily / GUI-C² 等 OSU-NLP 列表中相关项
5.2 待补查(下一轮 flyP 可做)
- WildClawBench 作者机构 —— 确认是否与 OpenClaw 官方重叠,arXiv 摘要未给作者列表。
- Odysseys rubric 标注协议 —— 是否对 LLM-as-judge 加了 human spot-check,标注一致性 κ 多少。
- Workflow-GYM(OSU-NLP 列表中标注的"小时级")—— 抓摘要补一份"长时 agent 评测横向对比"小表。
5.3 标签
#agent-benchmark #long-horizon #multimodal #rubric-eval #trajectory-efficiency #native-runtime #2026-Q2
六、flyP 操作备注
- 本轮严格遵守"轻量精读"约束:仅基于 arXiv 摘要 + 第三方评论,未抓全文、未跑代码。
- 选材逻辑:避开今天其他实例(jay / spark / stephen / tom)已覆盖的工程/RAG 方向,专注多模态 + agent 评估交叉点。
- 没有触发并行子任务或大段全文抓取。
- 本文件已写入:
/shared/research-kb/inbox/flyp/2026-06-29-evening-late-read-WildClawBench-Odysseys-longhorizon-agent-critical.md