你公司花了几百万挑的"AI 员工",真实办公可能连及格线都不到——arXiv 2608.22510 把"模型排行榜"彻底打回原形

  • 关联论文:2608.22510

你有没有这种感觉 🤔?

公司花了大钱、上线了"AI 员工"——号称对标 GPT-X、Claude-X, 宣传材料里写着"基准评测 85 分"。 结果真让它在办公环境里点个链接、发个消息、订个会议—— 它要么发呆、要么点错按钮、要么三句话里藏一句瞎编。

不是你买到了垃圾。是那份"85 分"在骗你

arXiv 2608.22510(ClawProBench) 做了一件对所有 Agent 厂商都很扎心的事——

它把评测单元从"模型"升级成"模型 + 运行框架 + 原生能力 + 安全护栏"的整张配置清单, 在真实 OpenClaw runtime 上跑了 102 道动态办公题 + 68 道冻结审计题, 对 68 / 37 个模型加 runtime 配置评分。

结论是:纯"答对率"排行榜系统性地高估了真实办公能力大约 10 个百分点

更狠的是——同一个 agent,"撞运气体"和"稳定型选手"可以差出 0.6638 vs 0.2890 这种量级的排名差异。

这件事为什么重要?因为今天的 Agent 排行榜几乎都在用错尺子量 Agent


0 · TL;DR(30 秒版)

arXiv 2608.22510 解决一件具体的事:

现有 Agent benchmark(SWE-bench、WebArena、τ-bench、BFCL)只看最终答案,系统性遗漏三件事:runtime 配置漂移(同一模型配不同 harness 能差 20%+)、撞运气 vs 稳定(pass@k 与 strict-3-trial 给出不同排名)、安全失败被平均稀释。ClawProBench 用 trace-aware 评分公式 + dual-track(102 dynamic + 68 frozen)+ safety-gated 隔离把这三件事一次性补齐,并开源了完整 artifact。

对从业者最直接的工程含义:不要再拿 final-answer 排行榜做 Agent 选型——native surface 才是真实瓶颈,撞运气的通过不算通过,安全失败不该被平均稀释。


1 · 痛点:现在的 Agent 评测在量什么?

1.1 「只看最终答案」的三大骗局

现有 benchmark 普遍存在三种"评测欠指定":

  1. 只看 final answer:Agent 跑在有状态的 runtime(memory、tool routing、subagent、scheduling)上,但评测只比对字符串结果——"过程全错 + 偶然答案对"和"过程完美 + 答案差一个 token"得分相同。
  2. runtime 配置漂移:同一个模型配不同 harness(vLLM、SGLang、自定义 routing)能差 20%+,但榜单往往只报"GPT-X 跑某 benchmark 多少分",可复现性差。
  3. one-off 成功率误导:单次试验通过 ≠ 系统鲁棒——几乎没人要求 ≥3 次重复试验的 strict-pass 视图。

论文把这点说得很直白:评测单元应该是声明式的 model-plus-runtime 配置,失败点可能出现在证据获取、runtime routing、安全边界、重复执行。

1.2 「原生能力」是被藏起来的瓶颈

把 agent 放进真实办公环境,让它自己用 browsing、自己调 memory、自己开 subagent——这种任务(论文叫"native runtime 任务")的平均分是 0.5238。但只让它在沙箱工作区里摆弄文件(workspace-live 任务),平均分就是 0.6415同一个 agent,光是换一下"是否接 native surface",分数就掉了 12 个绝对点。

这意味着:你今天看到的"agent benchmark 80 分"很可能等于"真实办公 68 分"。差的不是模型能力,是评测方式没模拟真实办公的复杂度。


2 · ClawProBench 怎么修这把尺子

2.1 评测单元升到「model-plus-runtime configuration」

不再把"模型"或"agent"当成原子单元,而是显式声明五元组:

模型 + harness runtime 版本 + 原生能力清单(browsing/memory/messaging/scheduling/skills/subagents)+ workspace 工具 + 安全护栏 + 重复试验次数

评测对象 = 一份可被 git diff 的 configuration snapshot,不是"GPT-5 跑 SWE-bench 多少分"这种含糊口径。

2.2 两条赛道,互相补位

  • Full profile(102 题):live workspace + native-runtime routing,跑在真实 OpenClaw 实例上——代表"真实办公环境"。
  • Frozen holdout(68 题):closed-world JSON output contract,输出结构化 schema——代表"防过拟合的审计锚"。

两条赛道互补:full profile 暴露 native-surface 弱点,holdout 锁定稳定基线。关键反直觉发现:full 与 holdout 的排名相关度只有 Spearman 0.1754(95% CI [−0.23, 0.54])——两个榜单几乎在量不同的能力

2.3 Trace-aware 评分公式(safety-gated)

每个 trial 收集完整执行 trace(tool calls、subagent spawns、retries、safety events),由公式聚合:

分数 = 安全门控 ×(正确率 + 过程质量 + 效率 + 三试全过率 + 任意一次过率 + trace 失败惩罚)

关键设计是 safety-gated:任何触犯安全边界的 trial 直接归零并保留 trace 用于审计——把"安全失败"从"普通失败"里隔离出来,不让它被平均分稀释。这条对 SOC2 / EU AI Act / ISO 42001 审计是硬要求。

2.4 失败证据可重现

每个失败 trial 不只记"pass/fail",还保留完整 trace(tool 序列、retry 次数、safety 事件)。artifact 公开 benchmark 代码与 sanitized traces,外部审计者能复现"为什么这个配置在这题挂了"——和近期"auditable agents"共识完全对齐。


3 · 关键反直觉发现(普通读者最该记住的 4 件事)

  1. 排行榜失真:基于纯 correctness 的 leaderboard 与 process-aware / safety-gated / strict-pass 视图给出的排名差异巨大——"X 模型第一"在不同视图下不是同一个人。
  2. native surface 是被隐藏的瓶颈:在 workspace-only 任务上看起来 OK 的 agent,进到 native runtime 任务上掉 12 个绝对点(0.6415 → 0.5238)最终答案 leaderboard 系统性高估了真实办公能力
  3. pass@k vs strict pass = 不同 agent:0.6638 vs 0.2890 的差距意味着同一个 benchmark 里,pass@k 排名靠前的 agent 多半靠"撞运气 + 多试一次",而 strict 3-trial 通过率高的才是真正稳定的系统。
  4. full/holdout 排名不相关(Spearman 0.1754,CI 跨零):full profile 的动态任务和 holdout 的 frozen 任务在量的是不同能力,不能用一个去预测另一个

4 · 这篇论文为什么和你(普通读者)有关?

  • 如果你在用 AI Agent 做工作流(自动填表、自动调研、自动下单):别信厂商给你的"benchmark 分数"——真实成功率可能比那低 10+ 绝对点。先小范围跑一遍你公司的真实场景,再决定要不要扩大部署。
  • 如果你是开发 / 选型决策者:把这篇的三个设计(dual-track + safety-gated + strict-pass)抄到自己内部 CI 里。任何不给 strict-pass 视图的 vendor,建议直接换。
  • 如果你在做 Agent 产品:runtime 版本漂移能差 7+ 个绝对点。每次发版锁死 runtime 版本、不要用 latest tag——否则你的 benchmark 数据一年后全失效。
  • 如果你是安全 / 合规岗:safety-gated 评分范式与 EU AI Act / ISO 42001 审计需求高度对齐。把"安全失败被平均稀释"列为当前评测体系的最大漏洞。

5 · 一句话总结

别再用 final-answer 排行榜挑 Agent 了——native surface 才是真实瓶颈,撞运气的通过不算通过,安全失败不该被平均稀释。 ClawProBench 把这件事从"行业心里都清楚但没人改"推到"完整工程化方案 + 开源 artifact"。


三个标题变体

  1. 《你以为 85 分的 AI 员工很强,真实办公可能只有 73 分——一篇 arXiv 论文把"AI 排行榜"整套尺子打回原形》
  2. 《公司花了几百万挑的 AI 员工,怎么到了真实办公就拉胯?arXiv 2608.22510 揭穿"撞运气体"和"稳定型"的差距》
  3. 《"模型+框架+原生能力"才是 AI 评测的正确单位——arXiv 2608.22510 给了完整工程化方案》

📱 小红书风格卡片文案

📌 你公司花了几百万挑的 AI 员工,真实办公可能连及格线都不到

你有没有这种感觉 🤔 —— 公司上线了号称"对标 GPT/Claude"的 AI 员工,宣传材料写着 benchmark 85 分,结果真让它点链接、订会议、回消息,它要么发呆,要么点错,要么三句话里藏一句瞎编。

不是你买到了垃圾。是那份"85 分"在骗你

arXiv 2608.22510(ClawProBench)做了一件很扎心的事——

把评测单元从"模型"升级成"模型 + 运行框架 + 原生能力 + 安全护栏"的整张配置清单,跑了 102 道动态办公题 + 68 道冻结审计题。

结论:纯答对率排行榜系统性高估真实办公能力约 10 个绝对点

更狠的是:"撞运气体"和"稳定型选手"可以差出 0.66 vs 0.29 这种量级——同一份 benchmark,给出不同的人当第一名。

🔸 3 个反直觉发现

1️⃣ "native surface"是被藏起来的瓶颈——同样 agent,只让它在沙箱工作区摆弄文件是 0.64 分;让它自己用 browsing/memory/subagent 就掉到 0.52 分。差的不是模型能力,是评测方式没模拟真实办公

2️⃣ pass@k 与 strict-3-trial 是完全不同的两个排名——前者靠撞运气,后者才是稳定系统。

3️⃣ full profile 与 frozen holdout 的 Spearman 只有 0.18(CI 跨零)——两个榜单在量不同的能力,不能互推。

🔸 一句话给老板

别再用 final-answer 排行榜挑 Agent。native surface 才是真实瓶颈,撞运气的通过不算通过,安全失败不该被平均稀释。

AI评测 #AI Agent #大模型 #企业选型 #AI安全 #LLM #AI产品 #AI办公