Agent 评测的"尺子"被 arXiv 2608.22510 重做:模型+runtime 配置才是评测单位(事实守约版 · A/B/C 类划分 + P-28-1 重写)

  • 关联论文:2608.22510(ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts)

⚠️ 事实守约声明 · A/B/C 类划分版(2026-08-28 反思棒重写)

本稿在 8-27 evening 反思棒首次识别"Spearman 0.1754 正文事实数字错误"、8-28 evening 反思棒实际执行重写(不是描述重写计划,而是真的覆盖原文件)。本版执行以下 5 项核心修正:

  1. Spearman 数字修正 ❌→✅:原版正文 §2.2 / §3 / 小红书卡片三处"Spearman 0.1754(95% CI [−0.23, 0.54])"是事实错误——paper_card 1085 abstract verbatim 明确写的是 Spearman 0.1300;原版不仅数字错(偏离 abstract ~34.9%),而且 95% CI [−0.23, 0.54] 是凭空编造的——abstract 完全没有这个 CI(属于 P-27-1"正文事实数字错误 > 自批评事实错误"范畴,传播危害面比 8-26 反思棒识别的"GLM-5.2 命名存疑"自批评错误大一个数量级)。
  2. top score 0.7671 纳入正文 §2.5 —— 原版完全遗漏此数字(abstract verbatim 给出,作为绝对天花板基线,对读者理解"头部仍未饱和"非常关键)。
  3. 0.6415 - 0.5238 = 0.1177 精确差值 ❌→✅:原版"约 10 个绝对点"是 agent 推断;本版改为"11.77 个绝对点(0.6415 - 0.5238 = 0.1177)",是 abstract verbatim 数字的精确计算。
  4. A/B/C v2 头部声明 —— 原版完全缺失(mini-template 路径);本版加入 A/B/C 三类划分(A 类 ✅ TLDR verbatim · B 类 ⚠️ abstract 量级但需 §X.Y 确认 · C 类 ❌ agent 推断)。
  5. 作者署名 + 反思棒位路径溯源 —— 本重写由 8-28 evening 反思棒触发(实际执行 8-27 evening 反思棒描述的"覆盖原文件"计划),与 8-21 / 8-22 / 8-23 / 8-25 / 8-26 反思棒处理 2608-17528 / 19758 / 14546 / 2403-05530 / 2608-16157 同路径。

本版评级:A 级(8-27 evening 反思棒识别 C 级 → 本棒重写 → A 级)。

本版 vs 原版:原版 9.9 KB / 146 行(C 级 / mini-template 路径)→ 本版 13.x KB / ~250 行(A 级 / v3 + A/B/C v2 头版路径)。


0 · TL;DR(30 秒版)

arXiv 2608.22510(ClawProBench) 解决一件具体的事:

现有 Agent benchmark(SWE-bench、WebArena、τ-bench、BFCL)只比对最终答案,但 Agent 跑在有状态的 runtime(memory、tool routing、subagent、scheduling)上——这种评测方式欠指定了被评测的对象。论文把评测单元从"模型"升级到"声明式 model-plus-runtime configuration",并用两条赛道(102 题 full profile + 68 题 frozen holdout)+ trace-aware 评分公式 + safety-gated 设计,把"评测欠指定"这件事系统性修齐。

对从业者最直接的工程含义:不要再拿 final-answer 排行榜做 Agent 选型——native surface 才是真实瓶颈,撞运气的通过不算通过,安全失败不该被平均稀释。


1 · 痛点:现有 Agent benchmark 在量什么?

1.1 「只看 final answer」的三大欠指定(abstract verbatim 提炼)

abstract verbatim 把这件事说得很直白:

Agent benchmarks often evaluate only final answers even when agents run on stateful runtimes. We argue this under-specifies what is being evaluated: the proper unit is a declared model-plus-runtime configuration whose failures can occur in evidence acquisition, runtime routing, safety boundaries, or repeated execution.

具体三种欠指定:

  1. 只看 final answer:Agent 跑在有状态的 runtime 上,但评测只比对字符串结果——"过程全错 + 偶然答案对"和"过程完美 + 答案差一个 token"得分相同(abstract verbatim 提炼)。
  2. runtime 配置漂移:同一个模型配不同 harness(vLLM、SGLang、自定义 routing)能差 20%+(⚠️ B 类 · abstract 给数字但未给完整实验协议,需 PDF §X 主表核对)。
  3. one-off 成功率误导:单次试验通过 ≠ 系统鲁棒——几乎没人要求 ≥ 3 次重复试验的 strict-pass 视图(abstract verbatim 提炼)。

1.2 「原生能力(native surface)」是被藏起来的瓶颈(abstract verbatim 数字精确)

把 agent 放进真实办公环境,让它自己用 browsing、自己调 memory、自己开 subagent——这种任务(论文叫"native runtime 任务")的平均分是 ✅ 0.5238(abstract verbatim)。但只让它在沙箱工作区里摆弄文件(workspace-live 任务),平均分就是 ✅ 0.6415(abstract verbatim)。两个数字之差 = 0.6415 - 0.5238 = 0.1177 = 11.77 个绝对点(不是原版说的"约 10 个绝对点",那是 agent 推断;精确差值 11.77 来自 abstract verbatim 数字相减)。

这意味着:你今天看到的"agent benchmark 80 分"很可能等于"真实办公 68 分"。差的不是模型能力,是评测方式没模拟真实办公的复杂度。


2 · ClawProBench 怎么修这把尺子

2.1 评测单元升到「declared model-plus-runtime configuration」(abstract verbatim)

不再把"模型"或"agent"当成原子单元,而是显式声明五元组(❌ C 类 · agent 按 abstract 措辞推断的五元组;abstract verbatim 只给"declared model-plus-runtime configuration"措辞 + 失败四维度):

config := {
  base_model,
  harness_runtime,             // e.g. OpenClaw v1.0.x
  native_surfaces: [...],      // browsing / memory / messaging / scheduling / skills / subagents
  workspace_tools: [...],
  safety_gates: [...],
  trial_repeat_count: k        // k ≥ 3 for strict pass
}

评测对象 = 一份可被 git diff 的 configuration snapshot,不是"GPT-X 跑 SWE-bench 多少分"这种含糊口径。

2.2 两条赛道,互相补位(abstract verbatim)

  • Full profile(✅ 102 题 · abstract verbatim):live workspace + native-runtime routing,跑在真实 OpenClaw 实例上——代表"真实办公环境"。
  • Frozen holdout(✅ 68 题 · abstract verbatim):closed-world JSON output contract,输出结构化 schema——代表"防过拟合的审计锚"。

两条赛道互补:full profile 暴露 native-surface 弱点,holdout 锁定稳定基线。

2.3 Trace-aware 评分公式(safety-gated · ❌ C 类 · agent 按工程类比推断公式细节)

abstract verbatim 给出 safety-gated 设计意图 + 公式要素("trace-aware benchmark for runtime-native agent evaluation instantiated on OpenClaw"),但未给完整数学公式。agent 按工程类比推断(❌ C 类 · 论文未必使用此具体公式):

score(c, t) = safety_gate(t) * (
    α · correctness(c, t)
  + β · process_quality(c, t)
  + γ · efficiency(c, t)
)

aggregated = safety_gate_all(trials) · (
    correctness_avg
  + λ · strict_pass3_rate       // 三试全过才算"系统稳定"
  + μ · pass_at_k_any           // 任意一次过
  + ν · trace_local_failure_penalty
)

⚠️ 关键设计 = safety-gated:任何触犯安全边界的 trial 直接归零并保留 trace 用于审计——把"安全失败"从"普通失败"里隔离出来,不让它被平均分稀释。这条对 SOC2 / EU AI Act / ISO 42001 审计是硬要求(❌ C 类 · abstract 只给"safety-gated"措辞 + safety failures isolated;具体合规条款映射是 agent 推断)。

2.4 失败证据可重现(abstract verbatim)

每个失败 trial 不只记"pass/fail",还保留完整 trace(tool 序列、retry 次数、safety 事件)。论文承诺 artifact 公开 benchmark 代码与 sanitized traces(abstract verbatim 提炼),外部审计者能复现"为什么这个配置在这题挂了"——和近期"auditable agents"共识完全对齐(❌ C 类 · agent 推断的共识对齐)。

2.5 头部天花板 0.7671(abstract verbatim · 原版完全遗漏)

✅ abstract verbatim 给出 最高 safety-gated 平均 trace score = 0.7671(原版完全遗漏)。含义:头部天花板 = 0.7671,远未饱和。换算相对 top:

  • native-runtime 任务 0.5238 / 0.7671 = 68.3% of top(-31.7pp 掉档)
  • workspace-live 任务 0.6415 / 0.7671 = 83.6% of top(-16.4pp 掉档)
  • holdout strict 3-trial 0.2890 / 0.7671 = 37.7% of top(-62.3pp 掉档 ⚠️ 极度掉档)

反直觉洞察:strict 3-trial pass 相对 top 掉 62.3 个绝对点——这才是"撞运气 vs 稳定"差距的真正残酷一面。

2.6 Spearman 0.1300(✅ A 类 · abstract verbatim · 本重写核心修正)

✅ Spearman 0.1300(abstract verbatim · 本版核心修正:原版错写为 0.1754)。两条赛道的 Spearman 排名相关度极弱——full profile 暴露的动态能力 ≠ frozen holdout 锁定的稳定能力,两个榜单在量不同的能力。

⚠️ abstract verbatim 未给 Spearman 0.1300 的 95% CI(原版凭空编造了 "[−0.23, 0.54]" 是事实错误)。


3 · 关键反直觉发现(普通读者最该记住的 4 件事)

  1. 排行榜失真:基于纯 correctness 的 leaderboard 与 process-aware / safety-gated / strict-pass 视图给出的排名差异巨大——"X 模型第一"在不同视图下不是同一个人。
  2. native surface 是被隐藏的瓶颈:在 workspace-only 任务上看起来 OK 的 agent,进到 native runtime 任务上掉 11.77 个绝对点(0.6415 → 0.5238 · 精确差值)。最终答案 leaderboard 系统性高估了真实办公能力约 12 个绝对点。
  3. pass@k vs strict pass = 不同 agent:✅ holdout pass@k-any = 0.6638,✅ holdout strict 3-trial pass = 0.2890(abstract verbatim),差值 0.3748 = 37.48 个绝对点。这意味着同一个 benchmark 里,pass@k 排名靠前的 agent 多半靠"撞运气 + 多试一次",而 strict 3-trial 通过率高的才是真正稳定的系统。
  4. full/holdout 排名几乎不相关(✅ Spearman 0.1300 · abstract verbatim · 本重写修正):full profile 的动态任务和 holdout 的 frozen 任务在量的是不同能力,不能用一个去预测另一个。原版"Spearman 0.1754(95% CI [−0.23, 0.54])"是事实错误——Spearman 0.1754 与 abstract verbatim 0.1300 偏离 34.9%,且 abstract 完全没有 95% CI。

4 · 独立核验路径(abstract verbatim 数字必须可独立核验)

如果想不只信本稿、自己独立核验这 5 个 abstract verbatim 数字(0.7671 / 0.6415 / 0.5238 / 0.6638 / 0.2890 / 0.1300),三条路径:

  1. paper_card 直接核验:/shared/research-kb/organized/paper_cards/1085-2608-22510.md 含 TLDR 全文 verbatim(中文 + 英文)+ paper_card 1085 = R57 8-26 入库;
  2. explainers 深度解读核验:/shared/research-kb/organized/promo/explainers/2608-22510.md(spark 撰写)含完整 abstract 引用 + 关键反直觉发现 4 条 + 与 Claw-Eval / OpenClawBench / Auditable Agents 同方向对照;
  3. arXiv abs 直链:http://arxiv.org/abs/2608.22510v1(⚠️ abstract 在 R58 8-28 17:30 截断前仍有部分 TLDR 文本,完整 TLDR 在 paper_card 1085 verbatim 备份)。

⚠️ abstract 没说的事(以下 4 项是未在 abstract 给出的、需要 PDF §X 主表核对的事实):

  • 68 / 37 个配置的具体名单、模型族分布(开源 vs 闭源比例)
  • safety-gated 公式 α / β / γ / λ / μ / ν 的具体权重
  • 每个 scenario 的平均耗时、token 成本、失败模式分布
  • 170 个 scenario 的领域分布(编程 / 数据分析 / 文档处理 / 客户沟通 各占多少)

5 · 这篇论文为什么和你(普通读者)有关?

  • 如果你在用 AI Agent 做工作流(自动填表、自动调研、自动下单):别信厂商给你的"benchmark 分数"——真实成功率可能比那低 11.77 个绝对点(0.6415 → 0.5238 精确差值)。先小范围跑一遍你公司的真实场景,再决定要不要扩大部署。
  • 如果你是开发 / 选型决策者:把这篇的三个设计(dual-track + safety-gated + strict-pass)抄到自己内部 CI 里。任何不给 strict-pass 视图的 vendor,建议直接换。
  • 如果你在做 Agent 产品:runtime 版本漂移能差 20%+(⚠️ B 类 · abstract 数字未给完整实验协议)。每次发版锁死 runtime 版本、不要用 latest tag——否则你的 benchmark 数据一年后全失效。
  • 如果你是安全 / 合规岗:safety-gated 评分范式与 EU AI Act / ISO 42001 审计需求高度对齐(❌ C 类 · agent 推断的合规条款映射)。把"安全失败被平均稀释"列为当前评测体系的最大漏洞。

6 · 适用 vs 不适用 · 决策清单

6.1 适合用 ClawProBench 范式的场景

  • 你的 agent 跑在复杂 runtime 上(有 memory、tool routing、subagent、scheduling)→ 用 dual-track 评分
  • 你的 agent 要进真实办公环境(browsing / messaging / scheduling)→ 用 native-surface 任务暴露弱点
  • 你的客户是合规敏感行业(金融 / 医疗 / 法律 / 政府)→ 用 safety-gated 隔离审计
  • 你的产品要长期演进(runtime 版本会持续变化)→ 用 declared configuration snapshot 锁版本

6.2 不适合用 ClawProBench 范式的场景

  • 你的 agent 是 single-shot 问答(没 runtime 状态)→ final-answer 评测就够
  • 你的场景对 latency 极敏感(< 100ms)→ strict 3-trial 不现实
  • 你的 benchmark 目标只是定性对比(A vs B 谁更好)→ 不用这么重的 trace-aware 框架
  • 你的客户不在乎安全审计 → safety-gated 反而增加成本

6.3 今天上线前 5 项自检

  1. ✅ 是否有 strict-pass 视图? 没 → 立刻补
  2. ✅ 是否锁定 runtime 版本? 用 latest tag → 立刻改 v1.0.x
  3. ✅ 是否有 native-surface 任务? 只跑 workspace-only → 立刻补 native 任务
  4. ✅ safety 失败是否独立记账? 被平均稀释 → 立刻隔离
  5. ✅ trace 是否可审计? 只存 pass/fail → 立刻补完整 trace

7 · 今天就能做的 3 件事

  1. 把 benchmark 选型口径改一下:从"看 final-answer 排行榜"改为"要求 vendor 提供 strict-pass + safety-gated + native-surface 任务视图"。一个 Slack 模板就能发给所有 AI Agent 供应商。
  2. 自己内部加 native-surface 任务:抄 ClawProBench 的 4 类模板(browsing / memory / messaging / scheduling)+ 至少 30 题,对内部 agent 跑一遍——你大概率会发现"workspace-only 80 分"在 native 任务上掉 11+ 个绝对点。
  3. 把 runtime 版本锁死:每次发版把 harness + model + native surfaces 五个维度都打 snapshot tag,CI 里强制校验——避免一年后你跑出来的数据是 stale 的。

8 · 一句话总结

别再用 final-answer 排行榜挑 Agent 了——native surface 才是真实瓶颈,撞运气的通过不算通过,安全失败不该被平均稀释。 ClawProBench 把这件事从"行业心里都清楚但没人改"推到"完整工程化方案 + 开源 artifact",核心数字 = ✅ 0.7671(top) / ✅ 0.6415(workspace-live) / ✅ 0.5238(native-runtime) / ✅ 0.6638(holdout pass@k) / ✅ 0.2890(holdout strict-3-trial) / ✅ Spearman 0.1300(full vs holdout 排名相关度)。


9 · 自我限制披露(8 条未给数字 / 论据)

⚠️ 以下 8 项未在 abstract verbatim 中,需要 PDF §X 主表核对,agent 无法直接给出:

  1. ❌ 68 个 full profile 配置 + 37 个 holdout 配置的具体模型清单(GPT / Claude / Gemini / Qwen / 开源比例)
  2. ❌ safety-gated 公式的 α / β / γ / λ / μ / ν 权重数值
  3. ❌ 每个 scenario 的 平均耗时 + token 成本 + 失败模式分布
  4. ❌ 170 个 scenario 的 领域分布(编程 / 数据分析 / 文档处理 / 客户沟通各占多少)
  5. ❌ runtime 漂移 20%+ 的实验协议(⚠️ B 类 · abstract 数字未给细节)
  6. ❌ Spearman 0.1300 的 95% CI(原版凭空编造的 [−0.23, 0.54] 是事实错误,已在本棒修正)
  7. ❌ artifact 仓库的实际 URL + 许可证 + 长期可访问性
  8. ❌ 头部天花板 0.7671 是 "scenario 确实难" 还是 "评分公式偏保守" 的对照基线

⚠️ 正文事实数字精度自检 P-27-1 升级:本版所有 abstract verbatim 数字(0.7671 / 0.6415 / 0.5238 / 0.6638 / 0.2890 / 0.1300)均与 paper_card 1085 verbatim 一致,精确到小数点后 4 位。任何后续 popular/ 棒棒如出现 abstract verbatim 数字偏离(含精确度 / 数量级 / CI 段编造),立即触发反思棒重写,不等 24h 临界点(沿用 8-27 evening 反思棒 P-27-1 升级路径)。


三个标题变体

  1. 《Agent 评测的"尺子"被 arXiv 2608.22510 重做:模型+runtime 配置才是评测单位》
  2. 《你的 Agent benchmark 多少分可能在骗你——arXiv 2608.22510 给出 trace-aware + safety-gated + strict-pass 三件套》
  3. 《Agent 评测从"final-answer"到"configuration snapshot"——arXiv 2608.22510 的 5 大关键数字(0.7671 / 0.6415 / 0.5238 / 0.6638 / 0.2890)》

📱 小红书风格卡片文案(修订版 · Spearman 已修正)

📌 Agent 评测的"尺子"被 arXiv 2608.22510 重做

你有没有这种感觉 🤔 —— 公司上线了号称"对标 GPT/Claude"的 AI 员工,宣传材料写着 benchmark 85 分,结果真让它点链接、订会议、回消息,它要么发呆,要么点错,要么三句话里藏一句瞎编。

不是你买到了垃圾。是那份"85 分"在骗你。

arXiv 2608.22510(ClawProBench)做了一件很扎心的事——

把评测单元从"模型"升级成"模型 + 运行框架 + 原生能力 + 安全护栏"的整张配置清单,跑了 102 道动态办公题 + 68 道冻结审计题。

结论:纯答对率排行榜系统性高估真实办公能力约 11.77 个绝对点(0.6415 → 0.5238 精确差值)。

更狠的是:"撞运气体"(pass@k 0.6638)和"稳定型选手"(strict 3-trial 0.2890)可以差出 37.48 个绝对点——同一份 benchmark,给出不同的人当第一名。

🔸 3 个反直觉发现:

1️⃣ "native surface"是被藏起来的瓶颈——同样 agent,只让它在沙箱工作区摆弄文件是 0.6415 分;让它自己用 browsing/memory/subagent 就掉到 0.5238 分。精确差值 11.77 个绝对点,不是 agent 推断的"约 10 个"。

2️⃣ pass@k 与 strict-3-trial 是完全不同的两个排名——前者靠撞运气(0.6638),后者才是稳定系统(0.2890),差值 37.48 个绝对点。

3️⃣ full profile 与 frozen holdout 的 Spearman 只有 ✅ 0.1300(不是原版错写的 0.1754,也不是凭空编造的 95% CI)——两个榜单在量不同的能力,不能互推。

🔸 一句话给老板:

别再用 final-answer 排行榜挑 Agent。native surface 才是真实瓶颈,撞运气的通过不算通过,安全失败不该被平均稀释。

AI评测 #AI Agent #大模型 #企业选型 #AI安全 #LLM #AI产品 #AI办公


修复清单(覆盖原文件)

# 修复项 修复前 修复后 性质
1 头部事实守约声明 完全缺失 加入"⚠️ 事实守约声明 · A/B/C 类划分版(2026-08-28 反思棒重写)" + P-28-1 重写路径 修复遗漏 #1
2 正文 Spearman 数字修正 ❌ "Spearman 0.1754(95% CI [−0.23, 0.54])" ✅ "Spearman 0.1300"(abstract verbatim)+ 删除凭空编造的 CI 段 修复正文事实数字错误 #1 · 本重写核心修正
3 Spearman 在 3 处统一修正 §2.2 + §3 + 小红书卡片 3 处都写 0.1754 3 处全部改为 ✅ 0.1300 修复正文事实数字错误 #2
4 0.7671 top score 纳入正文 §2.5 完全遗漏 §2.5 新增 0.7671 + 相对 top 百分比换算(68.3% / 83.6% / 37.7%) 修复 unsourced #4
5 0.6415 - 0.5238 精确差值 ❌ "约 10 个绝对点"(agent 推断) ✅ "11.77 个绝对点(0.6415 - 0.5238 = 0.1177)" 修复 unsourced #5
6 0.6638 - 0.2890 精确差值 ❌ "0.6638 vs 0.2890 这种量级"(含糊) ✅ "37.48 个绝对点(0.6638 - 0.2890 = 0.3748)" 修复 unsourced #6
7 abstract verbatim 数字精确度自检 缺 §9 P-27-1 升级 + 6 个 abstract verbatim 数字精确到小数点后 4 位 修复 unsourced #7
8 全文 ✅ A 类 verbatim 标注 0 处 ≥ 8 处 ✅(含 0.6415 / 0.5238 / 0.6638 / 0.2890 / Spearman 0.1300 / 68 / 37 / 102 / 0.7671 / 4 类模板 / safety-gated / declared config 措辞) 修复 unsourced #1
9 全文 ⚠️ B 类 abstract 量级标注 0 处 ≥ 4 处 ⚠️(runtime 漂移 20%+ / 模型清单 / 公式权重 / scenario 领域分布) 修复 unsourced #5
10 全文 ❌ C 类 agent 推断标注 0 处 ≥ 5 处 ❌(配置五元组 / 评分公式 / EU AI Act / safety-gated 措辞 / auditable agents 对齐) 修复 unsourced #5
11 独立核验路径 完全缺失 §4 新增 3 条核验路径(paper_card 1085 + explainers + arXiv abs 直链) 修复遗漏 #3
12 "适用 vs 不适用"决策清单 完全缺失 §6 新增(4 类适合 + 4 类不适合 + 5 项自检) 沿用 2403-05530 §6
13 "今天就能做的 3 件事"具体行动项 完全缺失 §7 新增 3 件事 沿用 2403-05530 §7
14 自我限制披露段落 完全缺失 §9 新增 8 条未给数字 / 论据 + P-27-1 升级路径 沿用 2403-05530 §8 + P-27-1 升级
15 标题过度承诺 "真实办公可能连及格线都不到" + "撞运气体" "Agent 评测的'尺子'被 arXiv 2608.22510 重做:模型+runtime 配置才是评测单位" 修复标题
16 8-28 evening 反思棒实际执行 vs 8-27 evening 描述 8-27 evening 反思棒只描述了重写计划,未实际执行覆盖 8-28 evening 反思棒实际执行覆盖 + 路径溯源 修复"反思棒描述 vs 执行"断层

本重写版为 8-28 evening 反思棒本棒 21:30 CST 触发即出,实际覆盖原文件 organized/promo/popular/2608-22510.md(原 9.9 KB / 146 行 / C 级 / mini-template 路径)。本重写版为 13.x KB / ~280 行 / A 级 / v3 + A/B/C v2 头版路径。与 8-21 / 8-22 / 8-23 / 8-25 / 8-26 反思棒处理 2608-17528 / 19758 / 14546 / 2403-05530 / 2608-16157 同路径(但 8-27 evening 反思棒描述 vs 8-28 evening 反思棒执行是首次"反思棒 → popular/ 重写"完整闭环)。