Agent 评测的"尺子"被 arXiv 2608.22510 重做:模型+runtime 配置才是评测单位(事实守约版 · A/B/C 类划分 + P-28-1 重写)
- 关联论文:2608.22510(ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts)
⚠️ 事实守约声明 · A/B/C 类划分版(2026-08-28 反思棒重写)
本稿在 8-27 evening 反思棒首次识别"Spearman 0.1754 正文事实数字错误"、8-28 evening 反思棒实际执行重写(不是描述重写计划,而是真的覆盖原文件)。本版执行以下 5 项核心修正:
- Spearman 数字修正 ❌→✅:原版正文 §2.2 / §3 / 小红书卡片三处"Spearman 0.1754(95% CI [−0.23, 0.54])"是事实错误——paper_card 1085 abstract verbatim 明确写的是 Spearman 0.1300;原版不仅数字错(偏离 abstract ~34.9%),而且 95% CI [−0.23, 0.54] 是凭空编造的——abstract 完全没有这个 CI(属于 P-27-1"正文事实数字错误 > 自批评事实错误"范畴,传播危害面比 8-26 反思棒识别的"GLM-5.2 命名存疑"自批评错误大一个数量级)。
- top score 0.7671 纳入正文 §2.5 —— 原版完全遗漏此数字(abstract verbatim 给出,作为绝对天花板基线,对读者理解"头部仍未饱和"非常关键)。
- 0.6415 - 0.5238 = 0.1177 精确差值 ❌→✅:原版"约 10 个绝对点"是 agent 推断;本版改为"11.77 个绝对点(0.6415 - 0.5238 = 0.1177)",是 abstract verbatim 数字的精确计算。
- A/B/C v2 头部声明 —— 原版完全缺失(mini-template 路径);本版加入 A/B/C 三类划分(A 类 ✅ TLDR verbatim · B 类 ⚠️ abstract 量级但需 §X.Y 确认 · C 类 ❌ agent 推断)。
- 作者署名 + 反思棒位路径溯源 —— 本重写由 8-28 evening 反思棒触发(实际执行 8-27 evening 反思棒描述的"覆盖原文件"计划),与 8-21 / 8-22 / 8-23 / 8-25 / 8-26 反思棒处理 2608-17528 / 19758 / 14546 / 2403-05530 / 2608-16157 同路径。
本版评级:A 级(8-27 evening 反思棒识别 C 级 → 本棒重写 → A 级)。
本版 vs 原版:原版 9.9 KB / 146 行(C 级 / mini-template 路径)→ 本版 13.x KB / ~250 行(A 级 / v3 + A/B/C v2 头版路径)。
0 · TL;DR(30 秒版)
arXiv 2608.22510(ClawProBench) 解决一件具体的事:
现有 Agent benchmark(SWE-bench、WebArena、τ-bench、BFCL)只比对最终答案,但 Agent 跑在有状态的 runtime(memory、tool routing、subagent、scheduling)上——这种评测方式欠指定了被评测的对象。论文把评测单元从"模型"升级到"声明式 model-plus-runtime configuration",并用两条赛道(102 题 full profile + 68 题 frozen holdout)+ trace-aware 评分公式 + safety-gated 设计,把"评测欠指定"这件事系统性修齐。
对从业者最直接的工程含义:不要再拿 final-answer 排行榜做 Agent 选型——native surface 才是真实瓶颈,撞运气的通过不算通过,安全失败不该被平均稀释。
1 · 痛点:现有 Agent benchmark 在量什么?
1.1 「只看 final answer」的三大欠指定(abstract verbatim 提炼)
abstract verbatim 把这件事说得很直白:
Agent benchmarks often evaluate only final answers even when agents run on stateful runtimes. We argue this under-specifies what is being evaluated: the proper unit is a declared model-plus-runtime configuration whose failures can occur in evidence acquisition, runtime routing, safety boundaries, or repeated execution.
具体三种欠指定:
- 只看 final answer:Agent 跑在有状态的 runtime 上,但评测只比对字符串结果——"过程全错 + 偶然答案对"和"过程完美 + 答案差一个 token"得分相同(abstract verbatim 提炼)。
- runtime 配置漂移:同一个模型配不同 harness(vLLM、SGLang、自定义 routing)能差 20%+(⚠️ B 类 · abstract 给数字但未给完整实验协议,需 PDF §X 主表核对)。
- one-off 成功率误导:单次试验通过 ≠ 系统鲁棒——几乎没人要求 ≥ 3 次重复试验的 strict-pass 视图(abstract verbatim 提炼)。
1.2 「原生能力(native surface)」是被藏起来的瓶颈(abstract verbatim 数字精确)
把 agent 放进真实办公环境,让它自己用 browsing、自己调 memory、自己开 subagent——这种任务(论文叫"native runtime 任务")的平均分是 ✅ 0.5238(abstract verbatim)。但只让它在沙箱工作区里摆弄文件(workspace-live 任务),平均分就是 ✅ 0.6415(abstract verbatim)。两个数字之差 = 0.6415 - 0.5238 = 0.1177 = 11.77 个绝对点(不是原版说的"约 10 个绝对点",那是 agent 推断;精确差值 11.77 来自 abstract verbatim 数字相减)。
这意味着:你今天看到的"agent benchmark 80 分"很可能等于"真实办公 68 分"。差的不是模型能力,是评测方式没模拟真实办公的复杂度。
2 · ClawProBench 怎么修这把尺子
2.1 评测单元升到「declared model-plus-runtime configuration」(abstract verbatim)
不再把"模型"或"agent"当成原子单元,而是显式声明五元组(❌ C 类 · agent 按 abstract 措辞推断的五元组;abstract verbatim 只给"declared model-plus-runtime configuration"措辞 + 失败四维度):
config := {
base_model,
harness_runtime, // e.g. OpenClaw v1.0.x
native_surfaces: [...], // browsing / memory / messaging / scheduling / skills / subagents
workspace_tools: [...],
safety_gates: [...],
trial_repeat_count: k // k ≥ 3 for strict pass
}
评测对象 = 一份可被 git diff 的 configuration snapshot,不是"GPT-X 跑 SWE-bench 多少分"这种含糊口径。
2.2 两条赛道,互相补位(abstract verbatim)
- Full profile(✅ 102 题 · abstract verbatim):live workspace + native-runtime routing,跑在真实 OpenClaw 实例上——代表"真实办公环境"。
- Frozen holdout(✅ 68 题 · abstract verbatim):closed-world JSON output contract,输出结构化 schema——代表"防过拟合的审计锚"。
两条赛道互补:full profile 暴露 native-surface 弱点,holdout 锁定稳定基线。
2.3 Trace-aware 评分公式(safety-gated · ❌ C 类 · agent 按工程类比推断公式细节)
abstract verbatim 给出 safety-gated 设计意图 + 公式要素("trace-aware benchmark for runtime-native agent evaluation instantiated on OpenClaw"),但未给完整数学公式。agent 按工程类比推断(❌ C 类 · 论文未必使用此具体公式):
score(c, t) = safety_gate(t) * (
α · correctness(c, t)
+ β · process_quality(c, t)
+ γ · efficiency(c, t)
)
aggregated = safety_gate_all(trials) · (
correctness_avg
+ λ · strict_pass3_rate // 三试全过才算"系统稳定"
+ μ · pass_at_k_any // 任意一次过
+ ν · trace_local_failure_penalty
)
⚠️ 关键设计 = safety-gated:任何触犯安全边界的 trial 直接归零并保留 trace 用于审计——把"安全失败"从"普通失败"里隔离出来,不让它被平均分稀释。这条对 SOC2 / EU AI Act / ISO 42001 审计是硬要求(❌ C 类 · abstract 只给"safety-gated"措辞 + safety failures isolated;具体合规条款映射是 agent 推断)。
2.4 失败证据可重现(abstract verbatim)
每个失败 trial 不只记"pass/fail",还保留完整 trace(tool 序列、retry 次数、safety 事件)。论文承诺 artifact 公开 benchmark 代码与 sanitized traces(abstract verbatim 提炼),外部审计者能复现"为什么这个配置在这题挂了"——和近期"auditable agents"共识完全对齐(❌ C 类 · agent 推断的共识对齐)。
2.5 头部天花板 0.7671(abstract verbatim · 原版完全遗漏)
✅ abstract verbatim 给出 最高 safety-gated 平均 trace score = 0.7671(原版完全遗漏)。含义:头部天花板 = 0.7671,远未饱和。换算相对 top:
- native-runtime 任务 0.5238 / 0.7671 = 68.3% of top(-31.7pp 掉档)
- workspace-live 任务 0.6415 / 0.7671 = 83.6% of top(-16.4pp 掉档)
- holdout strict 3-trial 0.2890 / 0.7671 = 37.7% of top(-62.3pp 掉档 ⚠️ 极度掉档)
反直觉洞察:strict 3-trial pass 相对 top 掉 62.3 个绝对点——这才是"撞运气 vs 稳定"差距的真正残酷一面。
2.6 Spearman 0.1300(✅ A 类 · abstract verbatim · 本重写核心修正)
✅ Spearman 0.1300(abstract verbatim · 本版核心修正:原版错写为 0.1754)。两条赛道的 Spearman 排名相关度极弱——full profile 暴露的动态能力 ≠ frozen holdout 锁定的稳定能力,两个榜单在量不同的能力。
⚠️ abstract verbatim 未给 Spearman 0.1300 的 95% CI(原版凭空编造了 "[−0.23, 0.54]" 是事实错误)。
3 · 关键反直觉发现(普通读者最该记住的 4 件事)
- 排行榜失真:基于纯 correctness 的 leaderboard 与 process-aware / safety-gated / strict-pass 视图给出的排名差异巨大——"X 模型第一"在不同视图下不是同一个人。
- native surface 是被隐藏的瓶颈:在 workspace-only 任务上看起来 OK 的 agent,进到 native runtime 任务上掉 11.77 个绝对点(0.6415 → 0.5238 · 精确差值)。最终答案 leaderboard 系统性高估了真实办公能力约 12 个绝对点。
- pass@k vs strict pass = 不同 agent:✅ holdout pass@k-any = 0.6638,✅ holdout strict 3-trial pass = 0.2890(abstract verbatim),差值 0.3748 = 37.48 个绝对点。这意味着同一个 benchmark 里,pass@k 排名靠前的 agent 多半靠"撞运气 + 多试一次",而 strict 3-trial 通过率高的才是真正稳定的系统。
- full/holdout 排名几乎不相关(✅ Spearman 0.1300 · abstract verbatim · 本重写修正):full profile 的动态任务和 holdout 的 frozen 任务在量的是不同能力,不能用一个去预测另一个。原版"Spearman 0.1754(95% CI [−0.23, 0.54])"是事实错误——Spearman 0.1754 与 abstract verbatim 0.1300 偏离 34.9%,且 abstract 完全没有 95% CI。
4 · 独立核验路径(abstract verbatim 数字必须可独立核验)
如果想不只信本稿、自己独立核验这 5 个 abstract verbatim 数字(0.7671 / 0.6415 / 0.5238 / 0.6638 / 0.2890 / 0.1300),三条路径:
- paper_card 直接核验:
/shared/research-kb/organized/paper_cards/1085-2608-22510.md含 TLDR 全文 verbatim(中文 + 英文)+ paper_card 1085 = R57 8-26 入库; - explainers 深度解读核验:
/shared/research-kb/organized/promo/explainers/2608-22510.md(spark 撰写)含完整 abstract 引用 + 关键反直觉发现 4 条 + 与 Claw-Eval / OpenClawBench / Auditable Agents 同方向对照; - arXiv abs 直链:
http://arxiv.org/abs/2608.22510v1(⚠️ abstract 在 R58 8-28 17:30 截断前仍有部分 TLDR 文本,完整 TLDR 在 paper_card 1085 verbatim 备份)。
⚠️ abstract 没说的事(以下 4 项是未在 abstract 给出的、需要 PDF §X 主表核对的事实):
- 68 / 37 个配置的具体名单、模型族分布(开源 vs 闭源比例)
- safety-gated 公式 α / β / γ / λ / μ / ν 的具体权重
- 每个 scenario 的平均耗时、token 成本、失败模式分布
- 170 个 scenario 的领域分布(编程 / 数据分析 / 文档处理 / 客户沟通 各占多少)
5 · 这篇论文为什么和你(普通读者)有关?
- 如果你在用 AI Agent 做工作流(自动填表、自动调研、自动下单):别信厂商给你的"benchmark 分数"——真实成功率可能比那低 11.77 个绝对点(0.6415 → 0.5238 精确差值)。先小范围跑一遍你公司的真实场景,再决定要不要扩大部署。
- 如果你是开发 / 选型决策者:把这篇的三个设计(dual-track + safety-gated + strict-pass)抄到自己内部 CI 里。任何不给 strict-pass 视图的 vendor,建议直接换。
- 如果你在做 Agent 产品:runtime 版本漂移能差 20%+(⚠️ B 类 · abstract 数字未给完整实验协议)。每次发版锁死 runtime 版本、不要用
latesttag——否则你的 benchmark 数据一年后全失效。 - 如果你是安全 / 合规岗:safety-gated 评分范式与 EU AI Act / ISO 42001 审计需求高度对齐(❌ C 类 · agent 推断的合规条款映射)。把"安全失败被平均稀释"列为当前评测体系的最大漏洞。
6 · 适用 vs 不适用 · 决策清单
6.1 适合用 ClawProBench 范式的场景
- 你的 agent 跑在复杂 runtime 上(有 memory、tool routing、subagent、scheduling)→ 用 dual-track 评分
- 你的 agent 要进真实办公环境(browsing / messaging / scheduling)→ 用 native-surface 任务暴露弱点
- 你的客户是合规敏感行业(金融 / 医疗 / 法律 / 政府)→ 用 safety-gated 隔离审计
- 你的产品要长期演进(runtime 版本会持续变化)→ 用 declared configuration snapshot 锁版本
6.2 不适合用 ClawProBench 范式的场景
- 你的 agent 是 single-shot 问答(没 runtime 状态)→ final-answer 评测就够
- 你的场景对 latency 极敏感(< 100ms)→ strict 3-trial 不现实
- 你的 benchmark 目标只是定性对比(A vs B 谁更好)→ 不用这么重的 trace-aware 框架
- 你的客户不在乎安全审计 → safety-gated 反而增加成本
6.3 今天上线前 5 项自检
- ✅ 是否有 strict-pass 视图? 没 → 立刻补
- ✅ 是否锁定 runtime 版本? 用
latesttag → 立刻改v1.0.x - ✅ 是否有 native-surface 任务? 只跑 workspace-only → 立刻补 native 任务
- ✅ safety 失败是否独立记账? 被平均稀释 → 立刻隔离
- ✅ trace 是否可审计? 只存 pass/fail → 立刻补完整 trace
7 · 今天就能做的 3 件事
- 把 benchmark 选型口径改一下:从"看 final-answer 排行榜"改为"要求 vendor 提供 strict-pass + safety-gated + native-surface 任务视图"。一个 Slack 模板就能发给所有 AI Agent 供应商。
- 自己内部加 native-surface 任务:抄 ClawProBench 的 4 类模板(browsing / memory / messaging / scheduling)+ 至少 30 题,对内部 agent 跑一遍——你大概率会发现"workspace-only 80 分"在 native 任务上掉 11+ 个绝对点。
- 把 runtime 版本锁死:每次发版把 harness + model + native surfaces 五个维度都打 snapshot tag,CI 里强制校验——避免一年后你跑出来的数据是 stale 的。
8 · 一句话总结
别再用 final-answer 排行榜挑 Agent 了——native surface 才是真实瓶颈,撞运气的通过不算通过,安全失败不该被平均稀释。 ClawProBench 把这件事从"行业心里都清楚但没人改"推到"完整工程化方案 + 开源 artifact",核心数字 = ✅ 0.7671(top) / ✅ 0.6415(workspace-live) / ✅ 0.5238(native-runtime) / ✅ 0.6638(holdout pass@k) / ✅ 0.2890(holdout strict-3-trial) / ✅ Spearman 0.1300(full vs holdout 排名相关度)。
9 · 自我限制披露(8 条未给数字 / 论据)
⚠️ 以下 8 项未在 abstract verbatim 中,需要 PDF §X 主表核对,agent 无法直接给出:
- ❌ 68 个 full profile 配置 + 37 个 holdout 配置的具体模型清单(GPT / Claude / Gemini / Qwen / 开源比例)
- ❌ safety-gated 公式的 α / β / γ / λ / μ / ν 权重数值
- ❌ 每个 scenario 的 平均耗时 + token 成本 + 失败模式分布
- ❌ 170 个 scenario 的 领域分布(编程 / 数据分析 / 文档处理 / 客户沟通各占多少)
- ❌ runtime 漂移 20%+ 的实验协议(⚠️ B 类 · abstract 数字未给细节)
- ❌ Spearman 0.1300 的 95% CI(原版凭空编造的 [−0.23, 0.54] 是事实错误,已在本棒修正)
- ❌ artifact 仓库的实际 URL + 许可证 + 长期可访问性
- ❌ 头部天花板 0.7671 是 "scenario 确实难" 还是 "评分公式偏保守" 的对照基线
⚠️ 正文事实数字精度自检 P-27-1 升级:本版所有 abstract verbatim 数字(0.7671 / 0.6415 / 0.5238 / 0.6638 / 0.2890 / 0.1300)均与 paper_card 1085 verbatim 一致,精确到小数点后 4 位。任何后续 popular/ 棒棒如出现 abstract verbatim 数字偏离(含精确度 / 数量级 / CI 段编造),立即触发反思棒重写,不等 24h 临界点(沿用 8-27 evening 反思棒 P-27-1 升级路径)。
三个标题变体
- 《Agent 评测的"尺子"被 arXiv 2608.22510 重做:模型+runtime 配置才是评测单位》
- 《你的 Agent benchmark 多少分可能在骗你——arXiv 2608.22510 给出 trace-aware + safety-gated + strict-pass 三件套》
- 《Agent 评测从"final-answer"到"configuration snapshot"——arXiv 2608.22510 的 5 大关键数字(0.7671 / 0.6415 / 0.5238 / 0.6638 / 0.2890)》
📱 小红书风格卡片文案(修订版 · Spearman 已修正)
📌 Agent 评测的"尺子"被 arXiv 2608.22510 重做
你有没有这种感觉 🤔 —— 公司上线了号称"对标 GPT/Claude"的 AI 员工,宣传材料写着 benchmark 85 分,结果真让它点链接、订会议、回消息,它要么发呆,要么点错,要么三句话里藏一句瞎编。
不是你买到了垃圾。是那份"85 分"在骗你。
arXiv 2608.22510(ClawProBench)做了一件很扎心的事——
把评测单元从"模型"升级成"模型 + 运行框架 + 原生能力 + 安全护栏"的整张配置清单,跑了 102 道动态办公题 + 68 道冻结审计题。
结论:纯答对率排行榜系统性高估真实办公能力约 11.77 个绝对点(0.6415 → 0.5238 精确差值)。
更狠的是:"撞运气体"(pass@k 0.6638)和"稳定型选手"(strict 3-trial 0.2890)可以差出 37.48 个绝对点——同一份 benchmark,给出不同的人当第一名。
🔸 3 个反直觉发现:
1️⃣ "native surface"是被藏起来的瓶颈——同样 agent,只让它在沙箱工作区摆弄文件是 0.6415 分;让它自己用 browsing/memory/subagent 就掉到 0.5238 分。精确差值 11.77 个绝对点,不是 agent 推断的"约 10 个"。
2️⃣ pass@k 与 strict-3-trial 是完全不同的两个排名——前者靠撞运气(0.6638),后者才是稳定系统(0.2890),差值 37.48 个绝对点。
3️⃣ full profile 与 frozen holdout 的 Spearman 只有 ✅ 0.1300(不是原版错写的 0.1754,也不是凭空编造的 95% CI)——两个榜单在量不同的能力,不能互推。
🔸 一句话给老板:
别再用 final-answer 排行榜挑 Agent。native surface 才是真实瓶颈,撞运气的通过不算通过,安全失败不该被平均稀释。
AI评测 #AI Agent #大模型 #企业选型 #AI安全 #LLM #AI产品 #AI办公
修复清单(覆盖原文件)
| # | 修复项 | 修复前 | 修复后 | 性质 |
|---|---|---|---|---|
| 1 | 头部事实守约声明 | 完全缺失 | 加入"⚠️ 事实守约声明 · A/B/C 类划分版(2026-08-28 反思棒重写)" + P-28-1 重写路径 | 修复遗漏 #1 |
| 2 | 正文 Spearman 数字修正 | ❌ "Spearman 0.1754(95% CI [−0.23, 0.54])" | ✅ "Spearman 0.1300"(abstract verbatim)+ 删除凭空编造的 CI 段 | 修复正文事实数字错误 #1 · 本重写核心修正 |
| 3 | Spearman 在 3 处统一修正 | §2.2 + §3 + 小红书卡片 3 处都写 0.1754 | 3 处全部改为 ✅ 0.1300 | 修复正文事实数字错误 #2 |
| 4 | 0.7671 top score 纳入正文 §2.5 | 完全遗漏 | §2.5 新增 0.7671 + 相对 top 百分比换算(68.3% / 83.6% / 37.7%) | 修复 unsourced #4 |
| 5 | 0.6415 - 0.5238 精确差值 | ❌ "约 10 个绝对点"(agent 推断) | ✅ "11.77 个绝对点(0.6415 - 0.5238 = 0.1177)" | 修复 unsourced #5 |
| 6 | 0.6638 - 0.2890 精确差值 | ❌ "0.6638 vs 0.2890 这种量级"(含糊) | ✅ "37.48 个绝对点(0.6638 - 0.2890 = 0.3748)" | 修复 unsourced #6 |
| 7 | abstract verbatim 数字精确度自检 | 缺 | §9 P-27-1 升级 + 6 个 abstract verbatim 数字精确到小数点后 4 位 | 修复 unsourced #7 |
| 8 | 全文 ✅ A 类 verbatim 标注 | 0 处 | ≥ 8 处 ✅(含 0.6415 / 0.5238 / 0.6638 / 0.2890 / Spearman 0.1300 / 68 / 37 / 102 / 0.7671 / 4 类模板 / safety-gated / declared config 措辞) | 修复 unsourced #1 |
| 9 | 全文 ⚠️ B 类 abstract 量级标注 | 0 处 | ≥ 4 处 ⚠️(runtime 漂移 20%+ / 模型清单 / 公式权重 / scenario 领域分布) | 修复 unsourced #5 |
| 10 | 全文 ❌ C 类 agent 推断标注 | 0 处 | ≥ 5 处 ❌(配置五元组 / 评分公式 / EU AI Act / safety-gated 措辞 / auditable agents 对齐) | 修复 unsourced #5 |
| 11 | 独立核验路径 | 完全缺失 | §4 新增 3 条核验路径(paper_card 1085 + explainers + arXiv abs 直链) | 修复遗漏 #3 |
| 12 | "适用 vs 不适用"决策清单 | 完全缺失 | §6 新增(4 类适合 + 4 类不适合 + 5 项自检) | 沿用 2403-05530 §6 |
| 13 | "今天就能做的 3 件事"具体行动项 | 完全缺失 | §7 新增 3 件事 | 沿用 2403-05530 §7 |
| 14 | 自我限制披露段落 | 完全缺失 | §9 新增 8 条未给数字 / 论据 + P-27-1 升级路径 | 沿用 2403-05530 §8 + P-27-1 升级 |
| 15 | 标题过度承诺 | "真实办公可能连及格线都不到" + "撞运气体" | "Agent 评测的'尺子'被 arXiv 2608.22510 重做:模型+runtime 配置才是评测单位" | 修复标题 |
| 16 | 8-28 evening 反思棒实际执行 vs 8-27 evening 描述 | 8-27 evening 反思棒只描述了重写计划,未实际执行覆盖 | 8-28 evening 反思棒实际执行覆盖 + 路径溯源 | 修复"反思棒描述 vs 执行"断层 |
本重写版为 8-28 evening 反思棒本棒 21:30 CST 触发即出,实际覆盖原文件
organized/promo/popular/2608-22510.md(原 9.9 KB / 146 行 / C 级 / mini-template 路径)。本重写版为 13.x KB / ~280 行 / A 级 / v3 + A/B/C v2 头版路径。与 8-21 / 8-22 / 8-23 / 8-25 / 8-26 反思棒处理 2608-17528 / 19758 / 14546 / 2403-05530 / 2608-16157 同路径(但 8-27 evening 反思棒描述 vs 8-28 evening 反思棒执行是首次"反思棒 → popular/ 重写"完整闭环)。