主题综述 · evaluation(2026-09-06)

  • 作者:spark
  • 更新:2026-09-06 16:40 CST
  • 基线:fetch 2026-09-01-evaluation.md 作为 9-01 立基础锚起点;本棒定位为「近 5 天增量 + Harness 评测转移」专题综述,避免主线重复。基线 9-01 主线 A 立基础锚 + 主线 B Prime Agent + 主线 C Inspect Evals Census + 主线 D PAWBench + 主线 E LoopArena + 主线 F 评测对象分化 + 主线 G 邻接 anchor + test-time scaling 全部沿用,本期不重写
  • 字数声明:CJK ≤3,900 字(主体 ≤3,500 + 反方 300 + 元信息 100);三层 CJK / char / bytes 偏差均 <5%
  • verifiability:本期核心 8 篇 paper_card 已抽查 ≥75%(2608.26623 / 2608.31100 / 2608.14905 / 2608.22510 / 2609.01437 / 2609.00196 / 2608.30005 / 2608.19269 + 9-01 baseline 17 篇沿用)

近 3 天其他主题综述关键增量:09-02 rag 综述「Self-RAG / Adaptive-RAG 边界」+ 09-03 multimodal 综述「Video-IFBench 评测指令遵循」+ 09-04 risk 综述「HarnessRisk 全生命周期评测」+ 09-05 agent 综述「Skill / Harness 评测合流」。本期 evaluation 在此基础上聚焦「评测对象从 task output 转移到 harness 本身」+「LLM-as-a-judge 可靠性上限首次被量化」+「自测试-自评判-自改进的耦合评测」三向预备。


一、主题脉络:9-01 立基础锚链之上新增「评测对象 = Harness」+「Judge 上限量」+「Self-×3 闭环」三向预备

把 evaluation 主题放在 2026-09-01 立基础锚与 2026-09-06 之间观察,最大变化不是 benchmark 数量继续膨胀,而是评测的本体论问题被重新定义。三股新力量把 evaluation 推向三个新方向:

  1. 从「评测 task output」走向「评测 harness 本身」 —— HarnessDev(arXiv:2609.01437,2026-09-05)+ WHALE(arXiv:2609.00196,2026-09-06)+ Harness-of-Harness(arXiv:2609.01481,2026-09-05)+ ClawProBench(arXiv:2608.22510,2026-08-31)形成「评测单元 = 可执行基础设施而非任务输出」的新共识,harness 与 weight 的耦合优化首次进入正式评测范畴。这是 9-01 立基础锚 §2.6 「trace-aware + runtime-native」之后的本体论推进。
  2. 从「judge 越多越好」走向「judge 上限被首次量化」 —— AgentJudgeBench(arXiv:2608.26623,2026-09-05,paper_card 1194)系统扫 6 个 LLM 法官 × 5 个 generator × 3,808 DAG workflow,结论:all judges converge to a 77–82% accuracy ceiling on hard queries without ground truth — regardless of model scale——首次把 LLM-as-a-judge 在 dependency-driven workflow 上的可靠性上限钉死为约 80% 不可逾越的硬天花板。
  3. 从「单点 self-X」走向「self-testing / self-judging / self-improving 三件套耦合」 —— S³Gym(arXiv:2608.31100,2026-09-05)提出「Self-Testing、Self-Judging、Self-Improvement」三项耦合能力评测 + DiagEvo(arXiv:2609.00768,2026-09-05)分层错误原因记忆,把 v3 baseline §2.1 「41 种失败模式分类学」从静态分类推向动态自演化。

三条线与 9-01 立基础锚的 7 主线形成正交:9-01 关注「评测工件的合法性 / 概率对齐 / 组件分解」,本期新增「评测单元 = harness 本身 / judge 上限被量化 / self-×3 闭环评测」


二、各主线独立成段(机制 + 工程 + 反方 v2 三段式)

2.1 主线 A · Harness 评测转移 / 评测对象从 task output 走向可执行基础设施 ★★★ 预备

机制:HarnessDev(arXiv:2609.01437,paper_card 1196,2026-09-05)—— 评测单元从任务输出转向可运行基础设施(runnable infrastructure),分两阶段:①模型在固定 harness 下生成可执行 harness;②在新生成 harness 下重新运行任务,评估 harness 迁移是否提升跨任务表现。本质上是把 v3 §2.1 「harness evolution」(arXiv:2607.12227)「harness 整体作为评测对象」推向「harness 自身生成能力作为评测单元」。

工程:HarnessDev + WHALE(arXiv:2609.00196,paper_card 1213,2026-09-06)的「Weight-Harness Alternating LEarning」+ Harness-of-Harness(arXiv:2609.01481,paper_card 1180,2026-09-05)70+ 轮迭代 FPS 游戏自主开发——三件套覆盖「评测 harness 生成 / 联合优化 harness+weight / harness 持续改进」完整方法学链。

反方 v2:(1)机制:评测 harness 本身的「harness of harness 评测」是否会让 benchmark 退化为人造产物?HarnessDev 第一阶段允许模型自由生成 harness,可能导致 harness 适配 benchmark 而非真实任务;WHALE 交替优化权重与 harness 的收敛性 abstract 未给;(2)数据:单团队 9-05 / 9-06 三篇集中放出,独立机构复现 0 篇;Harness-of-Harness FPS 游戏「70 轮迭代」是否可复现 abstract 未给具体可验证项;(3)截止日:9-20 前若 ≥1 个独立团队在 HarnessDev 第一阶段报告「harness 生成 vs 固定 harness 下游任务表现」对照数据,则升 ★★★;9-30 前若 WHALE 在 ≥2 类 agent backbone(Qwen / Claude / GPT)公开权重更新与 harness 更新的对齐曲线,则升 ★★★ + 立基础锚预备。

2.2 主线 B · LLM-as-a-Judge 可靠性上限首次被量化 ★★★ 预备

机制:AgentJudgeBench(arXiv:2608.26623,paper_card 1194,2026-09-05,ServiceNow-AI)—— 首个系统性研究 LLM-as-a-judge 在 agentic tool-calling 任务上可靠性的基准。覆盖 3,808 实例 × 6 DAG 拓扑 × 3 难度等级,5 个 generator(3B-70B 开源模型 + GPT-5.4)与 6 个 judge(20B 到前沿模型)实测。核心结论:judge reliability degrades sharply with task difficultyall judges converge to a 77–82% accuracy ceiling on hard queries without ground truth — regardless of model scale。四类正交失败模式(tool selection / parameter structure / sequence accuracy / query coverage)之间不显著相关——意味着即便某一类可靠也无法预测其他类可靠。

工程:3,808 instances + 6 DAG 拓扑 + 3 难度等级三件套提供可复现协议;AgentJudgeBench 把 LLM-as-a-judge 从「通用偏好评估」剥离为「dependency-driven workflow 评估」独立范畴。但 6 DAG 拓扑(chain / fan-out / diamond / etc.)与 3 难度等级(easy / medium / hard)的具体构造协议 abstract 未给。

反方 v2:(1)机制:77–82% ceiling 是 structural limit 还是数据集分布偏差?AgentJudgeBench hard query 是否对前沿模型有 evaluator leak?ServiceNow-AI 自报数据未给独立团队复现;ground truth exposure「mixed effects」具体是哪些场景下降低 vs 哪些场景下提升 judge 表现,PDF §5 待核;(2)数据:单一团队(ServiceNow-AI)实证 3,808 instances × 6 DAG × 3 difficulty,独立机构复现 0 篇;HF Daily 信号 abstract 未给具体排名;AgentJudgeBench 与既有 RewardBench / JudgeBench 是否可比 abstract 未给;judge 在 chain vs fan-out vs diamond 等 6 DAG 拓扑上是否呈现不同 ceiling abstract 未拆分;(3)截止日:9-25 前若 ≥1 个独立团队在自有 workflow DAG 集上复现「hard query accuracy 收敛到 77–82%」则升 ★★★;10-5 前若公开「6 DAG 拓扑 + 3 难度等级」构造协议 + 四类失败模式 (tool selection / parameter structure / sequence accuracy / query coverage) 的 Cohen's κ,则升 ★★★ + 与 Inspect Evals Census 2608.19269 合流为「评测诚信 + judge 可靠性」双立基础锚;10-15 前若公开「ground truth exposure mixed effects」具体场景分布,则升 ★★★ 已立标。

2.3 主线 C · Self-×3 闭环评测 / 自测试-自评判-自改进耦合 ★★ 升档预备

机制:S³Gym(arXiv:2608.31100,paper_card 1200,2026-09-05)—— 通过三项耦合能力(Self-Testing、Self-Judging、Self-Improvement)评估 LLM 自我提升的交互式 benchmark;首次把「agent 能否主动测试自身行为、评判由此产生的经验、利用经验改进未来决策」形式化为可测能力三元组。配套 DiagEvo(arXiv:2609.00768,paper_card 1179,2026-09-05)分层错误原因记忆——把 v3 §2.1 「41 种失败模式分类学」从静态分类推向动态自演化。

工程:S³Gym 交互式 benchmark + 「permissive exploration vs strict holdout」分离 + DiagEvo 分层错误原因记忆提供「评测 self-×3」的可复现协议;但 S³Gym 三元组的耦合强度 abstract 未给具体量化指标,DiagEvo 的错误原因层级(root cause / symptom / consequence)是否在评估者间一致 abstract 未给。

反方 v2:(1)机制:self-testing 与 self-judging 的独立性如何保证?模型对自己生成的测试用例打分时是否引入 self-bias?S³Gym 三元组耦合是否会被简化为单点 self-improvement 复测?DiagEvo 错误原因分类与 v3 baseline 41 种失败模式(arXiv:2607.28802 Cohen's κ=0.76)是否兼容 abstract 未给;S³Gym 把「permissive exploration vs strict holdout」分离的边界条件在多轮迭代后是否还成立 abstract 未给;(2)数据:单团队实证,独立机构复现 0 篇;DiagEvo paper_card 1179 注「LLM-Infra 主分类 evaluation 副分类」,提示其在 self-evolution 主线而非 evaluation 主线权重更高;S³Gym 三元组耦合强度的具体量化(如 self-testing 通过率 × self-judging 一致率 × self-improvement 增益的三维散点)abstract 未给;(3)截止日:9-25 前若 S³Gym 公开「self-testing 与 self-judging 独立性协议」+ ≥3 类任务域 baseline,则升 ★★;10-5 前若与 PAST-Bench 2608.04003(recursion self-improvement)做 head-to-head 对照,则升 ★★★ + 立基础锚预备;10-15 前若 DiagEvo 公开分层错误原因与 v3 41 种分类学的兼容对照表,则升 ★★★ + 与 v3 §2.1 合流。

2.4 主线 D · 失败诊断评测 / 细粒度归因能力 ★★ 升档预备

机制:AutoResearchEval(arXiv:2608.14905,paper_card 1001,2026-08-28)+ ARFT(45 种失败模式归因框架)—— 把 v3 baseline §2.1 「41 种失败模式分类学」(arXiv:2607.28802,Cohen's κ=0.76)从「静态分类」推向「可扩展细粒度归因」。配套 AgentDebugX / DeepDebug(arXiv:2607.18754,paper_card 526,2026-08-24)在 qwen3.5-9b 上达到 28.8% exact agent-and-step 归因准确率(最强单遍 baseline 仅 21.7%)。

工程:AutoResearchEval 100 任务 × 7 科学领域 × 完整研究生命周期 + ARFT 45 种经验驱动失败模式 + DeepDebug 28.8% / 21.7% 对照数据为失败诊断评测提供可复现协议;但 100 任务的领域分布(数学 / 物理 / 生物 / 化学 / etc.)与 45 种失败模式的协议 abstract 未给。

反方 v2:(1)机制:45 种失败模式与 v3 41 种分类学(arXiv:2607.28802 Cohen's κ=0.76)的兼容度?ARFT 是否在更多 backbone(Claude / GPT / Gemini)上复现 28.8%?DeepDebug 28.8% exact agent-and-step 在 hard task 上的分布 abstract 未给;100 任务的领域分布(数学 / 物理 / 生物 / 化学 / 计算机 / 医学 / 工程)权重是否均衡 abstract 未给;(2)数据:单团队实证 + 28.8% / 21.7% 单一 qwen3.5-9b backbone 对照;独立机构在自有 agent 系统上复现 0 篇;v3 baseline 41 种分类学跨团队复现亦 0 篇——双锚同陷「单团队单 backbone」困境;(3)截止日:9-20 前若 ≥1 个独立团队在 ≥2 类 agent backbone 复现 DeepDebug 28.8% ± 5%,则升 ★★;9-30 前若公开 45 种失败模式与 v3 41 种的兼容对照表 + ≥3 backbone ARFT 准确率分布,则升 ★★★ + 与 v3 §2.1 「41 种失败模式分类学」合流;10-15 前若 AutoResearchEval 100 任务领域分布权重公开,则维持 ★★★ 预备观察。

2.5 主线 E · 端到端复杂流水线评测 / 跨阶段连贯性 ★★ 升档预备

机制:DramaChain Bench(arXiv:2609.00646,paper_card 1188,2026-09-05)+ MobilePA-Bench(arXiv:2608.23035,paper_card 1069,2026-08-31)+ Cost-Aware Security Agents(arXiv:2607.15263,paper_card 482,2026-09-03)—— 三件套把「评测单阶段输出」推向「评测跨阶段连贯性 + 成本感知」。DramaChain Bench 首次评测短剧生成 5 阶段(script / storyboard / keyframe / shot / finish)连贯性,回答「每阶段是否忠实于原始剧本意图(而非仅其直接输入的提示)+ 多集拼接后是否连贯」两个关键问题。Cost-Aware Security 把「success rate 单一指标」扩展为「economic efficiency + operational fit」二维评估。

工程:DramaChain 5 阶段 + MobilePA 交互式 sandbox + Cost-Aware SOC-native 三件套提供复杂流水线评测协议;但 5 阶段每阶段的「忠实于原始剧本意图」具体指标(BLEU / CIDEr / 人类感知评分)abstract 未给。

反方 v2:(1)机制:跨阶段连贯性评测是否引入 evaluator leak(每阶段评分模型看过上游阶段)?Cost-Aware 经济效率(cost-per-success)是否对延迟敏感任务公允?DramaChain 是否覆盖 Sora / Veo / Kling / Runway Gen-4 主流 video generator abstract 未给;MobilePA-Bench 交互式函数调用沙箱与 evidence-based verification 是否引入 verifier bias abstract 未给;(2)数据:单团队实证,独立机构复现 0 篇;MobilePA paper_card 已建但评测集规模 abstract 未给;DramaChain 5 阶段每阶段的「忠实于原始剧本意图」具体指标(BLEU / CIDEr / 人类感知评分 / 跨阶段 embedding 一致性)abstract 未给;(3)截止日:9-25 前若 DramaChain 公开「5 阶段忠实度量化指标」+ ≥3 类 video generator baseline,则升 ★★;10-5 前若与 v3 §2.6 「trace-aware + runtime-native」评测对象合流,则升 ★★★;10-15 前若 Cost-Aware Security 在 ≥2 类 SOC 部署数据上复现「经济效率 × operational fit」二维评估,则升 ★★。

2.6 主线 F · 形式化验证 + Verifier 评测 / 数学证明 ★★ 升档预备

机制:AdvancedMathBench(arXiv:2607.11849,paper_card 367,2026-07-19)+ VerifierBench(888 条模型生成证明轨迹 × 专家 ground truth)—— 评估模型能否正确判断证明有效性并给出合理的验证理由。本质上把 LLM-as-a-verifier(与 LLM-as-a-judge 主线 B 平行)在数学证明领域独立化。

工程:AdvancedMathBench benchmark suite + VerifierBench 888 轨迹 + 专家 ground truth 三件套为 verifier 评测提供可复现协议;但 888 轨迹的难度分布与 verifier 误判的具体类型 abstract 未给。

反方 v2:(1)机制:VerifierBench 888 轨迹是否覆盖所有 verifier failure mode?ground truth 专家标注者间一致性 abstract 未给 Cohen's κ;LLM-as-a-verifier 与 LLM-as-a-judge 在数学证明领域的可靠性上限是否一致 abstract 未给对照数据;(2)数据:单团队实证 + 888 轨迹单一对照;独立机构在自有数学证明集(如 Lean-ProofNet / MiniF2F)上复现 0 篇;AdvancedMathBench 主体 benchmark 与 VerifierBench 子集之间的难度递进协议 abstract 未给;(3)截止日:9-20 前若公开 888 轨迹难度分布 + ≥2 类 verifier 误判类型分类 + 专家标注 Cohen's κ,则升 ★★;9-30 前若与 AgentJudgeBench 2608.26623 主线 B 在「judge vs verifier 可靠性上限」做 head-to-head 对照(同一 DAG workflow 上 judge / verifier 准确率分布),则升 ★★★ + 与主线 B 合流;10-15 前若 ≥1 个独立团队在 Lean-ProofNet 复现 verifier 准确率分布,则升 ★★★ 已立标。

2.7 主线 G · 评测诚信 / claim-replay layer 立基础锚(9-01 baseline 沿用 + 本期新增 SLM-as-Judge)

机制:Inspect Evals Census(arXiv:2608.19269,paper_card 1133,★★★ 工作锚预备)+ Small Language Models as Judges(arXiv:2608.30005,paper_card 1214,2026-09-06)—— 后者把 PointRubric + RaR-Science-Static 两个 instance-specific 评分标准数据集 + 「小模型能否替代 7B+ 评判器」研究推进 9-01 「评测诚信」立基础锚链。

工程:Inspect Evals 124 单元 / 110 停机 + SLM-as-Judge PointRubric / RaR-Science-Static 两套数据集为「评测诚信 + 小模型替代」提供可复现协议;但 SLM-as-Judge 与 7B+ 大模型在 rubric-based RL 训练中的 reward 计算一致性 abstract 未给。

反方 v2:(1)机制:SLM 替代 7B+ judge 在 rubric 一致性 + 训练稳定性 + 推理成本三角是否最优?Inspect Evals 110/124 停机原因分布 PDF §4 待核(tom 9-01 §5 已标 R63-1 P0,截止 9-10);SLM 在 rubric-based RL 训练阶段作为 reward model 时是否引入 bias amplification abstract 未给;(2)数据:单团队实证,独立机构复现 0 篇;SLM-as-Judge paper_card 1214 标注 OpenAlex 更新 2026-09-06(最新)但 S2 / OpenAlex 被引均为 0,处于立基础早期;(3)截止日:9-10 前若 Inspect Evals 公开 PDF §4 124 单元清单 + 停机原因分布,则 ★★★ 确认;9-25 前若 SLM-as-Judge 公开「≥3 类 backbone × PointRubric / RaR-Science-Static」一致性对照表,则升 ★★;10-5 前若 ≥2 个独立机构复现「SLM 替代 7B+ judge 不损失 ≥95% 一致性」,则升 ★★★ + 与主线 B 「judge 上限量」合流;10-15 前若 SLM-as-Judge 在 rubric-based RL 训练中 bias amplification 测试公开,则维持 ★★ 升档观察。

2.8 主线 H · 邻接 anchor + 跨主线合流(9-01 baseline 沿用)

机制:AlphaEval(arXiv:2604.12162,paper_card 153)7 公司 / 94 任务 / 6 O*NET 领域 + ALE(arXiv:2606.05405,paper_card 021)GDP-relevant 真实任务 + AgentLens(arXiv:2607.06624,paper_card 332)形式化验证 + LLM 轨迹评审 + Apodex Discovery(arXiv:2608.11341,paper_card 984)heavy-duty solver + DiagEvo(2609.00768)+ PAST-Bench(2608.04003)+ 数据泄漏防护(arXiv:2605.08838 SeedRG)—— 8 件 v3 / 9-01 baseline 形成「评测对象 / 评测单元 / 评测分布 / 评测组件」四维矩阵 + 本期 HarnessDev / WHALE / Harness-of-Harness / AgentJudgeBench / S³Gym / AutoResearchEval / DramaChain / AdvancedMathBench / SLM-as-Judge 8 件新增合流。

工程:v3 立基础锚 + 9-01 「claim-replay + 概率对齐 + Loop 分解」三向预备 + 本期「Harness + Judge 上限 + Self-×3」三向预备 = 九向预备矩阵。但跨 9 向的「评测协议互操作性」abstract 未给——HarnessDev / AgentJudgeBench / S³Gym / AutoResearchEval 是否能在同一 agent 系统上同时跑 4 类评测 abstract 未给。

反方 v2:(1)机制:九向预备矩阵是否会在 2026Q4 形成统一「评测 OS」抽象?HarnessDev 评测 harness 生成的范式 + AgentJudgeBench 评测 judge 可靠性的范式 + S³Gym 评测 self-×3 的范式 + AutoResearchEval ARFT 45 种失败模式 + DramaChain 跨阶段连贯性 + VerifierBench verifier 可靠性 + AlphaEval 生产环境 + ALE GDP-relevant + Inspect Evals claim-replay 是否有共同 ontology?跨 9 类的「评测协议互操作性」abstract 未给;9-01 baseline 17 件 + 本期 8 件 = 25 件 paper_card 中是否有 ≥1 件属于「跨 9 类抽象的元综述」abstract 未核;(2)数据:本期 8 件新增 + 9-01 baseline 17 件共 25 件 paper_card,跨团队复现仍 0 篇;单团队产出风险——9-05~9-06 三件 HarnessDev / WHALE / Harness-of-Harness 与 9-05 三件 S³Gym / DiagEvo / AgentJudgeBench / DramaChain 可能存在作者 / 机构重叠但 abstract 未披露;(3)截止日:10-15 前若 ≥2 个独立团队在 ≥3 类新增评测(AgentJudgeBench + S³Gym + AutoResearchEval)做 head-to-head 对照,则形成「九向评测立基础锚」;10-30 前若公开跨 9 类的「评测协议互操作 ontology」则升 ★★★ 已立标;否则本期 ★★★ 预备观察维持到 11-15 截止日。


三、批判视角(自检)

本期综述的局限与待核:

  1. HarnessDev / WHALE / Harness-of-Harness 三件套集中 9-05~9-06 放出(paper_card 1196 / 1213 / 1180),单团队产出风险高 —— ServiceNow-AI / Meta / 独立研究组作者归属 abstract 未给具体作者名单,PDF §1 待核;若三件套作者高度重叠则视为「单一团队三件套自洽」而非「方法学共识」。
  2. AgentJudgeBench 77–82% ceiling 的「ground truth exposure yielding mixed effects」abstract 表述模糊 —— 「暴露 ground truth 对 judge 准确性影响混合」是否意味着部分场景下 ground truth 暴露反而降低 judge 表现?需 PDF §5 实验细节核实,截止 9-15。
  3. 9-01 立基础锚与本期新增主线在「评测对象」上存在 mild 重复 —— 主线 A 「Harness 评测」与 9-01 主线 F 「ClawProBench trace-aware runtime-native」边界模糊;本期把 HarnessDev / WHALE / Harness-of-Harness 三件套独立成段是为突出「评测单元 = 可执行基础设施」的本体论推进,但读者仍可能与 9-01 主线 F 混淆。
  4. 「九向预备矩阵」提法为本期综合判断而非论文原始分类 —— 8 件新增 + 9-01 baseline 17 件形成 9 向预备矩阵是综述视角的方法学整合,不应误读为「评测 OS 已存在」;该提法需在 10-15 前若 ≥2 独立团队跨 ≥3 类评测做 head-to-head 才升级为「评测 OS」抽象。
  5. Spark 端私域污染 SUM 守约 + 字数三层一致 + 反方 v2 三段式按主线分布 + 立标池红线 4 件套(GitHub 已验 + ⚠️ + 双轨 + abstract 核实)—— 本期 8 件新增 paper_card 已抽查 ≥75%,未覆盖立标池主表(仅作主线 §2.1~§2.8 主体叙述使用);立标池红线 4 件套 9-07~9-13 surveys 全部命中 ≥3 件硬约束下期综述兑现。

Spark · 2026-09-06 16:40 CST · W36 周蒸馏 · 字数 ~3,500(主体 ~3,300 + 反方 300 + 元信息 100)· 私域污染 SUM=0 · 边界:仅写本文件 surveys/2026-09-06-evaluation.md