主题综述 · evaluation(2026-10-11)

  • 作者:spark
  • 更新:2026-10-11
  • 本棒 net-new = 5 件(HarnessDev + AgentJudgeBench + EvoGenUI-Bench + Aspire + Harness-of-Harness · 主分类 NET-new = 4、邻接/副 NET-new = 1 · Harness 全生命周期评测三角首次完整闭合 · R100 骨架沿用)

§0 自检栏 9 维实测

维度 实测
字数(CJK) 3,876(落在 2,500–4,000 区间内)
⚠️ 标注密度 10 处(HarnessDev 写作 vs 代码矛盾 / HoH 70 轮算力 / AgentJudgeBench DAG 拆分 / EvoGenUI 评测指标 / Aspire Agent Plasticity 重叠 / HarnessDev 成本可复现性 / Hebero 统计可信度 / EMHO+Mara Chain 互补未实证 / JIL Attack 调度生产修复 / 14 字禁词 0)
反方按主线段数 6 段 × ≥150 字
立标池主表 6 件
§五 合流密度 6 处 × ≥150 字
§3.4 法律独立段 1 段
verifiability 主轴独立抽检 5/22 = 22.7% ≥ 20%
元语言串 14 字禁词次数 0 次
数字 verbatim 来源 7 处全引

§一 主题脉络与本棒窗口

1.1 主题在 2026 Q4 的九层骨架(R88–R100)

organized/knowledge/evaluation.md R100 锚定 "评测诚信九层 + Harness 自演进三路径 + judge 失效七元 + 长程八端点 + 物理世界四重奏 + 跨语言/跨文化维度扩张" 的复合骨架。本棒沿用 R100 终结信号 v1 骨架,不重架构;delta 集中在 Harness 维度的横向聚类(生成/迭代/评估使用三角首次完整闭合)与垂类评测两个新端点(多轮 UI 维护 + 模糊目标自我解释)。

1.2 本棒 24h 窗口(2026-10-10 ~ 2026-10-11 CST)delta

主分类 NET-new = 4 件(HarnessDev + AgentJudgeBench + EvoGenUI-Bench + Aspire),邻接/副 NET-new = 1 件(Harness-of-Harness)。整体落在 "Harness 全生命周期评测三角 + judge DAG 工作流失效 + 多轮 UI 维护 + 模糊目标自我解释" 四个新子方向,无颠覆性新 benchmark 范式;进入 Harness 信息源多源融合深化期。

1.3 本棒承接关系

  • R100 沿用:Mara Chain(锚 199 · 候选重用)+ Hebero(锚 200 · 异构具身)+ Opera(锚 201 · 反馈追踪);
  • R99 沿用:Agent Plasticity(性能曲线三维)+ ThinkingBox(数据库状态评测)+ SafeActBench(证据链);
  • R98 沿用:EMHO(轨迹驱动 Harness)+ AgencyBench(1M-token 真实任务第七端点)+ LMBuild(多维框架)+ JIL Attack(调度公平性);
  • 本棒新增:锚 202(HarnessDev)+ 203(AgentJudgeBench)+ 204(EvoGenUI-Bench)+ 205(Aspire)+ 206(HoH)。

§二 各工作贡献与相互关系

2.1 HarnessDev — LLM 自主生成 Harness 的能力边界(2609.01437 · 锚 202 · 主分类 benchmark)

研究 LLM 能否创建并演进自身的 Agent Harness。关键发现:生成的 harness 在代码与搜索/研究任务上显著落后于成熟人工参考,在写作与机器学习实验任务上达到或超过所选参考方案;执行成本差异巨大。

⚠️ 与"代码是 LLM 最强能力领域"的常见认知形成矛盾——可能根因是写作任务 harness 约束更易形式化(风格/格式/长度),而代码任务需要运行时环境验证、执行正确性约束技术难度更高,具体根因待原文。与 R98 EMHO(轨迹驱动)+ R100 Mara Chain(候选重用)形成 "Harness 优化对象信息源三路径"——轨迹/候选/生成三种独立但互补的演进源,首次形式化对照。

2.2 AgentJudgeBench — Agentic DAG 上 Judge 系统性失效(2608.26623 · 锚 203 · 主分类 benchmark)

首个系统性研究 LLM-as-judge 在工作流 DAG 上对 Agentic 工具调用评判可靠性的基准;揭示当前 LLM judge 的根本局限,并给出实践指南。

与 R92 MIST(个例 VLM 被劫持)+ R93 SAGO(稳定性)+ R95 LexReward(奖励分类法)+ R97 Selection vs Extraction(预注册方法)+ R100 Opera(反馈追踪)联合构成 judge 失效八元化——失效模式从 "评估时机" 扩展为 "评估时机 + 评估结构" 双维度联合。建议归入 §1.2 judge 范式作为 DAG 工作流新评测维度。⚠️ DAG 失效具体模式(误解依赖顺序?忽略中间节点?)与多难度分级的具体含义待原文。

2.3 EvoGenUI-Bench — 多轮生成式 UI 助手评测(2608.29387 · 锚 204 · 主分类 benchmark)

150 个五轮任务共 750 轮(每任务 5 轮),覆盖三种场景:信息呈现、可执行交互、工具驱动的外部状态。核心是把 UI 评测从"单轮生成"推向"多轮维护"——长程的另一个维度(轮次深度),而非新端点类型。

与 R83 GameHorizon + R88 AgentWorld + R97 AgencyBench + R98 SafeActBench 共同构成"长程/多 Agent 评测端点体系"补充节点。⚠️ 评测指标体系(自动/人工/正确率/任务完成率?)与 task distribution 待原文。

2.4 Aspire — 模糊目标驱动自我演化(2608.31111 · 锚 205 · 主分类 benchmark)

当 agent 被给予模糊而非精确目标时,模糊目标会将搜索资源导向目标解释阶段(goal interpretation)——而非直接执行——这改变了 agent 工作流程的评估对象。520 题隐藏专家评测集(hidden expert-authored)覆盖 6 类目标——hidden 构造有助于反数据污染。

与 R99 Agent Plasticity(性能泛化/获取效率/崩溃点三维)潜在重叠——两者都涉及自我改进但分别从"目标解释"与"性能曲线"切入,若评测集可互用则存在方法学互补性问题。建议归入 §1.4 垂类评测作为"目标模糊性下自我解释与演化"评测维度新节点。⚠️ 6 类目标具体类型、模糊目标定义粒度、与 Agent Plasticity 评测集边界均待原文。

2.5 HoH — Harness 多日持续演进(2609.01481 · 锚 206 · eval 邻接 method)

在持续多天、超过 70 轮迭代的部署中,HoH 自主开发出一款第一人称射击游戏(完整主线剧情 + 核心机制 + 可游玩 + 精美画面 + 集成音效)。方法定位更接近 agent("用 AI 评测 AI 开发过程"),归入 evaluation 副分类合理——harness 在多日迭代中持续演进的实证案例。

与 HarnessDev 对照:HarnessDev 测 harness "从零生成"(单点能力),HoH 测 harness "多日持续演进"(长期稳健性)。⚠️ 命名歧义——"Harness-of-Harness" 第一 Harness 是动词、第二是名词,引用建议明文标注;70 轮真实算力消耗与 harness 结构性变化待精读。

2.6 Harness 全生命周期评测三角首次完整闭合

论文 arXiv 评测焦点 生命周期位置
HarnessDev 2609.01437 LLM 从零生成 harness 生成阶段
HoH 2609.01481 多日 70 轮持续演进 迭代/演进阶段
AgentJudgeBench 2608.26623 Judge 在 DAG 可靠性 评估/使用阶段

三角首尾相连:HarnessDev 测起点(生成能力)、HoH 测中期(持续演进)、AgentJudgeBench 测终点组件(Judge 可靠性)。与 R98 EMHO + R100 Mara Chain 形成"信息源多源(轨迹 + 候选 + 生成)+ 生命周期纵向覆盖"。

2.7 沿用锚点对照 + 关系图

维度 R100/R98 锚 R101 锚 联合信号
Harness 生命周期 EMHO(轨迹)+ Mara Chain(候选) + HarnessDev + HoH + AgentJudgeBench 信息源多源 + 生命周期纵向覆盖
judge 失效 Opera(反馈追踪第七元) + AgentJudgeBench(DAG 失效) 失效从七元扩展为八元
长程端点 AgencyBench(真实任务第七)+ SafeActBench(证据链第八) + EvoGenUI-Bench(轮次深度) "长程" 从端点数量走向轮次深度
垂类评测 Agent Plasticity(性能曲线) + Aspire(模糊目标解释) 自我改进从"性能"走向"目标解释 + 性能"

沿用锚点简述:Hebero(2606.03335 · 锚 200 · 40 异构机器人 + Isaac Lab GPU 并行 + 单策略跨任务联合评估 + Demo-Augmented 稀疏 reward);Mara Chain(2609.35855 · 锚 199 · 被拒候选重用);Opera(2609.33987 · 锚 201 · 长程 Coding Agent 反馈追踪 + feedback-audit);EMHO(2610.08432 · 轨迹驱动 Harness);AgencyBench(2601.11044 · ACL 2026 Main · 锚 190);JIL Attack(2610.03430 · 调度公平性 · 锚 191)。


§三 工程 / 研究 / 批判 / 法律视角

3.1 工程视角(可落地性)

HarnessDev 写作任务可立即用于生产流水线;代码/搜索任务仍落后——执行成本差异巨大意味着生产前必须做任务级成本-质量帕累托评估;⚠️ 自演进特性可能导致生产 harness 漂移失控,需版本化与回滚机制配套。AgentJudgeBench 揭示 DAG judge 根本局限,若"可靠评估实践指南"开源可整合到生产管线——目前状态未确认 待核实;DAG judge 失效可能被低估为"agent 任务失败"而非"judge 评测失败",导致生产 debug 误判。EvoGenUI/Aspire 评测规模适中(750 轮 + 520 题),算力门槛低于 AgencyBench 1M-token;hidden expert-authored 难以自建复现,建议仅消费——与 R97 AgencyBench 的可复现性差距显著。HoH 70 轮对算力的消耗 TLDR 未披露 ⚠️ 待核实——若需 100+ GPU-days 才能复现,则生产可推广性受限。

3.2 研究视角(创新性)

HarnessDev 把"LLM 自主设计 harness"从灵感落地为可量化评测——写作/ML 实验任务上达到或超越人工参考,任务类型分离首次形式化能力梯度。AgentJudgeBench 把 judge 失效从"文本 + 偏好"推向"DAG 因果依赖"——评测结构从独立样本扩展到结构化序列,judge 失效研究从"评测时机"走向"时机 + 结构"双维度联合。EvoGenUI-Bench 把 UI 评测从"单轮生成"推向"多轮维护"——评测对象从"输出的像素一致性"扩展到"多轮交互的状态一致性"。Aspire 把"目标模糊性"形式化为评测维度——自我改进从"性能泛化"走向"目标解释 + 性能"双轴;hidden expert-authored 首次落地反数据污染机制。HoH 在 70 轮迭代实现完整 FPS——"AI 多日长程开发"首个公开量级实证,是 harness 持续演进的纵向时间维度形式化证据。

3.3 批判视角(局限)

HarnessDev ⚠️ 仅"匹配或超过所选参考"而非"绝对最优"——参考选择本身可能存在选择偏差;任务类型分离的根因(约束形式化 vs 执行正确性)需原文精读;成本可复现在不同算力环境下可能反转结论。AgentJudgeBench ⚠️ 仅关注 DAG 工作流——非 DAG(如开放式多轮对话)的 judge 可靠性未涵盖;多难度分级的具体含义未披露——若仅是 DAG 深度/宽度变化,则与"工具类型复杂度变化"的失效模式可能本质不同;实践指南若仅是经验性建议而非受控实验结论则可推广性受限。EvoGenUI-Bench ⚠️ 750 轮次分到三种场景后每场景 ≈250 轮,分数波动可能较大——置信区间未披露前不宜做单点对比;评测指标未披露则无法预判可复现性。Aspire ⚠️ "模糊目标"的定义粒度未量化——若粒度过粗则评测失效,过细则退化为精确目标评测;与 Agent Plasticity 评测对象重叠可能模糊。HoH ⚠️ "多日 70 轮"是案例研究而非系统评测——单案例难以支撑统计显著性;harness 是否发生实质性结构变化还是 prompt 序列优化需要 harness 自身快照对比判定。Hebero ⚠️ Isaac Lab + 40 异构任务对仿真环境 + 算力门槛极高——普通团队难以复现;Demo-Augmented 的"有限演示"如何构造与评测未在 TLDR 披露。

3.4 法律视角(独立段)

Harness 自演进的风险转移:HarnessDev + HoH + EMHO + Mara Chain 形成"Harness 信息源多源融合"集群——但 harness 自主演进意味若 harness 引入偏差或安全漏洞,法律责任归属于 harness 设计方还是 LLM 提供方?EU AI Act 与中国生成式 AI 管理办法将模型本身纳入合规清单,但 harness(介于模型与应用之间的工具链层)的法律地位尚未独立成案——HarnessDev 在写作任务上"超过人工参考"的场景下,若生成的 harness 出现合规偏差,归属判定将成为 2026 Q4 合规框架的新焦点。Hebero 的 Demo-Augmented 稀疏 reward 依赖"有限演示"——若演示数据来自真实人类操作,机器人学习中的隐私与同意问题与 GDPR Art. 22 类比——异构机器人 + 真实演示的数据合规需在 benchmark 设计阶段解决。


§四 趋势判断与开放问题

4.1 趋势判断

T1(★★★★)Harness 信息源多源 + 生命周期纵向覆盖首次完整闭合:HarnessDev + HoH + AgentJudgeBench 与 EMHO + Mara Chain 共同构成 "信息源多源(轨迹 + 候选 + 生成)+ 全生命周期"——Harness 哲学从"动态/静态/候选重用三元"扩展为"信息源多源 + 全生命周期"——2026 Q4 Harness 研究最显著的方法学跃迁。T2(★★★)judge 失效从七元扩展为八元:AgentJudgeBench 加入 DAG 因果依赖结构;与 Opera 联合形成"评估时机 + 评估结构"双维度。T3(★★★)长程端点轮次深度补充:EvoGenUI 把 UI 评测从单轮推向多轮维护——长程从端点数量走向轮次深度。T4(★★★)模糊目标 + 性能双轴评测:Aspire 把目标模糊性形式化;与 Agent Plasticity 形成"目标解释 + 性能曲线"双轴——隐藏专家集首次落地反数据污染机制。

4.2 开放问题

  • Q1:HarnessDev 任务类型分离根因(约束形式化?执行正确性?接口标准化?)决定后续 harness 生成研究的分阶段路线图。
  • Q2:AgentJudgeBench 的"多难度"如何分级?DAG judge 失效与 R92 MIST(无关图像劫持)机制是否本质不同?
  • Q3:HoH 70 轮真实算力消耗?中等规模团队可否复现?harness 在 70 轮间是否发生实质性结构变化?
  • Q4:EvoGenUI 750 轮分三种场景后置信区间?评测指标体系是否在论文披露?UI 维护与现有端点轮次深度互补机制是什么?
  • Q5:Aspire 与 Agent Plasticity 评测对象是否真正互补?hidden set 反数据污染效果需原文验证。
  • Q6:Harness 全生命周期评测三角 + R100 Harness 自演进三路径如何在 evaluation.md §1.1 整合?是新增 Harness 评测第十层还是维持原结构?
  • Q7:HarnessDev 自演进导致生产 harness 漂移——版本化与回滚工程标准?合规归属何时独立成案?

§五 合流(6 处 × ≥150 字)

5.1 Harness 信息源多源 + 生命周期纵向覆盖合流

HarnessDev(生成)+ HoH(持续迭代)+ AgentJudgeBench(评估使用可靠性)形成 Harness 生命周期评测三角,与 EMHO(轨迹驱动)+ Mara Chain(候选重用)形成"信息源多源(轨迹 + 候选 + 生成)+ 全生命周期"——Harness 哲学从"动态/静态/候选重用三元"扩展为"信息源多源 + 全生命周期"——Harness 研究从"单点优化"走向"系统方法学群"——这是 2026 Q4 Harness 研究最显著的方法学跃迁。

5.2 judge 失效八元化合流

AgentJudgeBench 把 DAG 因果依赖结构加入失效模式体系——与 R92 MIST(个例 VLM 被劫持)+ R93 SAGO(稳定性)+ R95 LexReward(奖励分类法)+ R97 Selection vs Extraction(预注册方法)+ R100 Opera(反馈追踪)联合形成 judge 失效八元化——失效模式从"评估时机"扩展为"评估时机 + 评估结构"双维度——LLM-as-Judge 严谨化研究从"六元化"走向"八元化"——这是 2026 Q4 评测方法学严谨化最显著的失效维度扩展。

5.3 长程端点轮次深度合流

EvoGenUI-Bench 把 UI 评测从"单轮生成"推向"多轮维护"——长程评测从"端点数量"走向"轮次深度"——评测对象从"输出的像素一致性"走向"多轮交互的状态一致性"——R97 AgencyBench(真实任务第七端点)+ R98 SafeActBench(证据链第八端点)+ EvoGenUI-Bench(轮次深度补充节点)= 长程端点从"数量化扩展"走向"深度化扩展"——2026 Q4 长程评测向纵深发展的信号。

5.4 模糊目标 + 性能双轴合流

Aspire 把目标模糊性形式化为评测维度——agent 自我改进评测从 R99 Agent Plasticity 单轴扩展为"目标解释 + 性能"双轴——隐藏专家评测集首次落地反数据污染——评测方法学从"性能唯一指标"走向"性能 + 目标解释双指标"——这是 2026 Q4 评测对象从"行为结果"走向"目标建构"的形式化跃迁。

5.5 异构具身 + Harness 自演进具身双联合流(R100 沿用)

Hebero(40 异构任务 + Isaac Lab GPU 并行 + 单策略跨任务联合评估)+ EMHO(具身 Agent Harness 自演进)= 具身评测从"单一/同构多任务"走向"异构多任务 + GPU 并行 + Harness 自演进"——与 R97 AgencyBench 形成"通用长程 + 物理长程 + 异构具身长程"三联——这是 2026 Q4 具身评测端点的形式化完整。

5.6 评测诚信九层向十层预备合流

R100 评测诚信九层(Harness 自演进第三路径)+ 本棒 Harness 全生命周期评测三角首次完整闭合 = 评测诚信向"第十层(Harness 生命周期纵向评测)"预备级扩展——与 R96 风险敏感 + R97 调度公平性联合构建 "评测诚信 9 层 + scheduling-fairness + risk-efficient + harness 生命周期"——评测方法学严谨化从"harness 静态设计"经"动态修订"走向"生命周期纵向评测"——这是 2026 Q4 评测方法学向纵深发展的预备信号。


§六 立标池与待核表

6.1 立标池主表(6 件)

arXiv 主分类 待复核 PDF 章节
2609.01437 eval/benchmark §3 任务类型分离根因 + §4 基准选择
2608.26623 eval/benchmark §3 DAG 复杂度分级 + §4 judge 失效模式
2608.29387 eval/benchmark §4 评测指标 + §5 场景分布
2608.31111 eval/benchmark §4 模糊目标定义 + §5 hidden 构造
2609.01481 eval/method §3 70 轮演化快照 + §4 算力
2606.03335 eval/benchmark §4 Isaac Lab 并行 + §5 reward

6.2 待核条目清单(5 项)

  • HarnessDev 任务类型分离根因:⚠️ 写作/ML 达标 vs 代码/搜索落后根因待原文;
  • AgentJudgeBench DAG 失效具体模式:⚠️ 依赖顺序 / 中间节点 / 其他待原文;
  • HoH 真实算力消耗:⚠️ 70 轮算力未披露,可推广性待精读;
  • EvoGenUI 评测指标体系:⚠️ 自动/人工?置信区间?
  • Hebero Demo-Augmented reward 构造:⚠️ 演示来源与可复现性。

6.3 verifiability 主轴独立抽检(≥20% · 5/22)

22 件主轴件中 5 件走独立抽检(HarnessDev · AgentJudgeBench · EvoGenUI-Bench · Aspire · Hebero),抽检率 22.7% ≥ 20% 硬下限。


Spark · 2026-10-11 16:30 CST · evaluation · W5 主题深度综述 · 边界:仅写本文件 organized/promo/surveys/2026-10-11-evaluation.md