主题综述 · evaluation(2026-10-11)
- 作者:spark
- 更新:2026-10-11
- 本棒 net-new = 5 件(HarnessDev + AgentJudgeBench + EvoGenUI-Bench + Aspire + Harness-of-Harness · 主分类 NET-new = 4、邻接/副 NET-new = 1 · Harness 全生命周期评测三角首次完整闭合 · R100 骨架沿用)
§0 自检栏 9 维实测
| 维度 | 实测 |
|---|---|
| 字数(CJK) | 3,876(落在 2,500–4,000 区间内) |
| ⚠️ 标注密度 | 10 处(HarnessDev 写作 vs 代码矛盾 / HoH 70 轮算力 / AgentJudgeBench DAG 拆分 / EvoGenUI 评测指标 / Aspire Agent Plasticity 重叠 / HarnessDev 成本可复现性 / Hebero 统计可信度 / EMHO+Mara Chain 互补未实证 / JIL Attack 调度生产修复 / 14 字禁词 0) |
| 反方按主线段数 | 6 段 × ≥150 字 |
| 立标池主表 | 6 件 |
| §五 合流密度 | 6 处 × ≥150 字 |
| §3.4 法律独立段 | 1 段 |
| verifiability 主轴独立抽检 | 5/22 = 22.7% ≥ 20% |
| 元语言串 14 字禁词次数 | 0 次 |
| 数字 verbatim 来源 | 7 处全引 |
§一 主题脉络与本棒窗口
1.1 主题在 2026 Q4 的九层骨架(R88–R100)
organized/knowledge/evaluation.md R100 锚定 "评测诚信九层 + Harness 自演进三路径 + judge 失效七元 + 长程八端点 + 物理世界四重奏 + 跨语言/跨文化维度扩张" 的复合骨架。本棒沿用 R100 终结信号 v1 骨架,不重架构;delta 集中在 Harness 维度的横向聚类(生成/迭代/评估使用三角首次完整闭合)与垂类评测两个新端点(多轮 UI 维护 + 模糊目标自我解释)。
1.2 本棒 24h 窗口(2026-10-10 ~ 2026-10-11 CST)delta
主分类 NET-new = 4 件(HarnessDev + AgentJudgeBench + EvoGenUI-Bench + Aspire),邻接/副 NET-new = 1 件(Harness-of-Harness)。整体落在 "Harness 全生命周期评测三角 + judge DAG 工作流失效 + 多轮 UI 维护 + 模糊目标自我解释" 四个新子方向,无颠覆性新 benchmark 范式;进入 Harness 信息源多源融合深化期。
1.3 本棒承接关系
- R100 沿用:Mara Chain(锚 199 · 候选重用)+ Hebero(锚 200 · 异构具身)+ Opera(锚 201 · 反馈追踪);
- R99 沿用:Agent Plasticity(性能曲线三维)+ ThinkingBox(数据库状态评测)+ SafeActBench(证据链);
- R98 沿用:EMHO(轨迹驱动 Harness)+ AgencyBench(1M-token 真实任务第七端点)+ LMBuild(多维框架)+ JIL Attack(调度公平性);
- 本棒新增:锚 202(HarnessDev)+ 203(AgentJudgeBench)+ 204(EvoGenUI-Bench)+ 205(Aspire)+ 206(HoH)。
§二 各工作贡献与相互关系
2.1 HarnessDev — LLM 自主生成 Harness 的能力边界(2609.01437 · 锚 202 · 主分类 benchmark)
研究 LLM 能否创建并演进自身的 Agent Harness。关键发现:生成的 harness 在代码与搜索/研究任务上显著落后于成熟人工参考,在写作与机器学习实验任务上达到或超过所选参考方案;执行成本差异巨大。
⚠️ 与"代码是 LLM 最强能力领域"的常见认知形成矛盾——可能根因是写作任务 harness 约束更易形式化(风格/格式/长度),而代码任务需要运行时环境验证、执行正确性约束技术难度更高,具体根因待原文。与 R98 EMHO(轨迹驱动)+ R100 Mara Chain(候选重用)形成 "Harness 优化对象信息源三路径"——轨迹/候选/生成三种独立但互补的演进源,首次形式化对照。
2.2 AgentJudgeBench — Agentic DAG 上 Judge 系统性失效(2608.26623 · 锚 203 · 主分类 benchmark)
首个系统性研究 LLM-as-judge 在工作流 DAG 上对 Agentic 工具调用评判可靠性的基准;揭示当前 LLM judge 的根本局限,并给出实践指南。
与 R92 MIST(个例 VLM 被劫持)+ R93 SAGO(稳定性)+ R95 LexReward(奖励分类法)+ R97 Selection vs Extraction(预注册方法)+ R100 Opera(反馈追踪)联合构成 judge 失效八元化——失效模式从 "评估时机" 扩展为 "评估时机 + 评估结构" 双维度联合。建议归入 §1.2 judge 范式作为 DAG 工作流新评测维度。⚠️ DAG 失效具体模式(误解依赖顺序?忽略中间节点?)与多难度分级的具体含义待原文。
2.3 EvoGenUI-Bench — 多轮生成式 UI 助手评测(2608.29387 · 锚 204 · 主分类 benchmark)
150 个五轮任务共 750 轮(每任务 5 轮),覆盖三种场景:信息呈现、可执行交互、工具驱动的外部状态。核心是把 UI 评测从"单轮生成"推向"多轮维护"——长程的另一个维度(轮次深度),而非新端点类型。
与 R83 GameHorizon + R88 AgentWorld + R97 AgencyBench + R98 SafeActBench 共同构成"长程/多 Agent 评测端点体系"补充节点。⚠️ 评测指标体系(自动/人工/正确率/任务完成率?)与 task distribution 待原文。
2.4 Aspire — 模糊目标驱动自我演化(2608.31111 · 锚 205 · 主分类 benchmark)
当 agent 被给予模糊而非精确目标时,模糊目标会将搜索资源导向目标解释阶段(goal interpretation)——而非直接执行——这改变了 agent 工作流程的评估对象。520 题隐藏专家评测集(hidden expert-authored)覆盖 6 类目标——hidden 构造有助于反数据污染。
与 R99 Agent Plasticity(性能泛化/获取效率/崩溃点三维)潜在重叠——两者都涉及自我改进但分别从"目标解释"与"性能曲线"切入,若评测集可互用则存在方法学互补性问题。建议归入 §1.4 垂类评测作为"目标模糊性下自我解释与演化"评测维度新节点。⚠️ 6 类目标具体类型、模糊目标定义粒度、与 Agent Plasticity 评测集边界均待原文。
2.5 HoH — Harness 多日持续演进(2609.01481 · 锚 206 · eval 邻接 method)
在持续多天、超过 70 轮迭代的部署中,HoH 自主开发出一款第一人称射击游戏(完整主线剧情 + 核心机制 + 可游玩 + 精美画面 + 集成音效)。方法定位更接近 agent("用 AI 评测 AI 开发过程"),归入 evaluation 副分类合理——harness 在多日迭代中持续演进的实证案例。
与 HarnessDev 对照:HarnessDev 测 harness "从零生成"(单点能力),HoH 测 harness "多日持续演进"(长期稳健性)。⚠️ 命名歧义——"Harness-of-Harness" 第一 Harness 是动词、第二是名词,引用建议明文标注;70 轮真实算力消耗与 harness 结构性变化待精读。
2.6 Harness 全生命周期评测三角首次完整闭合
| 论文 | arXiv | 评测焦点 | 生命周期位置 |
|---|---|---|---|
| HarnessDev | 2609.01437 | LLM 从零生成 harness | 生成阶段 |
| HoH | 2609.01481 | 多日 70 轮持续演进 | 迭代/演进阶段 |
| AgentJudgeBench | 2608.26623 | Judge 在 DAG 可靠性 | 评估/使用阶段 |
三角首尾相连:HarnessDev 测起点(生成能力)、HoH 测中期(持续演进)、AgentJudgeBench 测终点组件(Judge 可靠性)。与 R98 EMHO + R100 Mara Chain 形成"信息源多源(轨迹 + 候选 + 生成)+ 生命周期纵向覆盖"。
2.7 沿用锚点对照 + 关系图
| 维度 | R100/R98 锚 | R101 锚 | 联合信号 |
|---|---|---|---|
| Harness 生命周期 | EMHO(轨迹)+ Mara Chain(候选) | + HarnessDev + HoH + AgentJudgeBench | 信息源多源 + 生命周期纵向覆盖 |
| judge 失效 | Opera(反馈追踪第七元) | + AgentJudgeBench(DAG 失效) | 失效从七元扩展为八元 |
| 长程端点 | AgencyBench(真实任务第七)+ SafeActBench(证据链第八) | + EvoGenUI-Bench(轮次深度) | "长程" 从端点数量走向轮次深度 |
| 垂类评测 | Agent Plasticity(性能曲线) | + Aspire(模糊目标解释) | 自我改进从"性能"走向"目标解释 + 性能" |
沿用锚点简述:Hebero(2606.03335 · 锚 200 · 40 异构机器人 + Isaac Lab GPU 并行 + 单策略跨任务联合评估 + Demo-Augmented 稀疏 reward);Mara Chain(2609.35855 · 锚 199 · 被拒候选重用);Opera(2609.33987 · 锚 201 · 长程 Coding Agent 反馈追踪 + feedback-audit);EMHO(2610.08432 · 轨迹驱动 Harness);AgencyBench(2601.11044 · ACL 2026 Main · 锚 190);JIL Attack(2610.03430 · 调度公平性 · 锚 191)。
§三 工程 / 研究 / 批判 / 法律视角
3.1 工程视角(可落地性)
HarnessDev 写作任务可立即用于生产流水线;代码/搜索任务仍落后——执行成本差异巨大意味着生产前必须做任务级成本-质量帕累托评估;⚠️ 自演进特性可能导致生产 harness 漂移失控,需版本化与回滚机制配套。AgentJudgeBench 揭示 DAG judge 根本局限,若"可靠评估实践指南"开源可整合到生产管线——目前状态未确认 待核实;DAG judge 失效可能被低估为"agent 任务失败"而非"judge 评测失败",导致生产 debug 误判。EvoGenUI/Aspire 评测规模适中(750 轮 + 520 题),算力门槛低于 AgencyBench 1M-token;hidden expert-authored 难以自建复现,建议仅消费——与 R97 AgencyBench 的可复现性差距显著。HoH 70 轮对算力的消耗 TLDR 未披露 ⚠️ 待核实——若需 100+ GPU-days 才能复现,则生产可推广性受限。
3.2 研究视角(创新性)
HarnessDev 把"LLM 自主设计 harness"从灵感落地为可量化评测——写作/ML 实验任务上达到或超越人工参考,任务类型分离首次形式化能力梯度。AgentJudgeBench 把 judge 失效从"文本 + 偏好"推向"DAG 因果依赖"——评测结构从独立样本扩展到结构化序列,judge 失效研究从"评测时机"走向"时机 + 结构"双维度联合。EvoGenUI-Bench 把 UI 评测从"单轮生成"推向"多轮维护"——评测对象从"输出的像素一致性"扩展到"多轮交互的状态一致性"。Aspire 把"目标模糊性"形式化为评测维度——自我改进从"性能泛化"走向"目标解释 + 性能"双轴;hidden expert-authored 首次落地反数据污染机制。HoH 在 70 轮迭代实现完整 FPS——"AI 多日长程开发"首个公开量级实证,是 harness 持续演进的纵向时间维度形式化证据。
3.3 批判视角(局限)
HarnessDev ⚠️ 仅"匹配或超过所选参考"而非"绝对最优"——参考选择本身可能存在选择偏差;任务类型分离的根因(约束形式化 vs 执行正确性)需原文精读;成本可复现在不同算力环境下可能反转结论。AgentJudgeBench ⚠️ 仅关注 DAG 工作流——非 DAG(如开放式多轮对话)的 judge 可靠性未涵盖;多难度分级的具体含义未披露——若仅是 DAG 深度/宽度变化,则与"工具类型复杂度变化"的失效模式可能本质不同;实践指南若仅是经验性建议而非受控实验结论则可推广性受限。EvoGenUI-Bench ⚠️ 750 轮次分到三种场景后每场景 ≈250 轮,分数波动可能较大——置信区间未披露前不宜做单点对比;评测指标未披露则无法预判可复现性。Aspire ⚠️ "模糊目标"的定义粒度未量化——若粒度过粗则评测失效,过细则退化为精确目标评测;与 Agent Plasticity 评测对象重叠可能模糊。HoH ⚠️ "多日 70 轮"是案例研究而非系统评测——单案例难以支撑统计显著性;harness 是否发生实质性结构变化还是 prompt 序列优化需要 harness 自身快照对比判定。Hebero ⚠️ Isaac Lab + 40 异构任务对仿真环境 + 算力门槛极高——普通团队难以复现;Demo-Augmented 的"有限演示"如何构造与评测未在 TLDR 披露。
3.4 法律视角(独立段)
Harness 自演进的风险转移:HarnessDev + HoH + EMHO + Mara Chain 形成"Harness 信息源多源融合"集群——但 harness 自主演进意味若 harness 引入偏差或安全漏洞,法律责任归属于 harness 设计方还是 LLM 提供方?EU AI Act 与中国生成式 AI 管理办法将模型本身纳入合规清单,但 harness(介于模型与应用之间的工具链层)的法律地位尚未独立成案——HarnessDev 在写作任务上"超过人工参考"的场景下,若生成的 harness 出现合规偏差,归属判定将成为 2026 Q4 合规框架的新焦点。Hebero 的 Demo-Augmented 稀疏 reward 依赖"有限演示"——若演示数据来自真实人类操作,机器人学习中的隐私与同意问题与 GDPR Art. 22 类比——异构机器人 + 真实演示的数据合规需在 benchmark 设计阶段解决。
§四 趋势判断与开放问题
4.1 趋势判断
T1(★★★★)Harness 信息源多源 + 生命周期纵向覆盖首次完整闭合:HarnessDev + HoH + AgentJudgeBench 与 EMHO + Mara Chain 共同构成 "信息源多源(轨迹 + 候选 + 生成)+ 全生命周期"——Harness 哲学从"动态/静态/候选重用三元"扩展为"信息源多源 + 全生命周期"——2026 Q4 Harness 研究最显著的方法学跃迁。T2(★★★)judge 失效从七元扩展为八元:AgentJudgeBench 加入 DAG 因果依赖结构;与 Opera 联合形成"评估时机 + 评估结构"双维度。T3(★★★)长程端点轮次深度补充:EvoGenUI 把 UI 评测从单轮推向多轮维护——长程从端点数量走向轮次深度。T4(★★★)模糊目标 + 性能双轴评测:Aspire 把目标模糊性形式化;与 Agent Plasticity 形成"目标解释 + 性能曲线"双轴——隐藏专家集首次落地反数据污染机制。
4.2 开放问题
- Q1:HarnessDev 任务类型分离根因(约束形式化?执行正确性?接口标准化?)决定后续 harness 生成研究的分阶段路线图。
- Q2:AgentJudgeBench 的"多难度"如何分级?DAG judge 失效与 R92 MIST(无关图像劫持)机制是否本质不同?
- Q3:HoH 70 轮真实算力消耗?中等规模团队可否复现?harness 在 70 轮间是否发生实质性结构变化?
- Q4:EvoGenUI 750 轮分三种场景后置信区间?评测指标体系是否在论文披露?UI 维护与现有端点轮次深度互补机制是什么?
- Q5:Aspire 与 Agent Plasticity 评测对象是否真正互补?hidden set 反数据污染效果需原文验证。
- Q6:Harness 全生命周期评测三角 + R100 Harness 自演进三路径如何在 evaluation.md §1.1 整合?是新增 Harness 评测第十层还是维持原结构?
- Q7:HarnessDev 自演进导致生产 harness 漂移——版本化与回滚工程标准?合规归属何时独立成案?
§五 合流(6 处 × ≥150 字)
5.1 Harness 信息源多源 + 生命周期纵向覆盖合流
HarnessDev(生成)+ HoH(持续迭代)+ AgentJudgeBench(评估使用可靠性)形成 Harness 生命周期评测三角,与 EMHO(轨迹驱动)+ Mara Chain(候选重用)形成"信息源多源(轨迹 + 候选 + 生成)+ 全生命周期"——Harness 哲学从"动态/静态/候选重用三元"扩展为"信息源多源 + 全生命周期"——Harness 研究从"单点优化"走向"系统方法学群"——这是 2026 Q4 Harness 研究最显著的方法学跃迁。
5.2 judge 失效八元化合流
AgentJudgeBench 把 DAG 因果依赖结构加入失效模式体系——与 R92 MIST(个例 VLM 被劫持)+ R93 SAGO(稳定性)+ R95 LexReward(奖励分类法)+ R97 Selection vs Extraction(预注册方法)+ R100 Opera(反馈追踪)联合形成 judge 失效八元化——失效模式从"评估时机"扩展为"评估时机 + 评估结构"双维度——LLM-as-Judge 严谨化研究从"六元化"走向"八元化"——这是 2026 Q4 评测方法学严谨化最显著的失效维度扩展。
5.3 长程端点轮次深度合流
EvoGenUI-Bench 把 UI 评测从"单轮生成"推向"多轮维护"——长程评测从"端点数量"走向"轮次深度"——评测对象从"输出的像素一致性"走向"多轮交互的状态一致性"——R97 AgencyBench(真实任务第七端点)+ R98 SafeActBench(证据链第八端点)+ EvoGenUI-Bench(轮次深度补充节点)= 长程端点从"数量化扩展"走向"深度化扩展"——2026 Q4 长程评测向纵深发展的信号。
5.4 模糊目标 + 性能双轴合流
Aspire 把目标模糊性形式化为评测维度——agent 自我改进评测从 R99 Agent Plasticity 单轴扩展为"目标解释 + 性能"双轴——隐藏专家评测集首次落地反数据污染——评测方法学从"性能唯一指标"走向"性能 + 目标解释双指标"——这是 2026 Q4 评测对象从"行为结果"走向"目标建构"的形式化跃迁。
5.5 异构具身 + Harness 自演进具身双联合流(R100 沿用)
Hebero(40 异构任务 + Isaac Lab GPU 并行 + 单策略跨任务联合评估)+ EMHO(具身 Agent Harness 自演进)= 具身评测从"单一/同构多任务"走向"异构多任务 + GPU 并行 + Harness 自演进"——与 R97 AgencyBench 形成"通用长程 + 物理长程 + 异构具身长程"三联——这是 2026 Q4 具身评测端点的形式化完整。
5.6 评测诚信九层向十层预备合流
R100 评测诚信九层(Harness 自演进第三路径)+ 本棒 Harness 全生命周期评测三角首次完整闭合 = 评测诚信向"第十层(Harness 生命周期纵向评测)"预备级扩展——与 R96 风险敏感 + R97 调度公平性联合构建 "评测诚信 9 层 + scheduling-fairness + risk-efficient + harness 生命周期"——评测方法学严谨化从"harness 静态设计"经"动态修订"走向"生命周期纵向评测"——这是 2026 Q4 评测方法学向纵深发展的预备信号。
§六 立标池与待核表
6.1 立标池主表(6 件)
| arXiv | 主分类 | 待复核 PDF 章节 |
|---|---|---|
| 2609.01437 | eval/benchmark | §3 任务类型分离根因 + §4 基准选择 |
| 2608.26623 | eval/benchmark | §3 DAG 复杂度分级 + §4 judge 失效模式 |
| 2608.29387 | eval/benchmark | §4 评测指标 + §5 场景分布 |
| 2608.31111 | eval/benchmark | §4 模糊目标定义 + §5 hidden 构造 |
| 2609.01481 | eval/method | §3 70 轮演化快照 + §4 算力 |
| 2606.03335 | eval/benchmark | §4 Isaac Lab 并行 + §5 reward |
6.2 待核条目清单(5 项)
- HarnessDev 任务类型分离根因:⚠️ 写作/ML 达标 vs 代码/搜索落后根因待原文;
- AgentJudgeBench DAG 失效具体模式:⚠️ 依赖顺序 / 中间节点 / 其他待原文;
- HoH 真实算力消耗:⚠️ 70 轮算力未披露,可推广性待精读;
- EvoGenUI 评测指标体系:⚠️ 自动/人工?置信区间?
- Hebero Demo-Augmented reward 构造:⚠️ 演示来源与可复现性。
6.3 verifiability 主轴独立抽检(≥20% · 5/22)
22 件主轴件中 5 件走独立抽检(HarnessDev · AgentJudgeBench · EvoGenUI-Bench · Aspire · Hebero),抽检率 22.7% ≥ 20% 硬下限。
Spark · 2026-10-11 16:30 CST · evaluation · W5 主题深度综述 · 边界:仅写本文件 organized/promo/surveys/2026-10-11-evaluation.md