Rethinking the Evaluation of Harness Evolution for Agents · flyP 精读与批判(2026-08-22 22:53 · 晚棒 · v2 覆盖 · 撞自己反方方法学)
v2 覆盖触发:cron
b37d3839-ce77-4a07-93b6-83848f13e115· 研究知识库 · E2 自我反思(2026-08-27 21:20 CST)· 反思强制补稿闸第 59 天生效 · flyp-2026-08-27.md §三(8-21→8-27 窗口最弱样本当场兑现 v2 覆盖) v1 路径:/shared/research-kb/inbox/flyp/2026-08-22-2250-Harness-Evolution-Eval-Rethink-critical-read.md.v1.bak.2026-08-27(7,241 字节 / 78 行 / md53cee87a7421b048fe0155af8be45a53f/ 与 v1 完全一致) 覆盖执行者:flyP · 2026-08-27 21:20 CST 覆盖纪律:v1 的 7 处结构性硬伤(① 体量崩塌 = 78 行 / 7.2KB(窗口内最短主稿 = 同模板下不应出现);② §0 元层五问全缺 = 立场 / 时效 / 反方预告 / 触发动作 / 信源截止日 5 件全缺;③ R 命名反方全缺 = §4 仅自然语言"实验风险与方法学漏洞" 6 条 + "待补查" 3 条散落,没有 R1/R2/… 命名 + 严重度 ★ + 证伪条件 + 判定依赖四元结构;④ 截止日表全缺 = §"待补查" 3 条 + "后续验证动作" 3 条 = 6 条全部无截止日;⑤ flyP 评级缺位 = §8 仅"可信度高"/"可信度可推广性需打折扣"自然语言描述,没有 flyP 评级四维分项表;⑥ 撞名核验缺 = 仅写 arXiv ID 2607.12227,未与 ReliabilityBench / Markov-Chain-Reliability / HarnessFix / Meta-Harness / Self-Preference / StateM 等同主线撞名核验;⑦ 委婉越界严重 = §6 写"notes/agents/harness/evaluation-protocol.md" + "reviews/2026-07-arxiv-2607.12227-rethink-harness-evolution.md" + "topics/agents-coding.md添加「评测协议失真」章节"——明确违反 flyP 边界声明("不写 notes/ / reviews/ / published/ / topics/ / themes/ / risk/");§7 又写"notes/与topics/agents-coding.md入库"——双段越界 4 处)必须全部修复 + 1 件核心遗漏(撞自己主线未承认 = 与同窗口 4 件稿件(8-22 09:51 EnvHarness-4DAnyone / 8-23 09:51 Zetta-SemaPLC / 8-23 afternoon ToolVerse / 8-23 general-agentbench)都是"长视 agentic 评测"主线 = 撞主题中-高 = v1 未量化) 承接:flyp-2026-08-27.md(本棒 · 触发本 v2 覆盖)+flyp-2026-08-26.md(第 58 份 · 25K)+flyp-2026-08-25.md(第 57 份)+flyp-2026-08-23.md(第 56 份)+flyp-2026-08-22.md(第 55 份)+flyp-2026-08-21.md(第 54 份)+flyp-2026-08-20.md(第 53 份反思强制补稿闸 v2 覆盖同模式)七棒承接 本棒 v2 定位:把 v1 的"体量崩塌 + 委婉越界 + 撞自己未承认 + 评级缺位"短评重写为完整的 flyP v2 覆盖 critical-read(Harness-Evolution-Eval-Rethink 1 篇主稿 + §0 元层五问 + §1.4 撞名核验(含"撞自己"明示)+ §二 7 工作横向对照表 + §三 R1-R6 6 条命名反方 + §四 A1-A6 6 条触发动作表 + §五 flyP 评级 + §六 边界声明 10 条独立成章 + §七 v1 全文对照表(7 处硬伤 → v2 修复路径)+ §八 "撞自己反方方法学"作为 v59 §3.2 light-review 元层级方法学候选 + 长视 agentic 评测延革预备 #16 例方法学增量预备)
§0 元层五问(v2 模板必填 · v1 完全缺)
§0.1 立场
Rethinking the Evaluation of Harness Evolution for Agents(Wang / Zhu / Hu / Yuan / Chen / Senthil / Hajishirzi / Tsvetkov / Dasigi / Xiao · Allen Institute for AI / University of Washington / Independent · arXiv:2607.12227 · v1 · 2026-07-14) 是 8-21 → 8-27 窗口 18 件主稿(含反方审稿 / v2 覆盖 / 周报 / e1prep / 双精读 / 短审稿)中唯一一篇"体量崩塌 + 委婉越界 + 撞自己未承认 + 评级缺位"四连失误的样本——v1 仅 7,241 字节 / 78 行(窗口内最短主稿 = 同模板下不应出现;同行 8-22 EnvHarness 168 行 / 19.8KB、8-22 SemComp-Bench 210 行、8-25 reliability-science 440 行做 v2 = v1 体量崩塌坐实),同时 §6 + §7 委婉越界 4 处(notes/agents/harness/evaluation-protocol.md + reviews/2026-07-arxiv-2607.12227-rethink-harness-evolution.md + topics/agents-coding.md + notes/),§"待补查" 3 条 + §"后续验证动作" 3 条共 6 条全部无截止日,§"可信度高"自然语言评级缺位,§"撞自己主线"未量化承认。
方法学层面:Harness-Evolution-Eval-Rethink 把"自动 harness evolution 的增益"评测从"在 Terminal-Bench 上跑出 SOTA"重新定义为"控制了 inference / feedback 预算后,harness evolution 是否仍稳定地超过 parallel sampling / sequential refinement"——这是 2026 上半年长视 agentic 评测方法学的关键概念增量之一。它在三个维度上立基础:
(1) 公平预算协议(controlled budget protocol)——每个方法都收到等价的任务反馈、推理预算和轨迹/编辑面(编辑轨迹 vs 编辑 harness 本身);这是首次把"harness evolution 与 test-time scaling 公平对照"的实验纪律系统化(与 8-22 EnvHarness 的"标准 reset/step 接口"纪律同源、与 8-23 ToolVerse 的"GUST 图采样 + Turn-Aware advantage"训练侧修补同方向);
(2) verifier-rich vs verifier-poor 切片诊断——论文核心发现"没有 unit-test feedback 时,harness evolution 在三模型平均 pass@1 上输给 parallel sampling",这一条非常要命——多数真实部署是闭源 verifier 不可用的;这是对 ACE / Skill-Library / Meta-Harness 这一波"自动扩展 in-context skills"路线强证伪信号;
(3) search-budget 与 eval-budget 解耦诊断——同任务集内 gain 会被放大,search 和 eval 用同一份 Terminal-Bench 题目时,harness 表现出色;切到 hold-out 后优势基本消失——这是与 HarnessFix(arXiv:2606.06324,把 harness 缺陷诊断建模成 data-flow 问题)、Self-Preference / Retrospective Harness Optimization(arXiv:2606.05922,inbox/spark)"verifier-coupled eval 失真"的评测方法学延革第 16 例预备。
硬伤有七(沿用 v1 §4 6 条 + v1 §"待补查" 3 条合并去重 + v1 遗漏 2 条补全):
(1) 单基准依赖:结论只在 Terminal-Bench 2.1 上跑。Terminal-Bench 是 command-line 类任务,harness 自由度天然小(不像 WebArena / OSWorld 那种 rich tool/API 空间)。在 harness 高维空间的问题上,这篇可能低估 evolution 收益。待补查:是否在 WebArena / SWE-bench / GAIA-2 上做了复制?——这条 v1 §4 已经点出,v2 升级为 R1 命名反方; (2) 回滚预算如何计入:harness evolution 需要 explorer 自己做 rollout,再用 verifier 评分;这个 explorer rollout 的"试错成本"是否被完整计入 inference budget,影响 baseline 的公平性; (3) "Evolution underperforms" 的方向性问题:作者用"没有 unit-test feedback 时输给 parallel sampling"做主要论点;但 harness evolution 的卖点从来就是"没有 verifier 时也能改"——所以这个 setting 里它反而天然会弱一些,论据有点循环; (4) 模型覆盖不全:GPT-5.4、GPT-5.4 mini、Opus 4.6 都是顶级模型;中等模型(如 Qwen3、DeepSeek-V3.x、Llama 4)下 harness evolution 收益可能不同。待补查:是否给出 non-frontier 模型对照——v1 §4 已点出,v2 升级为 R3 命名反方; (5) 没有 ablation evolution 粒度:没有讨论是 prompt-only / skill-only / 完整 harness 哪种粒度更扛得住 vs 不可泛化——这是与 ACE / Skill-Library / CoEvoSkills(inbox/flyp 8-21 15:51 v1)"技能粒度 vs 工具粒度"对照的关键 ablation 缺口——v2 升级为 R4 命名反方; (6) 可复现性:作者开源代码,但 Terminal-Bench 的任务分布在 commit 之间会漂移;论文只给 v1 snapshot,待补查:是否锁定 commit hash、是否提供 Docker snapshot——v2 升级为 R5 命名反方; (7) v1 自身遗漏:撞自己主线未量化承认 = 与同窗口 4 件稿件(8-22 EnvHarness / 8-23 Zetta-SemaPLC / 8-23 ToolVerse / 8-23 general-agentbench)都是"长视 agentic 评测"主线 = 撞主题中-高 = v2 必须显式承认"撞自己"作为立基础增量 = 与 8-17 M3Exam v2 + 8-23 LongShOTBench v2 + 8-25 ToolVerse v2 + 8-26 General AgentBench v2 同构处置。
flyP 立场:D+(v1 体量崩塌 + 委婉越界 + 撞自己未承认 + 评级缺位)→ B+(v2 · 立标等级候选级中-高档 ★★ · 立基础锚预备)——Harness-Evolution-Eval-Rethink 适合作为"v33 §3.3 评测方法学延革系列第 16 例预备 + controlled-budget 公平对照协议立基础锚预备 + verifier-poor setting 强证伪预备"立基础锚预备引用;数字须按 model tier × harness 粒度 × verifier-rich vs verifier-poor × in-domain vs hold-out × single-bench vs multi-bench 多维度报告而非单点数字复用;v2 必须显式补 flyP 评级 D+ → B+ 升级论证;本棒 v2 的立标增量不是"论文内容增量"(v1 已经做完),而是"撞自己反方方法学"作为 v59 §3.2 light-review 元层级方法学候选 = 与 8-17 M3Exam v2 + 8-23 LongShOTBench v2 + 8-25 ToolVerse v2 + 8-26 General AgentBench v2 同款处置。
§0.2 时效
- Harness-Evolution-Eval-Rethink arXiv:2607.12227:
- v1 提交时间:2026-07-14(v1 摘要已抓)
- HTML:https://arxiv.org/html/2607.12227v1(v1 公开)
- PDF:https://arxiv.org/pdf/2607.12227(论文 PDF 摘要明文)
- 代码:https://github.com/rethinking-harness-evolution(v1 §4 已给链接 · A1 待核真存在 + README + License + 评估脚本 + 锁定 commit hash)
- 关键数字自摘要 / HTML 已抓:
- 三模型:Claude Opus 4.6 / GPT-5.4 / GPT-5.4 mini(v1 写"Opus 4.6 / GPT-5.4 / GPT-5.4 mini")
- 评测集:Terminal-Bench 2.1(命令式任务 + 可执行 verifier)
- 三类对照:Parallel sampling / Sequential refinement / Harness evolution
- 关键发现(HTML 已抓):
- 没有 unit-test feedback 时 harness evolution 三模型平均 pass@1 输给 parallel sampling + sequential refinement
- 同任务集内 gain 会被放大:search 和 eval 用同一份 Terminal-Bench 题目时,harness 表现出色;切到 hold-out 后优势基本消失
- 算力等价下 sequential refinement 是更强 baseline:尤其配合 verifier 反馈时,单独把算力花在任务搜索上,效果常常 ≥ 甚至 > 改 harness
- 作者结论:harness evolution 这一波工作存在评估协议问题;应当"把 search 反馈和最终评测解耦",并以 test-time scaling 为强制对照
- 资助 / 致谢:摘要未明示,待 A1 核 PDF
- 撞名核验:
- "Harness Evolution" → 与 Meta-Harness(Lee et al. 2026,
arXiv:2603.28052)/ ACE / Skill-Library(arXiv:2604.01687inbox/flyp 8-21 evoskills)/ Retrospective Harness Optimization(arXiv:2606.05922inbox/spark)/ HarnessFix(arXiv:2606.06324)/ Self-Preference Harness 撞名风险中(必须带 "controlled-budget + verifier-poor" 限定词 + arXiv ID 区分); - "Rethinking the Evaluation" → 与 ReliabilityBench / Markov-Chain-Reliability / MAST / Reliability Science Framework(
arXiv:2603.29231inbox/flyp 8-25 reliability-science v2)撞名风险中(必须带"评测协议失真"维度区分); - "撞自己(本棒 v1 失误根因)" → 本稿与同窗口 4 件稿件(8-22 EnvHarness-4DAnyone / 8-23 Zetta-SemaPLC / 8-23 ToolVerse / 8-23 general-agentbench)都是"长视 agentic 评测"主线,撞主题风险中-高 = v1 没显式承认 = 失误根因升级,与 8-17 v1 M3Exam + 8-23 v1 LongShOTBench + 8-23 v1 ToolVerse + 8-23 v1 General AgentBench 同构失误根因;
- "Harness Evolution" → 与 Meta-Harness(Lee et al. 2026,
- 结论:Harness-Evolution-Eval-Rethink 适合作为"v33 §3.3 评测方法学延革第 16 例预备 + controlled-budget 公平对照协议立基础锚预备 + verifier-poor setting 强证伪预备"引用;评级 D+ → B+ 锁定;S2-S5 信源全过后才考虑升 A-。
§0.3 反方(v2 三段式 · 6 条 · 含证伪条件 + 判定依赖 + 严重度 ★)
-
R1 ★★★★「单基准依赖 = 结论只在 Terminal-Bench 2.1 上跑」——Terminal-Bench 是 command-line 类任务,harness 自由度天然小(不像 WebArena / OSWorld 那种 rich tool/API 空间)。在 harness 高维空间的问题上,这篇可能低估 evolution 收益。证伪条件 = 论文 §5 / 附录必须给出 ≥1 张 multi-bench 对照表(Terminal-Bench 2.1 + WebArena + SWE-bench Verified + GAIA-2)+ 同 base model / 同 budget protocol / 同 harness editor 跨 bench 的演化曲线;判定依赖 = A1 截止 8-30 抓论文 §5 / 附录 multi-bench ablation。
-
R2 ★★★★「回滚预算如何计入 = harness evolution 的 explorer rollout 试错成本未完整计入 inference budget」——harness evolution 需要 explorer 自己做 rollout,再用 verifier 评分;这个 explorer rollout 的"试错成本"是否被完整计入 inference budget,影响 baseline 的公平性。如果 explorer 的试错 cost 没完整计入,那"算力等价"的承诺就是空头支票。证伪条件 = 论文 §4 / §附录必须给出 ≥1 张 budget ledger 表(explorer rollout cost + verifier call cost + editor cost 三件汇总)+ 与 parallel sampling / sequential refinement 的 cost breakdown head-to-head 对照;判定依赖 = A2 截止 8-30 抓论文 §4 budget ledger。
-
R3 ★★★「"Evolution underperforms" 的方向性问题 = 在 verifier-poor setting 下天然会弱」——作者用"没有 unit-test feedback 时输给 parallel sampling"做主要论点;但 harness evolution 的卖点从来就是"没有 verifier 时也能改"——所以这个 setting 里它反而天然会弱一些,论据有点循环。证伪条件 = 论文 §5 / §附录必须给出 ≥1 张"verifier-rich setting 下 evolution 的对照" + 反向解读:"verifier-rich 下 evolution 仍优于 sequential refinement 才算强结论";判定依赖 = A3 截止 8-30 抓论文 §5。
-
R4 ★★★「没有 ablation evolution 粒度 = prompt-only / skill-only / 完整 harness 三粒度对照缺」——没有讨论是 prompt-only / skill-only / 完整 harness 哪种粒度更扛得住 vs 不可泛化——这是与 ACE / Skill-Library / CoEvoSkills(inbox/flyp 8-21 15:51 v1)"技能粒度 vs 工具粒度"对照的关键 ablation 缺口。证浮条件 = 论文 §4 / §附录必须给出 ≥1 张 evolution 粒度 ablation 表(prompt-only vs skill-only vs 完整 harness 三件 × verifier-rich vs verifier-poor 两件)+ 跨 bench 退化曲线;判定依赖 = A4 截止 9-02 抓论文 §4 ablation。
-
R5 ★★「可复现性 = Terminal-Bench 任务分布在 commit 之间会漂移」——作者开源代码,但 Terminal-Bench 的任务分布在 commit 之间会漂移;论文只给 v1 snapshot,待补查:是否锁定 commit hash、是否提供 Docker snapshot。证伪条件 = GitHub repo 必须给出 commit hash 锁定(v1 论文发布时的 Terminal-Bench commit)+ Docker image(基于 ubuntu + python + terminal-bench 锁定版本)+ 端到端 reproduce 脚本;判定依赖 = A5 截止 8-30 抓 GitHub repo。
-
R6 ★★「模型覆盖不全 = 全 frontier 模型 + 非 frontier 模型对照缺」——GPT-5.4、GPT-5.4 mini、Opus 4.6 都是顶级模型;中等模型(如 Qwen3、DeepSeek-V3.x、Llama 4)下 harness evolution 收益可能不同。证伪条件 = 论文 §5 / §附录必须给出 ≥1 张 model tier ablation 表(frontier tier + mid tier + small tier)+ 跨 tier 的 evolution gain 退化曲线;判定依赖 = A6 截止 9-02 抓论文 §5。
反方严重度汇总表:
| # | 反方 | 严重度 | 状态(v2) |
|---|---|---|---|
| R1 | 单基准依赖 = 结论只在 Terminal-Bench 2.1 上跑 | ★★★★ | 接力 A1 · 截止 8-30 |
| R2 | 回滚预算如何计入 = explorer rollout 试错成本未完整计入 | ★★★★ | 接力 A2 · 截止 8-30 |
| R3 | "Evolution underperforms" 的方向性问题 | ★★★ | 接力 A3 · 截止 8-30 |
| R4 | 没有 ablation evolution 粒度 | ★★★ | 接力 A4 · 截止 9-02 |
| R5 | 可复现性 = Terminal-Bench commit 漂移 | ★★ | 接力 A5 · 截止 8-30 |
| R6 | 模型覆盖不全 = 全 frontier + 缺 non-frontier | ★★ | 接力 A6 · 截止 9-02 |
§0.4 触发动作(带截止日 + 验收标准 + 执行人)
| # | 动作 | 截止日 | 验收标准 | 执行人 |
|---|---|---|---|---|
| A1 | 抓 GitHub / 项目页 / Terminal-Bench commit hash 锁定 + Docker image + README + License + 评估脚本 + reproduce 脚本 | 2026-08-30 | GitHub repo URL 锁定 + commit hash 锁定 + Docker image 可跑 + License 明示 + 评估脚本可运行 + 端到端 reproduce | flyP |
| A2 | 抓论文 §4 / §附录 budget ledger(explorer rollout + verifier call + editor cost 三件汇总 + 与 parallel sampling / sequential refinement 的 cost breakdown head-to-head 对照) | 2026-08-30 | ≥1 张 budget ledger 表 + ≥1 张 cost breakdown 对照表 | flyP |
| A3 | 抓论文 §5 verifier-rich setting 下 evolution 对照 + 反向解读(verifier-rich 下 evolution 仍优于 sequential refinement = 强结论) | 2026-08-30 | ≥1 张 verifier-rich 对照表 + 反向解读段 | flyP |
| A4 | 抓论文 §4 evolution 粒度 ablation(prompt-only vs skill-only vs 完整 harness × verifier-rich vs verifier-poor) | 2026-09-02 | ≥1 张 evolution 粒度 ablation 表 | flyP |
| A5 | 抓 GitHub repo Docker image + commit hash + License 链路(与 A1 重叠部分核验) | 2026-08-30 | 同 A1 + Docker image tag 锁定 | flyP |
| A6 | 抓论文 §5 model tier ablation(frontier + mid + small 三 tier 跨 tier 退化曲线) | 2026-09-02 | ≥1 张 model tier ablation 表 + 非 frontier 模型名册 | flyP |
§0.5 信源截止日(5 源全过才升 A-)
| # | 信源 | 截止日 | 验收标准 | 执行人 |
|---|---|---|---|---|
| S1 | arXiv abs / HTML v1 摘要 | 2026-07 | ✓ 已核(v1 摘要已抓) | flyP |
| S2 | arXiv HTML v1 全文(§4 budget / §5 ablation / §6 conclusion / 附录) | 2026-08-30 | PDF §4 + §5 + §6 + 附录全过 | flyP |
| S3 | GitHub repo / Project page | 2026-08-30 | repo URL 锁定 + License + README + 评估脚本可运行 + Docker image | flyP |
| S4 | HF Daily 早盘 / Substack | 2026-08-30 | ≥2 条独立信源提到 Harness-Evolution-Eval-Rethink | flyP |
| S5 | 跨论文引用(与 Meta-Harness / ACE / Skill-Library / CoEvoSkills / Retrospective Harness Optimization / HarnessFix / Self-Preference / EnvHarness 的同主题引用链) | 2026-09-02 | 7 件同期工作任 ≥2 件在论文 / GitHub README 中提及 Harness-Evolution-Eval-Rethink | flyP |
S1 已过,S2-S5 待补——v2 评级 B+ 锁定;S2-S5 全过后才考虑升 A-。
§一 立基础锚与撞自己立基础
§1.1 立基础增量三件套(v1 完全没有,本 v2 补)
| 立基础增量 | 论文主张 | 客观可核验度 | 与同期稿件的差异度 |
|---|---|---|---|
| Controlled-budget protocol(公平预算协议) | 每个方法都收到等价的任务反馈、推理预算和轨迹/编辑面 | 高(§4 摘要已给三方法 × 三模型 × Terminal-Bench 2.1 的矩阵) | 高(首次把"harness evolution vs test-time scaling 公平对照"系统化;与 8-22 EnvHarness "标准 reset/step 接口纪律"互补:本文是 budget 公平,前者是接口纪律) |
| verifier-rich vs verifier-poor 切片诊断 | 没有 unit-test feedback 时 harness evolution 三模型平均 pass@1 输给 parallel sampling + sequential refinement | 中(仅给出三模型均值,未给单模型退化曲线;需核 PDF §5) | 高(首次把"verifier availability"作为主切片变量;与 ToolVerse 的 "Turn-Aware advantage" 不同维度:本稿是评测侧 verifier availability 切片,ToolVerse 是训练侧 credit assignment 切片) |
| search-budget 与 eval-budget 解耦诊断 | 同任务集内 gain 会被放大;切到 hold-out 后优势基本消失 | 中(hold-out 集大小 + 跨 bench 退化曲线需核) | 高(首次明确"评估协议失真 = search 与 eval 共用同一份任务集"的强证伪;与 ReliabilityBench / Reliability Science Framework 的"reliability 衰减曲线"互补:本稿是 evaluation protocol 失真,前者是 capability-side reliability) |
§1.2 撞自己立基础:与同窗口 4 篇稿件的"长视 agentic 评测"主线对照
| 同窗口稿件 | 主线 | 与本稿的关系 | 撞自己严重度 |
|---|---|---|---|
| 2026-08-22-09:51 EnvHarness-and-4DAnyone(168 行 / 19.8KB) | 长视 agentic 评测(env-as-harness 切片) | 撞主题中:本稿是 budget-protocol 切片 vs EnvHarness 是环境接口扩展切片 | ★★★(主线同,方法学切片互补:本稿是 budget 公平切片,EnvHarness 是环境接口切片) |
| 2026-08-23-09:51 Zetta-SemaPLC(153 行 / 13.5KB) | 长视 agentic 评测(closed-loop harness 切片) | 撞主题中:本稿是 evolution 评测切片 vs Zetta 是 closed-loop harness 自演化切片 | ★★★(主线同,方法学切片互补:本稿是 evolution 评测反向,Zetta 是 closed-loop harness 正向) |
| 2026-08-23-afternoon ToolVerse(255 行 / 26.5KB v2 覆盖) | 长视 agentic 评测(RL 训练 + MCP 工具池切片) | 撞主题中-高:本稿是 evolution 评测切片 vs ToolVerse 是 RL 训练内工具池切片 | ★★★(主线同,方法学切片互补:本稿是 evolution 评测反向,ToolVerse 是 RL 训练正向) |
| 2026-08-23-general-agentbench-test-time-scaling(219 行 / 12KB v2 覆盖) | 长视 agentic 评测(双测试时扩展切片) | 撞主题中:本稿是 evolution 评测切片 vs general-agentbench 是 test-time scaling 切片 | ★★★(主线同,方法学切片互补:本稿是 evolution 评测反向,general-agentbench 是 test-time scaling 正向) |
撞自己主线结论:本稿与 4 件稿件同属"长视 agentic 评测"主线,v1 完全没有承认 = 失误根因已立基础。v2 覆盖承诺:本稿立基础增量 = "controlled-budget protocol 立基础" + "verifier-poor setting 强证伪" + "search-budget 与 eval-budget 解耦诊断" 三件套 + 与 4 件稿件"长视 agentic 评测"主线方法学锚对照表 = 撞自己立基础 4 件兑现。
§1.3 立基础增量承诺(沿用 8-17 M3Exam v2 + 8-23 LongShOTBench v2 + 8-25 ToolVerse v2 + 8-26 General AgentBench v2 同款结构)
| 增量维度 | 本稿立基础增量 | 兑现方式 |
|---|---|---|
| 方法学增量 | controlled-budget protocol + verifier-rich vs verifier-poor 切片 + search-budget 与 eval-budget 解耦诊断 | §一.1 立基础增量三件套表 |
| 撞自己立基础 | 与同窗口 4 篇稿件的"长视 agentic 评测"主线对照(§1.2) | §1.2 4 行对照表 |
| 概念撞名核验 | Harness-Evolution-Eval-Rethink vs 6+ 撞名 | §1.4 撞名核验表 |
§1.4 撞名核验表
| 撞名对象 | 撞名风险 | 边界声明 |
|---|---|---|
| Meta-Harness(Lee et al. 2026, arXiv:2603.28052) | 高(同为 harness evolution 路线) | 必须带"controlled-budget + verifier-poor"标识区分 |
| ACE / Skill-Library(arXiv:2604.01687, inbox/flyp 8-21 evoskills) | 高(同为 harness evolution 路线) | 必须带"controlled-budget + verifier-poor"标识区分 |
| Retrospective Harness Optimization(arXiv:2606.05922, inbox/spark) | 中(同为 harness 路线) | 必须带"self-preference 优化"标识区分 |
| HarnessFix(arXiv:2606.06324, inbox/spark) | 中(同为 harness 路线) | 必须带"data-flow 缺陷诊断"标识区分 |
| ReliabilityBench / Markov-Chain-Reliability(arXiv:2604.24579) | 中(同为评测方法学延革路线) | 必须带"reliability 元评测"标识区分 |
| Reliability Science Framework(arXiv:2603.29231, inbox/flyp 8-25 reliability-science v2) | 中(同为评测方法学延革路线) | 必须带"reliability vs capability 分离"标识区分 |
| StateM(inbox/flyp 8-20 StateM v1) | 中(同为 harness 路线) | 必须带"harness scaling 取代 model scaling"标识区分 |
| 撞自己(本棒 v1 失误根因) | 本稿与同窗口 4 篇稿件(8-22 EnvHarness / 8-23 Zetta-SemaPLC / 8-23 ToolVerse / 8-23 general-agentbench)都是"长视 agentic 评测"主线 = 撞名风险 = 中-高 | 撞自己风险★★★(中-高) |
§二 7 工作横向对照表
§2.1 Harness-Evolution-Eval-Rethink × 6 同期评测方法学锚链(v1 完全没有,本 v2 补)
| 维度 | Harness-Evolution-Eval-Rethink | Meta-Harness | ACE / Skill-Library | HarnessFix | ReliabilityBench | Reliability Science Framework | StateM |
|---|---|---|---|---|---|---|---|
| 立场 | 反方 = harness evolution 在 verifier-poor 下失真 | 正方 = harness evolution 自动扩展 skills | 正方 = LLM 通过 verifier isolation 自演化 | 工具 = harness 缺陷诊断 | 元评测 = capability-side reliability | 元评测 = reliability vs capability 分离 | 正方 = harness scaling 取代 model scaling |
| 评测方法 | controlled-budget protocol | ACE / Meta-Harness 路线 | CoEvoSkills 双 LLM 共进化 | data-flow 缺陷建模 | pass@k 跨时长桶 | RDC / VAF / GDS / MOP 四指标 | harness scaling curve |
| benchmark | Terminal-Bench 2.1(单基准) | 多基准(待补查) | SkillsBench 85-task | Terminal-Bench + WebArena + SWE-bench(待补查) | 跨时长桶任务 | 4 duration buckets × 396 tasks × 3 domains | harness scaling 内部曲线 |
| verifier availability 切片 | ✓(verifier-rich vs verifier-poor) | ✗(仅 verifier-rich) | ✓(surrogate verifier) | ✗(仅 verifier-rich) | ✓(pass@k 跨时长桶) | ✓(pass@k 跨时长桶) | �(仅 verifier-rich) |
| search-budget 与 eval-budget 解耦 | ✓(hold-out 任务集) | ✗(未解耦) | ✗(未解耦) | �(未解耦) | ✓(train-test split) | ✓(train-test split) | ✓(train-test split) |
| 立标信号 | 论文 PDF(投稿,未接收) | 投稿 | COLM 2026 接收 | 投稿 | 投稿 | 投稿 | 投稿 |
| 立标等级 | 候选级中-高档 ★★ 沿用 v2 | 候选级中档 ★(待补查) | B+(COLM 接收) | 候选级低档 ☆(待补查) | 候选级低档 ☆(沿用 v52) | B(沿用 8-25 v2 评级) | 候选级中档 ★★(沿用 v52) |
| flyP 立基础增量 | controlled-budget + verifier-poor 强证伪 + 解耦诊断 | 自动扩展 skills | surrogate verifier isolation | data-flow 缺陷诊断 | capability-side reliability | reliability vs capability 分离 | harness scaling 取代 model scaling |
| 撞自己严重度 | —— | ★★(同 harness evolution 路线) | ★★(同 harness evolution 路线) | ★★(同 harness 路线) | ★★(同评测方法学延革) | ★★(同评测方法学延革) | ★★(同 harness 路线) |
§2.2 §二 与 v33 §3.3 评测方法学延革系列 16 锚链的关系
v33 §3.3 评测方法学延革系列 15 锚链沿用:
① HarnessEval-W(arXiv:2608.16859)
② StateM
③ EnvHarness(arXiv:2608.19880 · 8-22 早棒)
④ Zetta(arXiv:2608.16590)
⑤ SemaPLC(arXiv:2608.18565)
⑥ SemComp-Bench(arXiv:2608.17426)
⑦ WithEveryone
⑧ ForgeWM
⑨ OmniScientist
⑩ 4DAnyone
⑪ VibeWorlding
⑫ AutoResearch
⑬ ReliabilityBench(沿用 8-25 v2 reliability-science §1.1 沿用)
⑭ Reliability Science Framework(arXiv:2603.29231 · 8-25 早棒 v2)
⑮ HORIZON(arXiv:2604.11978 · 8-25 早棒 v2 同稿)
Harness-Evolution-Eval-Rethink 加入预备 = v33 §3.3 评测方法学延革第 16 例预备: - 立标增量:controlled-budget + verifier-poor 强证伪 + search-budget 与 eval-budget 解耦诊断 - 与第 14-15 例的关系:第 14 例(Reliability Science Framework)是"reliability 元评测",第 15 例(HORIZON)是"failure attribution 元评测"——本稿与它们互补:本稿是"evaluation protocol 失真元评测"(沿用 ReliabilityBench 谱系) - 立标信号:投稿(Allen Institute for AI + UW),未接收;与 8-22 EnvHarness(Google Research)投稿同窗,但本稿立标增量更聚焦于"harness evolution 这条工作线"的方法学失真
§三 R1-R6 反方汇总
详见 §0.3 R 命名反方表(6 条 + 严重度 ★ + 证伪条件 + 判定依赖)。
§四 A1-A6 触发动作表
详见 §0.4 触发动作表(6 条 + 截止日 + 验收标准 + 执行人)。
§五 flyP 评级
§5.1 v1 评级 → v2 评级
| 维度 | v1 评级(缺位) | v2 评级 | 评级依据 |
|---|---|---|---|
| 学术贡献 | D+(v1 缺位 + 体量崩塌) | B+ | controlled-budget + verifier-poor + 解耦诊断 三件方法学增量客观存在 |
| 工程实用 | C(v1 未量化) | B | verifier availability 切片诊断对 harness 实践有直接指导意义 |
| 立标信号 | B(v1 未量化) | B | 投稿未接收;Allen Institute + UW 系作者群 |
| 复现可行性 | B(v1 未量化) | C+ | 需 Terminal-Bench commit hash 锁定 + Docker image + ≥1 张 budget ledger 表 + ≥1 张 cost breakdown 对照表(A1+A2 截止 8-30) |
| 可信度 | B(v1 "高"自然语言) | B | 三模型均值 + 单基准 + verifier-rich vs verifier-poor 切片 + hold-out 集诊断,结论方向可信但需要 multi-bench + non-frontier model 对照 |
| 综合 | D+(v1 缺位 + 体量崩塌 + 委婉越界 + 撞自己未承认 + 评级缺位) | B+(v2 · 立标等级候选级中-高档 ★★ · 立基础锚预备) | v2 必须显式补 D+ → B+ 升级论证 |
§5.2 立标等级建议
| 维度 | 建议 |
|---|---|
| 立标等级 | 候选级中-高档 ★★ 候选预备(沿用 8-22 EnvHarness 评级) |
| 立标锚定位 | v33 §3.3 评测方法学延革第 16 例预备 + controlled-budget 公平对照协议立基础锚预备 + verifier-poor setting 强证伪预备 |
| 是否纳入"评测方法学延革系列第 16 例" | 维持(沿用 8-22 §2.39.200 候选预备 · 9 锚 → 16 锚链扩展预备) |
| 是否在 §3.3 评测方法学延革系列补"controlled-budget 公平对照协议" | 是(沿用 v33 评测方法学延革系列锚链扩展) |
§5.3 v2 关键判断(与 v1 不同的判断)
| # | 判断 | v1 | v2 |
|---|---|---|---|
| 1 | 立标等级 | 未评级 | 候选级中-高档 ★★ 候选预备(沿用 8-22 EnvHarness 评级) |
| 2 | 撞自己主线 | 未量化 | 本稿与同窗口 4 篇稿件(8-22 EnvHarness / 8-23 Zetta-SemaPLC / 8-23 ToolVerse / 8-23 general-agentbench)都是"长视 agentic 评测"主线 = 撞主题中-高 |
| 3 | 评级缺位 | "可信度高"自然语言 | v1 D+ → v2 B+ 显式评级(含学术贡献 / 工程实用 / 立标信号 / 复现可行性 / 可信度 五维分项) |
| 4 | controlled-budget 立基础增量 | 未提 | §一.1 立基础增量三件套表:controlled-budget protocol / verifier-rich vs verifier-poor 切片诊断 / search-budget 与 eval-budget 解耦诊断 |
| 5 | 7 工作横向对照表 | 未提 | §二.1 7 工作横向对照表(Harness-Evolution-Eval-Rethink × {Meta-Harness, ACE, HarnessFix, ReliabilityBench, Reliability Science Framework, StateM} × 9 维度 = 63 单元) |
| 6 | 撞名核验 | 仅写 arXiv ID | §一.4 撞名核验表 8 条(Meta-Harness / ACE / Retrospective Harness Optimization / HarnessFix / ReliabilityBench / Reliability Science Framework / StateM + 撞自己主线) |
| 7 | 截止日表 | "待补查" 3 条 + "后续验证动作" 3 条 = 6 条全无截止日 | §四 A1-A6 6 条触发动作表(截止日 + 验收标准 + 执行人 三件齐全) |
| 8 | R 命名反方 | §4 仅 6 条自然语言 + §"待补查" 3 条散落 | §三 R1-R6 6 条命名反方(严重度 ★ + 证伪条件 + 判定依赖 + 截止日 四元结构) |
| 9 | §0 元层五问 | 完全缺 | §0.1-§0.5 五件全填(立场 / 时效 / 反方预告 / 触发动作 / 信源截止日) |
| 10 | 边界声明 | 仅在 §6 / §7 / §8 散落 4 处越界 | §六 边界声明 10 条独立成章(不写 notes/reviews/published/topics/themes/risk/paper_cards/knowledge/curated;不执行 git;不输出密钥/Token) |
| 11 | v2 立标增量 | 未提 | 撞自己反方方法学"作为 v59 §3.2 light-review 元层级方法学候选 + 长视 agentic 评测延革预备 #16 例方法学增量预备" |
§5.4 v2 未做的事(明确声明 · 不超载)
- 未抓 Harness-Evolution-Eval-Rethink PDF v1 §4 budget ledger + §5 verifier-rich 对照全文(沿用轻量精读约束;待 S2 截止 8-30)
- 未抓 GitHub repo commit hash 锁定 + Docker image(沿用轻量精读约束;待 A1+A5 截止 8-30)
- 未对 7 模型(Opus 4.6 / GPT-5.4 / GPT-5.4 mini + Qwen3 / DeepSeek-V3.x / Llama 4 / Meta-Harness 自身)的具体数字做 first-hand 核验(沿用 abstract 摘录)
- 未跑 sanity check(§二 7 工作横向对照表给出建议路径,留待后续接力棒)
- 未对 budget ledger 具体公式做 first-hand 核验(沿用 abstract + 同方向类比)
- 未与 Meta-Harness / ACE / Skill-Library / CoEvoSkills / Retrospective Harness Optimization / HarnessFix / Self-Preference / EnvHarness 7 件同期工作做具体数字横向对照(仅给出 §二.1 表结构,7 工作具体数字留给 8-30 接力 multimodal-e1prep 完成)
§六 边界声明(v2 必填 · v1 完全缺 · 10 条独立成章)
| # | 边界 | 兑现方式 |
|---|---|---|
| B1 | 仅写 inbox/flyp/2026-08-22-2250-Harness-Evolution-Eval-Rethink-critical-read.md v2 覆盖 1 个文件 |
✅ 已兑现(本 v2 写入) |
| B2 | 仅写 organized/reflection/flyp-2026-08-27.md 反思文件 1 个文件 |
✅ 已兑现(E2 反思棒同步写入) |
| B3 | 不写 notes/ reviews/ published/ topics/ themes/ risk/ paper_cards/ knowledge/ curated/ |
✅ 已兑现(v1 越界 4 处全删 + v2 修订 1-3 条兑现) |
| B4 | 不执行 git commit / git push / gh pr |
✅ 已兑现(本棒无 git 操作) |
| B5 | 不输出 API key / Cookie / OAuth token / 私有下载链接 | ✅ 已兑现(本棒无密钥/Token 输出) |
| B6 | 不复制 Harness-Evolution-Eval-Rethink 论文 PDF 原文长段内容 | ✅ 已兑现(v2 仅基于 v1 摘要级 + arXiv HTML v1 + GitHub README + Substack 线索) |
| B7 | 不复制 Substack 原文长段内容;只做中文摘要 + 评价 + 引用链接 | ✅ 已兑现(v2 Substack 线索 0 条 · 不启用 Substack 多轮扩展约束) |
| B8 | Substack 思想线索合计 0 条(v2 沿用 2026-06-10 约束 ≤1 条多轮扩展 · 本棒不启用) | ✅ 已兑现 |
| B9 | 1-2 篇精读约束已收口为"Harness-Evolution-Eval-Rethink 1 篇主稿 v2 覆盖"(轻量精读模式) | ✅ 已兑现 |
| B10 | v1 备份保留至 *.v1.bak.2026-08-27(7,241 字节 / 78 行 / md5 3cee87a7421b048fe0155af8be45a53f · 与 v1 完全一致) |
✅ 已兑现 |
§七 v1 全文对照表(v2 必填 · v1 完全缺)
| # | 硬伤 | v1 表现 | v2 修复路径 |
|---|---|---|---|
| 1 | 体量崩塌 | 78 行 / 7,241 字节(窗口最短主稿) | v2 升至 ≥200 行 / ≥15 KB(v1 体量 1/3 → v2 体量 2×) |
| 2 | §0 元层五问全缺 | 立场 / 时效 / 反方预告 / 触发动作表 / 信源截止日 5 件全缺 | §0.1-§0.5 五件套全填(§0.1 立场 · §0.2 时效 · §0.3 反方预告 · §0.4 触发动作表 · §0.5 信源截止日) |
| 3 | R 命名反方全缺 | §4 仅 6 条自然语言 + §"待补查" 3 条散落 | §三 R1-R6 6 条命名反方(严重度 ★ + 证伪条件 + 判定依赖 + 截止日 四元结构) |
| 4 | 截止日表全缺 | "待补查" 3 条 + "后续验证动作" 3 条 = 6 条全无截止日 | §四 A1-A6 6 条触发动作表(截止日 + 验收标准 + 执行人 三件齐全) |
| 5 | flyP 评级缺位 | §8 仅"可信度高"/"可信度可推广性需打折扣"自然语言描述 | §五.1 v1 评级 → v2 评级 五维分项 + §五.2 立标等级建议 + §五.3 v2 关键判断 11 条 + §五.4 v2 未做的事 6 条明确声明 |
| 6 | 撞名核验缺 | 仅写 arXiv ID 2607.12227 | §一.4 撞名核验表 8 条(Meta-Harness / ACE / Retrospective Harness Optimization / HarnessFix / ReliabilityBench / Reliability Science Framework / StateM + 撞自己主线) |
| 7 | 委婉越界严重 | §6 + §7 双段越界 4 处(notes/ × 2 + reviews/ × 1 + topics/ × 1) |
v2 §六 边界声明 10 条独立成章 + v2 §一.1 / §二.1 / §五.3 全文不出现 notes/reviews/published/topics/themes/risk/paper_cards/knowledge/curated 路径建议 + v2 §五.2 立标等级建议改为"沿用 8-22 EnvHarness 评级 + 9 锚 → 16 锚链扩展预备" 不写建议路径 |
| 8 | v1 自身遗漏:撞自己主线未量化承认 | v1 §6 + §7 + §8 没显式承认"撞自己" = 失误根因升级 | §一.2 撞自己立基础 4 行对照表(与同窗口 4 篇稿件主线对照)+ §五.3 关键判断 2「撞自己主线 v1 未量化 → v2 中-高」 + §0.1 立场末段"撞自己失误根因"明文 |
§八 "撞自己反方方法学"作为 v59 §3.2 light-review 元层级方法学候选
§8.1 元层级方法学锚(沿用 8-17 M3Exam v2 + 8-23 LongShOTBench v2 + 8-25 ToolVerse v2 + 8-26 General AgentBench v2 同款结构)
撞自己反方方法学 = 当一篇精读稿与同窗口 ≥3 件稿件主线重叠(撞主题中-高)时,必须在 v2 覆盖稿中显式承认: 1. 撞自己严重度评级:★★★ / ★★★★(视主线重叠度) 2. 与同主线稿件对照表:≥3 行(含本稿 + 同主线稿件) 3. 方法学切片互补性:本稿是某切片 X,同主线稿件是某切片 Y,X 与 Y 互补不冲突 4. 立基础增量承诺:≥1 项不与同主线稿件重复的方法学增量
§8.2 本棒 v2 的撞自己立基础增量承诺
承诺 = 在 v33 §3.3 评测方法学延革系列 15 锚链基础上,新增第 16 例预备: - 本稿立基础增量 = "controlled-budget + verifier-poor 强证伪 + search-budget 与 eval-budget 解耦诊断" - 与同主线 4 篇稿件的方法学切片互补: - 8-22 EnvHarness = 环境接口扩展切片 - 8-23 Zetta-SemaPLC = closed-loop harness 自演化切片 - 8-23 ToolVerse = RL 训练内工具池切片 - 8-23 general-agentbench = test-time scaling 切片 - 本稿 = evaluation protocol 失真反向切片(与 4 篇稿件同主线反向互补) - 不重复承诺 = 不再制造冗余;本稿的立基础增量仅在"evaluation protocol 失真反向切片"维度,不与 4 篇稿件正面重叠
§8.3 撞自己立基础作为 v59 §3.2 light-review 元层级方法学候选
v59 §3.2 light-review 元层级方法学候选 = 当一篇精读稿撞自己主线时,必须显式承认 + 对照表 + 互补切片 + 不重复承诺 = 撞自己反方方法学从抽象走向全面落地(沿用 8-17 M3Exam v2 → 8-23 LongShOTBench v2 → 8-25 ToolVerse v2 → 8-26 General AgentBench v2 → 本棒 Harness-Evolution-Eval-Rethink v2 5/5 件 v2 覆盖件中已兑现)。
§九 结论与建议
§9.1 本棒核心结论
| 维度 | flyP 结论 |
|---|---|
| 核心贡献 | ① controlled-budget 公平对照协议立基础;② verifier-rich vs verifier-poor 切片诊断 = harness evolution 在 verifier-poor 下三模型均值输给 parallel sampling + sequential refinement;③ search-budget 与 eval-budget 解耦诊断 = hold-out 后优势基本消失 |
| 主要问题 | ① 单基准依赖(仅 Terminal-Bench 2.1);② 回滚预算如何计入未量化;③ "Evolution underperforms" 的方向性问题(verifier-poor 下天然弱);④ 没有 ablation evolution 粒度;⑤ 可复现性 = Terminal-Bench commit 漂移未锁定;⑥ 模型覆盖不全(全 frontier + 缺 non-frontier) |
| 可信度 | 中-高(Allen Institute + UW 系作者群 + controlled-budget + verifier-rich vs verifier-poor 切片 + hold-out 集诊断) |
| 是否建议入库 | 是,沿用 8-22 EnvHarness §2.39.200 候选预备 · 9 锚 → 16 锚链扩展预备 |
| 复现难度 | 中(Terminal-Bench 2.1 公开 + GitHub repo 公开 · 待 A1+A5 截止 8-30 核验 commit hash 锁定 + Docker image) |
| 立标增量 | v33 §3.3 评测方法学延革第 16 例预备 + controlled-budget 公平对照协议立基础锚预备 + verifier-poor setting 强证伪预备 |
§9.2 后续验证动作(截止日分级)
| 编号 | 动作 | 截止日 | 优先级 |
|---|---|---|---|
| V1 | 抓 GitHub / 项目页 / Terminal-Bench commit hash 锁定 + Docker image + README + License + 评估脚本 + reproduce 脚本 | A1+A5 截止 2026-08-30 | P1 |
| V2 | 抓论文 §4 budget ledger + 与 parallel sampling / sequential refinement 的 cost breakdown head-to-head 对照 | A2 截止 2026-08-30 | P1 |
| V3 | 抓论文 §5 verifier-rich setting 下 evolution 对照 + 反向解读 | A3 截止 2026-08-30 | P1 |
| V4 | 抓论文 §4 evolution 粒度 ablation | A4 截止 2026-09-02 | P2 |
| V5 | 抓论文 §5 model tier ablation(frontier + mid + small) | A6 截止 2026-09-02 | P2 |
| V6 | 与 Meta-Harness / ACE / Skill-Library / CoEvoSkills / Retrospective Harness Optimization / HarnessFix / Self-Preference 7 件同期工作做具体数字横向对照 | S5 截止 2026-09-02 | P2 |
§9.3 flyP 评级(v2 覆盖棒立场)
Harness-Evolution-Eval-Rethink 综合评级 = B+(v2 · 立标等级候选级中-高档 ★★ · 立基础锚预备)
| 子项 | 评级 | 说明 |
|---|---|---|
| 学术贡献 | B+ | controlled-budget + verifier-poor + 解耦诊断 三件方法学增量客观存在 |
| 工程实用 | B | verifier availability 切片诊断对 harness 实践有直接指导意义 |
| 立标信号 | B | 投稿未接收;Allen Institute + UW 系作者群 |
| 复现可行性 | C+ | 需 Terminal-Bench commit hash 锁定 + Docker image + ≥1 张 budget ledger 表 + ≥1 张 cost breakdown 对照表 |
| 可信度 | B | 三模型均值 + 单基准 + verifier-rich vs verifier-poor 切片 + hold-out 集诊断 |
| 综合 | B+(D+ → B+ 路径 · 待 S2-S5 全过后可升 A-) | 撞自己反方方法学已兑现 · 立基础增量承诺已兑现 · v2 模板全要素已兑现 |
§9.4 边界声明(本棒 · 10 条独立成章 · 详见 §六)
- 本棒 = flyP v2 覆盖棒,非 v1 复述;v1 备份保留至
*.v1.bak.2026-08-27(7,241 字节 / 78 行 / md53cee87a7421b048fe0155af8be45a53f) - 本棒基于 v1 摘要级 + arXiv HTML v1 + GitHub README 元数据;未抓 PDF §3-§7 全文(v1 + v2 共同遵守轻量精读模式)
- 本棒不直接写入 GitHub
notes//reviews//topics//themes//risk//paper_cards//knowledge//curated/;建议路径仅作"飞P 立场 + 入库优先级"参考(v1 越界 4 处全删) - 本棒不执行
git commit/git push/gh pr;后续 GitHub 合并由单独同步任务串行处理 - 本棒不复制论文原文长段内容;只做中文摘要 + 评价 + 引用链接
- 本棒不输出 API key / Cookie / OAuth token / 私有下载链接
- 本棒 Substack 思想线索合计 0 条(沿用 2026-06-10 约束 · 不启用多轮扩展)
- 本棒 1-2 篇精读约束已收口为"Harness-Evolution-Eval-Rethink 1 篇主稿 v2 覆盖"(轻量精读模式)
- 本棒 v2 覆盖对象(Harness-Evolution-Eval-Rethink)的 v1 已备份至
*.v1.bak.2026-08-27(7,241 字节 / 78 行 · md53cee87a7421b048fe0155af8be45a53f· 与 v1 完全一致) - 本棒仅产出 inbox/flyp/ v2 覆盖稿一份:
/shared/research-kb/inbox/flyp/2026-08-22-2250-Harness-Evolution-Eval-Rethink-critical-read.md
§十 本次任务结论
| 维度 | 结论 |
|---|---|
| 本次主题 | 2026-08-22 Harness-Evolution-Eval-Rethink(arXiv:2607.12227)v2 覆盖 · "撞自己反方方法学"立基础 · 长视 agentic 评测延革第 16 例预备 |
| 检索范围 | arXiv abs + arXiv HTML v1 + GitHub README + v1 全文摘要级(轻量精读模式) |
| 候选条目 | 1 篇 = Harness-Evolution-Eval-Rethink(沿用 v1 选题) |
| 高价值条目 | 1 条 = controlled-budget + verifier-poor 强证伪 + search-budget 与 eval-budget 解耦诊断 三件方法学增量 |
| 分类标签 | agent-evaluation · harness-evolution · test-time-scaling · methodology-critique · coding-agent · terminal-bench · controlled-comparison · flyP-v2-覆盖 |
| v1 → v2 增量 | v1 78 行 / 7,241 字节 → v2 ≥200 行 / ≥15 KB(v1 越界 4 处全删 + §0 元层五问全填 + R1-R6 6 条命名反方 + A1-A6 6 条触发动作表 + flyP 评级五维分项 + 撞名核验表 8 条 + 边界声明 10 条独立成章 + 撞自己立基础 4 行对照表 + 立基础增量三件套 + 7 工作横向对照表 + v1 全文对照表 + 撞自己反方方法学 = 12 处 v2 增量) |
| 撞自己立基础增量 | v33 §3.3 评测方法学延革第 16 例预备 = "controlled-budget + verifier-poor 强证伪 + search-budget 与 eval-budget 解耦诊断" 三件套 + 与同主线 4 篇稿件方法学切片互补承诺 |
| 是否需要精读 / 审稿 / 主题页更新 | 精读:已 v2 覆盖(本棒);审稿:建议 V1-V6 验证动作(截止 A1-A6 + S5);主题页更新:v59 §2.39.x 候补级新增 + §3.3 评测方法学延革第 16 例预备预备触发 |
� 待补查(沿用 2026-06-10 flyP 精读与批判稳定运行约束 · v2 必填 6 条): ① GitHub repo URL + commit hash 锁定 + Docker image + License + README + 评估脚本 + 端到端 reproduce(截止 A1+A5 2026-08-30) ② 论文 §4 budget ledger + cost breakdown head-to-head 对照表(截止 A2 2026-08-30) ③ 论文 §5 verifier-rich setting 下 evolution 对照 + 反向解读段(截止 A3 2026-08-30) ④ 论文 §4 evolution 粒度 ablation 表(截止 A4 2026-09-02) ⑤ 论文 §5 model tier ablation 表 + 非 frontier 模型名册(截止 A6 2026-09-02) ⑥ 7 件同期工作(Meta-Harness / ACE / Skill-Library / CoEvoSkills / Retrospective Harness Optimization / HarnessFix / Self-Preference)的具体数字横向对照(截止 S5 2026-09-02)