2026-07-19 R1 · Harness Evolution 的评估被高估了吗
日期:2026-07-19 (Sunday · Asia/Shanghai) · R1 arXiv 链接:https://arxiv.org/abs/2607.12227 video-kb 脚本原路径:
/shared/video-kb/scripts/tom/2026-07-19_R1_harness-evolution-rethink-eval-short-video-script.md
1. 标题与观众
- 标题:Harness Evolution 的评估被高估了吗?——2607.12227 重新审视 Agent 自动化 harness 演化(主标题 25 字符)
- 目标观众:AI 工程师 / Agent 平台开发者
- 一句话核心观点:自动 harness 演化在留出任务上几乎没赢 —— 公开集 99% 不能直接等同于「Agent 真的进步了 99%」。
3. 45-90 秒口播稿
【钩子 — 0–8s】 ARC-AGI-3 公开集上 Schema Harness 跑出 99%。听起来像是 Agent 大跃进,但同一框架在留出任务上掉到 7.78%。这 91 个百分点里,有多少是模型本身的进步?
【机制 — 8–35s】 arXiv 2607.12227 这篇论文专门做了一件事:在「comparable feedback and inference budgets」相近预算口径下,把 automatic harness evolution、simple test-time scaling、discovery baselines 三类方法拉到同一水平做 head-to-head。结果:GPT-5.4 和 Claude Opus 4.6 在 Terminal-Bench 2.1 上,自动 harness 演化在训练同分布任务里看起来赢了,但放到「held-out tasks」留出任务上只给出 only marginal improvements,与 baseline 几乎打平。论文原话叫「does not consistently outperform simple test-time scaling methods」。说人话:很多 headline 数字是 harness 优化 + test-time scaling 的功劳,不是模型真的理解了任务。
【行业对照 — 35–55s】 Schema Harness 项目页自报:不改模型权重,只改 harness 流程,公开集就能拉到 98.98%。但它是 self-reported,ARC Prize 未核实,半私有集 7.78% 才是真正的留出成绩。flyP 反方审稿进一步指出:这个差距对应「matched budget 颗粒度 manipulation 空间」和「搜索与评估共享同一 benchmark 的过拟合风险」。harness evolution 协议 + 评估协议不分开,就一定会得到过度乐观的 99%。
【边界 — 55–72s】 这不是所有 benchmark 都不能信。论文目前只在 Terminal-Bench 2.1,偏 SWE / system 任务家族,RAG / web / 长视频 / embodied agent 都没实测。OpenReview 也还没进,GitHub 仓库 v1 公开、license 未实测显示。结论只能限在这条范围:Agent 自动 harness 演化的留出泛化性被高估了。
【行动 — 72–85s】 今天你能带走一条:看到一个漂亮 benchmark 分数,先问三句 —— 这是公开集还是留出集?这是模型改还是 harness 改?这是同分布还是跨分布?带这三个过滤再看数字,99% 才有意义。
4. 镜头分镜
分镜 1 · hero title(8s)
- 屏幕文字:Harness Evolution 的评估被高估了吗(25 字符)
- 画面元素:深蓝底色 + 中央大字标题 + 右下角小字「arXiv 2607.12227 · UW」
- 运动方式:标题淡入,小字同步出现
- 节奏:静,留 0.5s 给眼睛捕获文字
分镜 2 · 卡片 1 —— 三类 baseline 名称(10s)
- 屏幕文字(三张卡片并排):
- 卡 1:automatic harness evolution
- 卡 2:simple test-time scaling
- 卡 3:discovery baselines
- 画面元素:三卡片水平排列,蓝白灰冷色调,卡间用细线分隔
- 运动方式:从左到右依次滑入
分镜 3 · 流程图 —— 训练分布 vs 留出分布对照(12s)
- 屏幕文字:训练分布:看起来赢了 / 留出分布:marginal improvements
- 画面元素:左右两块色块,左 = 训练分布(浅蓝,填满高度)/ 右 = 留出分布(浅灰,只填底 1/4),中间箭头贯穿,标注「同模型 · 同 harness 协议」
- 运动方式:左块先填满 → 箭头闪一次 → 右块只填一截,凸显巨大落差
分镜 4 · 数字卡 —— ARC-AGI-3 公开集 vs 半私有集(10s)
- 屏幕文字:公开集 98.98% / 半私有集 7.78%(两数字竖排,下方统一小字「Schema Harness · 自报 · ARC Prize 未核实」)
- 画面元素:上大字数字 + 下小字限定语,背景渐变蓝→灰
- 运动方式:上数字先出现,停 1.5s,下数字用更小的字号同步出现
分镜 5 · 证据卡 —— paper verbatim 限定语(10s)
- 屏幕文字:「does not consistently outperform simple test-time scaling methods」 + 小字「「only marginal improvements on held out tasks」 · arXiv 2607.12227 verbatim」
- 画面元素:浅灰卡片底,深蓝文字,左对齐引用符号
- 运动方式:整段文字一次性浮现,自动加粗「does not consistently outperform」
分镜 6 · 风险卡 —— 公开状态 + 边界(10s)
- 屏幕文字(三条限定语,带编号):
- W11:arXiv v1 2026-07-14 · OpenReview 未进
- W12:Terminal-Bench 2.1 偏 SWE/system · RAG/web/embodied 未实测
- W4:abstract 未给具体百分点数字
- 画面元素:三行卡片,左竖排编号徽标(W11/W12/W4),右对应中文小字
- 运动方式:三条自上而下依次出现,每条 0.3s
分镜 7 · 行动清单(8s)
- 屏幕文字(三问):
- 公开集 vs 留出集?
- 模型改 vs harness 改?
- 同分布 vs 跨分布?
- 画面元素:三行加粗问句 + 底部小字「arXiv abs 2607.12227 · github.com/rethinking-harness-evolution」 + 右下小字「OpenReview 未进 · license 未实测」
- 运动方式:三问自上而下逐字出现,落点强调