• 日期:2026-07-18 R3
  • arxiv 链接:https://arxiv.org/abs/2607.08964
  • video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-07-18_R3_long-horizon-terminal-bench-short-video-script.md

1. 标题与观众

  • 标题:Agent 长程任务 · 4% 通关(8 字符 · ≤25 阈值 ✅)
  • 目标观众:AI 工程师 / Agent 工程师 / 技术产品经理
  • 一句话核心观点:dense reward + 子任务细粒度评分下,最强模型 pass@1 也只有 15.2%,全模型平均 4.3%——长程 Agent 还远没到 GPT 能稳过的拐点。

3. 45-90 秒口播稿

Agent 长程任务,4% 通关,你敢信?Long-Horizon-Terminal-Bench(arXiv 2607.08964)用 46 条任务 × 9 大类别,跑下来,最强模型 pass@1 也只有 15.2%(部分奖励阈值 0.95)和 10.9%(完美奖励阈值 1.0)——全模型平均仅仅 4.3% 和 1.7%。平均一次跑完烧掉 9.9M tokens、231 episodes、85.3 分钟,长时序 + 长上下文 + 迭代调试上,95% 还是空白。两条底线:0.95 阈值看产业可用,1.0 阈值看严格正确。行动:把 LH-Terminal-Bench 的 dense + 子任务 schema 当你内部 Agent 评测模板试试——共识方向由我推断,非论文原话。

4. 镜头分镜

  • scene-1 (8s) hero 标题卡:屏幕文字「Agent 长程任务 · 4% 通关」+ 副标题「pass@1 = 15.2% · 完美奖励 = 10.9%」;画面元素 = 主标题 hero 居中 + arXiv 2607.08964 论文角标 + 时间锚 2026-07-09 v1 + 2026-07-13 v2;运动方式 = 0.6s 淡入 + 静止 7s + 0.4s 切场;底部 30 字小字「W22 · arXiv v1 与项目页 v2 模型数 + 类目差异 · 本轮显式标注」。
  • scene-2 (8s) 5 张证据卡(数字三件套 · 0.5s × 5 = 2.5s 内出完):卡 1 = 「46 tasks × 9 类」· 卡 2 = 「9.9M token / 任务」· 卡 3 = 「231 episodes · 85.3 min」· 卡 4 = 「pass@1 = 15.2%」· 卡 5 = 「全模型平均 4.3%」;屏幕文字每条 ≤18 字;底部 30 字小字「W2 · 数字 = paper verbatim · harness 配置变化可漂移」。
  • scene-3 (8s) 流程图:画面元素 = 三层结构(顶层 dense reward 拐点机制 / 中层 长程任务 worker 分级 + 子任务 DAG 评分 + hourly budget 资源画像 + failure-mode 归因 4 类 / 底层 数字 verbatim · 46 tasks · 9 categories · 15.2% / 10.9% / 4.3% / 1.7%);运动方式 = 顶层 0.8s 出现 → 中层 1.2s 描线 → 底层 4 数字 1.6s 顺序弹出;长标签拆分二级子标签 ≤40 字符(沿用 R2 07-18 spark-feedback §下一轮建议);底部 30 字小字「W3 · dense + 子任务 = paper verbatim · aggregator 设计未 abstract 公开」。
  • scene-4 (8s) hero number 第二行:第一行 = 「最强模型 pass@1」· 第二行 = 「15.2%(0.95 阈值)· 10.9%(1.0 阈值)」(底部 30 字小字「数字 verbatim · 部分奖励 vs 完美奖励阈值双轨」)· 第三行 = 「全模型平均 = 4.3% / 1.7%」(底部 30 字小字「W22 · arXiv v1 abstract 4.3% / 1.7% · 跨 9 类平均」);屏幕文字每条 ≤18 字。
  • scene-5 (8s) 三行证据卡:第一行 = 「arXiv 2607.08964」· 第二行(细分隔线)= 「项目页 zli12321.github.io/LHTB」· 第三行(细分隔线)= 「leaderboard + flyP 解释稿」;第三行底部时间锚「2026-07-18 v1 + v2 已 200 实测 · 2026-07-18 18:42 CST 抓取」;底部 30 字小字「W7 · 项目页 v2 = 18 模型 vs arXiv v1 = 15 模型 · 跨版本不一致」+「W10 · Terminus-2 + 90-min = 项目页 verbatim · 非 abstract 公开」。
  • scene-6 (8s) 风险卡(底部 W1-W22 + E1-E8 编号小字):卡 1 = 「跨版本差异」 = 「arXiv v1 = 15 / 项目页 v2 = 18」(W1 + W7 + W22)· 卡 2 = 「harness 配置漂移」 = 「9.9M token · 231 ep · 85.3 min 因 harness 而变」(W2)· 卡 3 = 「subtask aggregator 未 abstract 公开」(W3)· 卡 4 = 「15 模型名单 abstract 未列名」 = 「最强模型」统称(W5)· 卡 5 = 「leaderboard 非 abstract verbatim」 = 「项目页 13 of 46 + 29 of 46」(W6 + W8)· 卡 6 = 「NotebookLM 分类 vs 解释稿推断并列标注」(W15 + W19)· 底部 30 字小字「E8 · leaderboard 跨厂商对比 = 解释稿推断(non-paper)· abstract 仅给最强 / 全模型平均」+「E7 · 学术引用层级 = 脚本作者推断」。
  • scene-7 (8s) 行动清单 5 条:第 1 条 = 读 arXiv 2607.08964 abstract(底部 30 字小字「E7 · 学术引用层级 = 脚本作者推断」)· 第 2 条 = 用 9.9M token / 85 min 当内部 PoC 成本上限(底部 30 字小字「E4 · 解释稿推断 · 非 paper verbatim」)· 第 3 条 = 把 dense + 双阈值当内部业务流评测模板(底部 30 字小字「E3 · 解释稿推断 · 非 paper verbatim · dense-subtask schema」)· 第 4 条 = 失败按 4 类(规划 / 上下文 / 工具 / 早期试错)归因(底部 30 字小字「E1 · 长程剩余空间 = 解释稿推断 · NotebookLM 分类并列保留 · W19 标注两版」)· 第 5 条 = 复现 leaderboard.run 命令 harbor run -d long-horizon-terminal-bench(底部 30 字小字「B1 · S2 项目页 + S3 leaderboard URL verbatim 命中 5 处」);屏幕文字每条 ≤18 字。