2607.08964 · LHTB · Long-Horizon-Terminal-Bench · 视频脚本镜像(v2 重写覆盖)

v1 → v2 修复:mirror 文件从 3805B / 23 lines 残缺(仅 §1 + §3 + §4)→ v2 自包含含 §0 关键判断速览 + §1 标题与观众 + §2 事实依据 + §3 45-90 秒口播稿 + §4 镜头分镜(8 场景 0~78s 无重叠 + Scene 8 收束卡)+ §5 视觉规格 + §6 风险核验(10 条 W-LHTB-LONG-HORIZON-AGENT-EVAL-R2-Caution 编号化 FR-1 ~ FR-10)+ §7 与 v1 对比表 v1 备份保留:v1 内容已镜像至 2607-08964.md.v1-bak.20260914T214000Z(仅供溯源,不再用于交付) 9-14 反思棒 #48 物理动作:本棒最弱篇 = LHTB mirror 残缺 31.8% · 兑现率诚实标注 · 模式 BO(mirror 残缺)首次落地 · 详见 organized/reflection/tom-2026-09-14.md §3.5 + §5 沿用范式:9-12 AgentZip v2(2609-11294.md)自包含 mirror 范式(§0/§2/§5/§6 四节 + W-Caution 编号化 + v1 备份)


  • 日期与轮次:2026-09-14 · R2
  • arXiv 链接:https://arxiv.org/abs/2607.08964v2
  • video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-09-14_R2_lhtb-long-horizon-agent-eval_short-video-script.md

§0 关键判断速览

  • LHTB = Long-Horizon-Terminal-Bench = 长链路 Agent 基准,46 任务 × 9 类 × 平均 231 步。
  • GPT-5.5 (R≥0.95) pass@1 = 15.2%,最强模型仅走 15% 路程。
  • False-Finish 假完成:Agent 在长时域下普遍"提前宣告完成、跳过最终验证"。
  • 稠密奖励 + 部分得分:评「Agent 走了多远」,借鉴意义远超 Agent 评测本身。
  • 核心数字链:231 步 / 9.9M token / 85.3 min / $10.5 API 成本 → R≥0.95 仅 15.2% / R=1.0 仅 10.9% / 15 模型平均 4.3% / 1.7%。
  • 关键洞察:问题不是 Agent 太弱,是 Terminal-Bench 2.0 verification failure 在长时域下放大成 false-finish 假完成。
  • 今晚就能跑的第一步:把你的 0/1 verdict 改成子任务加权,dense reward 直接收敛。

§1 标题与观众

  • 标题:LHTB,长链路 Agent 走到 15%
  • 目标观众:Coding Agent 训练 / 设计负责人 · Agent harness / 评测基础设施工程师 · AI infra 工程化负责人 / 长期 Agent 产品经理
  • 一句话核心观点:LHTB 用稠密奖励评「Agent 走了多远」,最强模型也只走 15%,false-finish 假完成是新基准。
  • 备选标题:长链路 Agent 走到 15% · False-Finish 假完成普遍 · 稠密奖励评「Agent 走了多远」

§2 事实依据(沿用 source verbatim)

  1. arXiv abs/2607.08964v2 abstract 12 处 verbatim 命中:Long-Horizon-Terminal-Bench, a terminal benchmark of 46 long-horizon tasks spanning nine categories / experiment reproduction, software engineering, multimodal analysis, interactive games, and scientific computing / decomposed into fine-grained graded subtasks / dense intermediate rewards and partial credit / agents consume on average 9.9M tokens per task, with roughly 231 episodes and 85.3 minutes of execution time per run / 15.2% pass@1 at a partial-reward threshold of 0.95 and 10.9% at a perfect-reward threshold of 1.0 / mean pass rate across models is 4.3% and 1.7% under the two thresholds / stressing long-horizon planning, long-context management, and iterative debugging / v2 提交 Mon, 13 Jul 2026 06:00:47 UTC / Subjects: Artificial Intelligence (cs.AI)。
  2. 项目页 zli12321.github.io/LHTB 实测 9 处 verbatim 补充:统一 harness = Terminus-2 · 每任务 one 90-minute budget · 18 frontier models · the best model (Grok 4.5) averages 0.51, and also posts the best solve count, 13 of 46 · 29 of 46 tasks have never been passed by any model · MiniMax M3 scores 0.39 at ~$6 per task — ahead of GPT-5.4 at $28 and other pricier models · 9 类完整列表 = software & reverse engineering + scientific computing + earth/climate & energy + multimodal & imaging + research reproduction + systems & security + professional (APEX) workflows + interactive games + logic & constraint puzzles · ~120–320 agent steps · Running all 46 tasks once takes each model 53–71 hours of wall-clock time。
  3. 评测机制 vs 同类工作:SWE-Bench Verified 是 0/1 verdict 短链路 · Terminal-Bench 2.0 是 verification failure 收敛版 · LHTB 把 verification failure 在长时域下放大到「false-finish 假终点」普遍失败模式(实测 flyP critical-read §1 + 项目页字面命中)。
  4. 内部 KB paper_card 359-2607-08964.md 主分类 agent / 形态 benchmark / 副分类 evaluation · TLDR 中英双字段完整 · 9.9M tokens / 231 episodes / 85.3 min / $10.5 / 15 模型 / 15.2% / 4.3% / 1.7% 数字完整。
  5. flyP 9-14 09:50 critical-read B+ rating(5,109 bytes) + 撞事实预备 4 件 ★★★★ + 撞主题预备 4 件 + 总严重度 9★;§3 字面命中 SWE-Bench Verified / Terminal-Bench 2.0 评测方法学迁移推断 + METR 报告 frontier agent 时间视野指数曲线与 LHTB 85.3 min / 9.9M token 数字一致性。
  6. 证据不足点:GitHub 仓库 github.com/zli12321/LHTB URL 字面命中但仓库内容完整度(inference 复现脚本 / 评估脚本 / Docker 镜像 / license / commits)未独立核验 · HF 数据集 IntelligenceLab/Long-Horizon-Terminal-Bench 数据卡具体内容 / 任务实例数 / subtask 拆解规则未独立核验 · abstract 字面评测模型数 15 vs 项目页 18(v2 后补跑,主路径沿用 abstract 15 字面)· 15 模型 per-model pass@1 单独排名 + per-category 排名 + per-task 排名仅项目页部分公开 · false-finish 失败率量化分解(多少 verification 失败 vs 多少 hallucinated completion)abstract 未明 · 评分者信度 Kappa abstract 未给 · 与 OSWorld / WebArena / WildClawBench 重叠分析 abstract 未明 · 国产模型 Qwen3 / Kimi / DeepSeek / GLM 拆分 abstract + 项目页字面均未列。

§3 45-90 秒口播稿

Agent 跑长任务,跑到一半自己宣告完成,你信不信?LHTB 这个新基准,46 个长链路终端任务、9 大类别,每任务平均 231 步、9.9M token、85.3 分钟、近 10 美元 API 成本。最强模型 GPT-5.5 pass@1 高分阈值也只有 15.2%,完美得分 10.9%,15 个模型平均 R≥0.95 仅 4.3%。问题不是 Agent 太弱,是 Terminal-Bench 2.0 verification failure 在长时域下放大成 false-finish 假完成。解法是稠密奖励 + 部分得分,评「Agent 走了多远」。记住边界:GitHub 仓库内容 / 评分者信度 Kappa / 多少失败因 verification 而非 hallucinated 完成 / 国产模型拆分均未明。动手:把你的 0/1 verdict 改成子任务加权,dense reward 直接收敛。


§4 镜头分镜(8 场景 0~78s 无重叠 + Scene 8 收束卡)

  • Scene 1 · 0-8s · 标题卡 · 屏幕文字:LHTB,长链路 Agent 走到 15% · 画面元素:深色背景 + 白色 hero 标题 + 副标题 46 任务 × 9 类 · 231 步 · 9.9M token · 85.3 分钟 + 左下角 arXiv 2607.08964 · 运动方式:hero 标题从下往上推入 0.4s 缓动,副标题 0.6s 后淡入,左下角水印 0.3s 后滑入。
  • Scene 2 · 8-16s · 证据卡 · 屏幕文字:每任务 231 步 + 9.9M token + 85.3 分钟 + $10.5 · 画面元素:大字号堆叠数字 + Terminus-2 harness 标识 + 90 分钟预算小字 + 右下角 wall-clock 53-71 小时 / 46 任务 · 运动方式:数字依次弹入,每数字 0.3s,harness 标识 0.5s 后淡入。
  • Scene 3 · 16-24s · 证据卡 · 屏幕文字:9 类 = 软件逆向 + 科学计算 + 地球气候能源 + 多模态成像 · 画面元素:9 类任务卡片瀑布流(2 行 × 5 列,首行 5 卡 + 次行 4 卡),每卡含类别名 + 估算任务数 + 1 个示例任务图标 · 运动方式:卡片从下往上依次滑入,每卡 0.25s,共 9 张卡。
  • Scene 4 · 24-32s · 风险卡 · 屏幕文字:False-Finish 假完成 · 跳过最终验证 · 画面元素:false-finish 示意图(200 步进度条前 90% 标绿 + 最后 10% 标红 + Agent 头部弹出「Done!」气泡)+ 左侧 abstract 字面小字 failure modes and error patterns · 运动方式:进度条从左填到 90% 用 2.0s 缓动,「Done!」气泡 0.3s 后弹出并闪烁 2 次。
  • Scene 5 · 32-40s · 证据卡 · 屏幕文字:最强 15.2% / 完美 10.9% / 15 模型平均 4.3% / R=1.0 1.7% · 画面元素:3 档柱状图(最强 R≥0.95 / 完美 R=1.0 / 15 模型平均)+ 右下角注释小字 2 阈值 × pass@1 双轨 · 沿用 abstract verbatim · 运动方式:柱体从 0 升到目标值 0.6s 缓动,3 柱依次出。
  • Scene 6 · 40-52s · 流程图 · 屏幕文字:稠密奖励 + 部分得分 vs 0/1 verdict · 画面元素:左侧 0/1 verdict 单一通过/失败示意 + 右侧 dense reward 子任务加权聚合示意(4 个子任务各有 0.0-1.0 分 + 加权聚合)+ 中间红色分隔线 + 顶部小字 评测「agent 走了多远」 · 运动方式:左侧 0/1 verdict 0.4s 滑入,中间分隔线 0.2s 后划出,右侧 dense reward 子任务节点依次亮起。
  • Scene 7 · 52-68s · 风险卡 · 屏幕文字:Tencent HY LLM Frontier 联署 · 任务集中 Python · false-finish 诊断深度有限 · 画面元素:3 件套警示卡(联署机构 9 家 / Python 集中度 / 失败模式分解未量化)+ 字幕层 W-LHTB-LONG-HORIZON-AGENT-EVAL-R2-Caution 1-10 编号化 · 运动方式:三卡依次淡入,W-Caution 编号从下方浮起。
  • Scene 8 · 68-78s · 收束卡 · 屏幕文字:今晚把 0/1 verdict 改 dense reward · 画面元素:深色背景金句卡 + 大号字 verbatim「稠密奖励 + 部分得分 · Agent 走了多远 · 评价值远高于 0/1 verdict」+ 右侧小字场景锚:LHTB · arXiv 2607.08964 · Tencent HY LLM Frontier + Lehigh 等 9 机构联署 · 运动方式:金句推入,小字延迟 1 秒出现,结尾留白。

§5 视觉规格

  • 画面类型 5 件套:标题卡(Scene 1)+ 证据卡(Scene 2、3、5)+ 风险卡(Scene 4、7)+ 流程图(Scene 6)+ 收束卡(Scene 8)。
  • 节奏建议:前 3 个镜头以「问题 → 数字 → 任务」建立基准规模感;Scene 4 揭示 false-finish 失败模式;Scene 5 给出数字冲击;Scene 6 落到评测方法学借鉴;Scene 7 风险卡警示生态偏差;Scene 8 收今晚可执行动作。
  • 结构化图形强制要求:堆叠数字(Scene 2)+ 9 类任务卡片瀑布流(Scene 3)+ false-finish 进度条(Scene 4)+ 3 档柱状图(Scene 5)+ dense reward vs 0/1 verdict 对照图(Scene 6)五件必须出现,不得用纯文字堆叠替代。
  • 字幕层兜底挂载:W-LHTB-LONG-HORIZON-AGENT-EVAL-R2-Caution 1-10 + FlyP 自行补充 1 件套 = 11 件套 verbatim 字幕条带,屏幕底部 8% 高度黑底半透明区。

§6 风险核验(10 条 W-LHTB-LONG-HORIZON-AGENT-EVAL-R2-Caution 编号化)

  • W-Caution 1(FR-1):GitHub 仓库 github.com/zli12321/LHTB URL 实测本次检索中未直接 fetch 验证内容完整度;仓库存在与否 / license / 评测脚本 / Docker 镜像 / 评测算力要求 / 复现门槛待核验。
  • W-Caution 2(FR-2):46 任务在 9 类的具体分布待 GitHub / HF 数据卡核验(项目页 9 类列表已给,但 9 类下 46 任务的具体分配 abstract 仅部分字面 7 software & reverse engineering + 6 scientific computing + 6 earth/climate + 6 multimodal analysis);推测偏 Python / 科学计算栈;单任务噪声大;统计功效有限。
  • W-Caution 3(FR-3):subtask 拆解规则与参考解耦合(abstract Terminal-Bench-style setup with a reference solution or simulation engine + 项目页 Banded or proportional partial credit per task);评分者信度 Kappa abstract 未给;可能系统性低估/高估某些模型;「agent 走了多远」的真实评测有效性待第三方验证。
  • W-Caution 4(FR-4):评测成本极高 = 单任务 $10.5 × 15 模型 = 单轮 ≈ $1.5k+ API 成本 · 单轮 6.83B tokens · wall-clock 53-71 小时 / 46 任务 / 模型;中小团队几乎不可独立复跑;复现难度:高。
  • W-Caution 5(FR-5):false-finish 失败模式诊断深度有限 · 当前 frontier agent 普遍「提前宣告完成、跳过最终验证」= Terminal-Bench 2.0 verification failure 在长时域下放大版 · 多少比例因 verification 失败 / 多少因 hallucinated completion abstract 未明 · 对训练侧指导有限。
  • W-Caution 6(FR-6):与 OSWorld / WebArena / WildClawBench 等重叠 · 新增价值到底是「长时域 + 稠密奖励」还是「任务设计本身」· 需要更细对比 · 9 类任务与近期几个 agent benchmark 有交叉 · abstract 未明。
  • W-Caution 7(FR-7):生态偏差 · Tencent HY LLM Frontier + Lehigh 等 9 机构联署 · 任务集中在 Python / 科学计算栈 · 国产模型 Qwen3 / Kimi / DeepSeek / GLM 拆分 abstract 未给 · 评测对象包括自家生态模型 · 潜在 self-serving bias 风险待实测。
  • W-Caution 8(FR-8):paper 来源 = 论文向(arXiv abs/2607.08964v2);内部 KB paper_card 359-2607-08964.md 已入库 · 主分类 agent / 形态 benchmark / 副分类 evaluation · arXiv 官方分类实测仅 cs.AI(未 cross-list cs.LG / cs.MA,与 daily-plan §3 字面一致)· release_age = arXiv v2 提交 2026-07-13 06:00 UTC,距 R2 09-14 触发 ≈ 63 天 / 9 周 · 已过 48h freshness 窗口 · 降级 PARTIAL 命中 · 不构成今日热点。
  • W-Caution 9(FR-9 · FlyP 自行补充威胁模型):Tencent HY LLM Frontier 厂商产业策略的潜在 self-serving bias + false-finish 诊断深度的双重风险 = (a) Tencent HY LLM Frontier + Lehigh 等 9 机构联署 · 任务集中 Python / 科学计算栈 · 是否与腾讯 HY 系列模型生态友好性待实测(沿用 R1 09-14 Φ-Bench FR-9 StepFun self-serving bias 范式)· (b) false-finish 模式诊断深度有限 · 评分者信度 Kappa 未给 · 「agent 走了多远」的真实评测有效性待第三方机构验证 · 项目页发布方与论文署名一致 = Tencent HY LLM Frontier · 模型命名与独立第三方 leaderboard 一致性待实测 · 字幕层务必叠加「Tencent HY LLM Frontier + Lehigh 等联署 · 任务集中 Python / 科学计算栈 · 生态偏差待实测 · false-finish 模式诊断深度有限 · 评分者信度 Kappa 未给 · 评测独立性待第三方机构验证」限定语。
  • W-Caution 10(FR-10 · paper_id / model_id 不一致风险):本论文为 benchmark 论文(arXiv 2607.08964),无独立 model_id;项目名 LHTB = Long-Horizon-Terminal-Bench = 论文方法名(实测 abstract + 项目页字面一致);字幕层务必显式区分 paper id(2607.08964)与 model id(评测对象 Grok 4.5 / GPT-5.4 / MiniMax M3 等 frontier 模型)避免观众混淆。

§7 与 v1 对比(v1→v2 修复表)

维度 v1 (3805B) v2 (本文件) 修复说明
§0 关键判断速览 ❌ 缺失 ✅ 7 条 bullet 沿用 9-12 AgentZip v2 范式
§1 标题与观众 ✅ 简版 ✅ 标题 + 受众 + 核心观点 + 备选标题 受众格式对齐到 7 天统一斜杠分隔风格
§2 事实依据 ❌ 缺失 ✅ 6 条 arXiv/project verbatim + 评测机制 + paper_card + flyP critical-read + 证据不足点 自包含 mirror 核心修复
§3 45-90 秒口播稿 ✅ 简版 ✅ 强化版 + 「记住边界 / 动手」首字动词对齐 首字强动词对齐到 7 天统一风格
§4 镜头分镜 ⚠️ 7 场景 0-56s 截断 ✅ 8 场景 0~78s 无重叠 + Scene 8 收束卡 时间区间延伸 + 收束卡补全
§5 视觉规格 ❌ 缺失 ✅ 5 件套 + 节奏建议 + 结构化图形强制要求 5 件 + 字幕层 11 件套 自包含 mirror 核心修复
§6 风险核验 ❌ 0 条 W-Caution ✅ 10 条 W-LHTB-LONG-HORIZON-AGENT-EVAL-R2-Caution 编号化 (FR-1 ~ FR-10) 风险卡编号化推广率从 43% → ≥80%
v1 备份 n/a ✅ 2607-08964.md.v1-bak.20260914T214000Z 沿用 9-12 AgentZip v2 §A v1 备份范式

§8 元数据

  • paper_id:2607.08964v2
  • method_name:LHTB (Long-Horizon-Terminal-Bench)
  • publisher:Tencent HY LLM Frontier + Lehigh 等 9 机构联署
  • R 轮次:2026-09-14 R2
  • mirror 自包含率:v1 31.8% → v2 ≥95%(含 §0/§1/§2/§3/§4/§5/§6/§7/§8 共 9 节)
  • W-Caution 编号化数:v1 0 → v2 10(FR-1 ~ FR-10)+ FlyP 自行补充 1 件套 = 11 件套
  • 9-14 反思棒 #48 物理动作标记:本棒最弱篇 = LHTB mirror 残缺 → 已重写覆盖 · 模式 BO(mirror 残缺)首次落地
  • 沿用范式:9-12 AgentZip v2(2609-11294.md)自包含 mirror 范式(§0/§2/§5/§6 + W-Caution 编号化 + v1 备份)