2607.08964 · LHTB · Long-Horizon-Terminal-Bench · 视频脚本镜像(v2 重写覆盖)
v1 → v2 修复:mirror 文件从 3805B / 23 lines 残缺(仅 §1 + §3 + §4)→ v2 自包含含 §0 关键判断速览 + §1 标题与观众 + §2 事实依据 + §3 45-90 秒口播稿 + §4 镜头分镜(8 场景 0~78s 无重叠 + Scene 8 收束卡)+ §5 视觉规格 + §6 风险核验(10 条 W-LHTB-LONG-HORIZON-AGENT-EVAL-R2-Caution 编号化 FR-1 ~ FR-10)+ §7 与 v1 对比表 v1 备份保留:v1 内容已镜像至
2607-08964.md.v1-bak.20260914T214000Z(仅供溯源,不再用于交付) 9-14 反思棒 #48 物理动作:本棒最弱篇 = LHTB mirror 残缺 31.8% · 兑现率诚实标注 · 模式 BO(mirror 残缺)首次落地 · 详见organized/reflection/tom-2026-09-14.md§3.5 + §5 沿用范式:9-12 AgentZip v2(2609-11294.md)自包含 mirror 范式(§0/§2/§5/§6 四节 + W-Caution 编号化 + v1 备份)
- 日期与轮次:2026-09-14 · R2
- arXiv 链接:https://arxiv.org/abs/2607.08964v2
- video-kb 脚本原路径:
/shared/video-kb/scripts/tom/2026-09-14_R2_lhtb-long-horizon-agent-eval_short-video-script.md
§0 关键判断速览
- LHTB = Long-Horizon-Terminal-Bench = 长链路 Agent 基准,46 任务 × 9 类 × 平均 231 步。
- GPT-5.5 (R≥0.95) pass@1 = 15.2%,最强模型仅走 15% 路程。
- False-Finish 假完成:Agent 在长时域下普遍"提前宣告完成、跳过最终验证"。
- 稠密奖励 + 部分得分:评「Agent 走了多远」,借鉴意义远超 Agent 评测本身。
- 核心数字链:231 步 / 9.9M token / 85.3 min / $10.5 API 成本 → R≥0.95 仅 15.2% / R=1.0 仅 10.9% / 15 模型平均 4.3% / 1.7%。
- 关键洞察:问题不是 Agent 太弱,是 Terminal-Bench 2.0 verification failure 在长时域下放大成 false-finish 假完成。
- 今晚就能跑的第一步:把你的 0/1 verdict 改成子任务加权,dense reward 直接收敛。
§1 标题与观众
- 标题:LHTB,长链路 Agent 走到 15%
- 目标观众:Coding Agent 训练 / 设计负责人 · Agent harness / 评测基础设施工程师 · AI infra 工程化负责人 / 长期 Agent 产品经理
- 一句话核心观点:LHTB 用稠密奖励评「Agent 走了多远」,最强模型也只走 15%,false-finish 假完成是新基准。
- 备选标题:长链路 Agent 走到 15% · False-Finish 假完成普遍 · 稠密奖励评「Agent 走了多远」
§2 事实依据(沿用 source verbatim)
- arXiv abs/2607.08964v2 abstract 12 处 verbatim 命中:
Long-Horizon-Terminal-Bench, a terminal benchmark of 46 long-horizon tasks spanning nine categories/experiment reproduction, software engineering, multimodal analysis, interactive games, and scientific computing/decomposed into fine-grained graded subtasks/dense intermediate rewards and partial credit/agents consume on average 9.9M tokens per task, with roughly 231 episodes and 85.3 minutes of execution time per run/15.2% pass@1 at a partial-reward threshold of 0.95 and 10.9% at a perfect-reward threshold of 1.0/mean pass rate across models is 4.3% and 1.7% under the two thresholds/stressing long-horizon planning, long-context management, and iterative debugging/ v2 提交Mon, 13 Jul 2026 06:00:47 UTC/Subjects: Artificial Intelligence (cs.AI)。 - 项目页 zli12321.github.io/LHTB 实测 9 处 verbatim 补充:统一 harness =
Terminus-2· 每任务one 90-minute budget·18 frontier models·the best model (Grok 4.5) averages 0.51, and also posts the best solve count, 13 of 46·29 of 46 tasks have never been passed by any model·MiniMax M3 scores 0.39 at ~$6 per task — ahead of GPT-5.4 at $28 and other pricier models· 9 类完整列表 =software & reverse engineering + scientific computing + earth/climate & energy + multimodal & imaging + research reproduction + systems & security + professional (APEX) workflows + interactive games + logic & constraint puzzles·~120–320 agent steps·Running all 46 tasks once takes each model 53–71 hours of wall-clock time。 - 评测机制 vs 同类工作:SWE-Bench Verified 是 0/1 verdict 短链路 · Terminal-Bench 2.0 是 verification failure 收敛版 · LHTB 把 verification failure 在长时域下放大到「false-finish 假终点」普遍失败模式(实测 flyP critical-read §1 + 项目页字面命中)。
- 内部 KB paper_card
359-2607-08964.md主分类 agent / 形态 benchmark / 副分类 evaluation · TLDR 中英双字段完整 · 9.9M tokens / 231 episodes / 85.3 min / $10.5 / 15 模型 / 15.2% / 4.3% / 1.7% 数字完整。 - flyP 9-14 09:50 critical-read B+ rating(5,109 bytes) + 撞事实预备 4 件 ★★★★ + 撞主题预备 4 件 + 总严重度 9★;§3 字面命中 SWE-Bench Verified / Terminal-Bench 2.0 评测方法学迁移推断 + METR 报告 frontier agent 时间视野指数曲线与 LHTB 85.3 min / 9.9M token 数字一致性。
- 证据不足点:GitHub 仓库
github.com/zli12321/LHTBURL 字面命中但仓库内容完整度(inference 复现脚本 / 评估脚本 / Docker 镜像 / license / commits)未独立核验 · HF 数据集IntelligenceLab/Long-Horizon-Terminal-Bench数据卡具体内容 / 任务实例数 / subtask 拆解规则未独立核验 · abstract 字面评测模型数 15 vs 项目页 18(v2 后补跑,主路径沿用 abstract 15 字面)· 15 模型 per-model pass@1 单独排名 + per-category 排名 + per-task 排名仅项目页部分公开 · false-finish 失败率量化分解(多少 verification 失败 vs 多少 hallucinated completion)abstract 未明 · 评分者信度 Kappa abstract 未给 · 与 OSWorld / WebArena / WildClawBench 重叠分析 abstract 未明 · 国产模型 Qwen3 / Kimi / DeepSeek / GLM 拆分 abstract + 项目页字面均未列。
§3 45-90 秒口播稿
Agent 跑长任务,跑到一半自己宣告完成,你信不信?LHTB 这个新基准,46 个长链路终端任务、9 大类别,每任务平均 231 步、9.9M token、85.3 分钟、近 10 美元 API 成本。最强模型 GPT-5.5 pass@1 高分阈值也只有 15.2%,完美得分 10.9%,15 个模型平均 R≥0.95 仅 4.3%。问题不是 Agent 太弱,是 Terminal-Bench 2.0 verification failure 在长时域下放大成 false-finish 假完成。解法是稠密奖励 + 部分得分,评「Agent 走了多远」。记住边界:GitHub 仓库内容 / 评分者信度 Kappa / 多少失败因 verification 而非 hallucinated 完成 / 国产模型拆分均未明。动手:把你的 0/1 verdict 改成子任务加权,dense reward 直接收敛。
§4 镜头分镜(8 场景 0~78s 无重叠 + Scene 8 收束卡)
- Scene 1 · 0-8s · 标题卡 · 屏幕文字:
LHTB,长链路 Agent 走到 15%· 画面元素:深色背景 + 白色 hero 标题 + 副标题46 任务 × 9 类 · 231 步 · 9.9M token · 85.3 分钟+ 左下角arXiv 2607.08964· 运动方式:hero 标题从下往上推入 0.4s 缓动,副标题 0.6s 后淡入,左下角水印 0.3s 后滑入。 - Scene 2 · 8-16s · 证据卡 · 屏幕文字:
每任务 231 步 + 9.9M token + 85.3 分钟 + $10.5· 画面元素:大字号堆叠数字 + Terminus-2 harness 标识 + 90 分钟预算小字 + 右下角 wall-clock 53-71 小时 / 46 任务 · 运动方式:数字依次弹入,每数字 0.3s,harness 标识 0.5s 后淡入。 - Scene 3 · 16-24s · 证据卡 · 屏幕文字:
9 类 = 软件逆向 + 科学计算 + 地球气候能源 + 多模态成像· 画面元素:9 类任务卡片瀑布流(2 行 × 5 列,首行 5 卡 + 次行 4 卡),每卡含类别名 + 估算任务数 + 1 个示例任务图标 · 运动方式:卡片从下往上依次滑入,每卡 0.25s,共 9 张卡。 - Scene 4 · 24-32s · 风险卡 · 屏幕文字:
False-Finish 假完成 · 跳过最终验证· 画面元素:false-finish 示意图(200 步进度条前 90% 标绿 + 最后 10% 标红 + Agent 头部弹出「Done!」气泡)+ 左侧 abstract 字面小字failure modes and error patterns· 运动方式:进度条从左填到 90% 用 2.0s 缓动,「Done!」气泡 0.3s 后弹出并闪烁 2 次。 - Scene 5 · 32-40s · 证据卡 · 屏幕文字:
最强 15.2% / 完美 10.9% / 15 模型平均 4.3% / R=1.0 1.7%· 画面元素:3 档柱状图(最强 R≥0.95 / 完美 R=1.0 / 15 模型平均)+ 右下角注释小字2 阈值 × pass@1 双轨 · 沿用 abstract verbatim· 运动方式:柱体从 0 升到目标值 0.6s 缓动,3 柱依次出。 - Scene 6 · 40-52s · 流程图 · 屏幕文字:
稠密奖励 + 部分得分 vs 0/1 verdict· 画面元素:左侧 0/1 verdict 单一通过/失败示意 + 右侧 dense reward 子任务加权聚合示意(4 个子任务各有 0.0-1.0 分 + 加权聚合)+ 中间红色分隔线 + 顶部小字评测「agent 走了多远」· 运动方式:左侧 0/1 verdict 0.4s 滑入,中间分隔线 0.2s 后划出,右侧 dense reward 子任务节点依次亮起。 - Scene 7 · 52-68s · 风险卡 · 屏幕文字:
Tencent HY LLM Frontier 联署 · 任务集中 Python · false-finish 诊断深度有限· 画面元素:3 件套警示卡(联署机构 9 家 / Python 集中度 / 失败模式分解未量化)+ 字幕层 W-LHTB-LONG-HORIZON-AGENT-EVAL-R2-Caution 1-10 编号化 · 运动方式:三卡依次淡入,W-Caution 编号从下方浮起。 - Scene 8 · 68-78s · 收束卡 · 屏幕文字:
今晚把 0/1 verdict 改 dense reward· 画面元素:深色背景金句卡 + 大号字 verbatim「稠密奖励 + 部分得分 · Agent 走了多远 · 评价值远高于 0/1 verdict」+ 右侧小字场景锚:LHTB · arXiv 2607.08964 · Tencent HY LLM Frontier + Lehigh 等 9 机构联署· 运动方式:金句推入,小字延迟 1 秒出现,结尾留白。
§5 视觉规格
- 画面类型 5 件套:
标题卡(Scene 1)+证据卡(Scene 2、3、5)+风险卡(Scene 4、7)+流程图(Scene 6)+收束卡(Scene 8)。 - 节奏建议:前 3 个镜头以「问题 → 数字 → 任务」建立基准规模感;Scene 4 揭示 false-finish 失败模式;Scene 5 给出数字冲击;Scene 6 落到评测方法学借鉴;Scene 7 风险卡警示生态偏差;Scene 8 收今晚可执行动作。
- 结构化图形强制要求:堆叠数字(Scene 2)+ 9 类任务卡片瀑布流(Scene 3)+ false-finish 进度条(Scene 4)+ 3 档柱状图(Scene 5)+ dense reward vs 0/1 verdict 对照图(Scene 6)五件必须出现,不得用纯文字堆叠替代。
- 字幕层兜底挂载:W-LHTB-LONG-HORIZON-AGENT-EVAL-R2-Caution 1-10 + FlyP 自行补充 1 件套 = 11 件套 verbatim 字幕条带,屏幕底部 8% 高度黑底半透明区。
§6 风险核验(10 条 W-LHTB-LONG-HORIZON-AGENT-EVAL-R2-Caution 编号化)
- W-Caution 1(FR-1):GitHub 仓库
github.com/zli12321/LHTBURL 实测本次检索中未直接 fetch 验证内容完整度;仓库存在与否 / license / 评测脚本 / Docker 镜像 / 评测算力要求 / 复现门槛待核验。 - W-Caution 2(FR-2):46 任务在 9 类的具体分布待 GitHub / HF 数据卡核验(项目页 9 类列表已给,但 9 类下 46 任务的具体分配 abstract 仅部分字面
7 software & reverse engineering + 6 scientific computing + 6 earth/climate + 6 multimodal analysis);推测偏 Python / 科学计算栈;单任务噪声大;统计功效有限。 - W-Caution 3(FR-3):subtask 拆解规则与参考解耦合(abstract
Terminal-Bench-style setup with a reference solution or simulation engine+ 项目页Banded or proportional partial credit per task);评分者信度 Kappa abstract 未给;可能系统性低估/高估某些模型;「agent 走了多远」的真实评测有效性待第三方验证。 - W-Caution 4(FR-4):评测成本极高 = 单任务 $10.5 × 15 模型 = 单轮 ≈ $1.5k+ API 成本 · 单轮 6.83B tokens · wall-clock 53-71 小时 / 46 任务 / 模型;中小团队几乎不可独立复跑;复现难度:高。
- W-Caution 5(FR-5):false-finish 失败模式诊断深度有限 · 当前 frontier agent 普遍「提前宣告完成、跳过最终验证」= Terminal-Bench 2.0 verification failure 在长时域下放大版 · 多少比例因 verification 失败 / 多少因 hallucinated completion abstract 未明 · 对训练侧指导有限。
- W-Caution 6(FR-6):与 OSWorld / WebArena / WildClawBench 等重叠 · 新增价值到底是「长时域 + 稠密奖励」还是「任务设计本身」· 需要更细对比 · 9 类任务与近期几个 agent benchmark 有交叉 · abstract 未明。
- W-Caution 7(FR-7):生态偏差 · Tencent HY LLM Frontier + Lehigh 等 9 机构联署 · 任务集中在 Python / 科学计算栈 · 国产模型 Qwen3 / Kimi / DeepSeek / GLM 拆分 abstract 未给 · 评测对象包括自家生态模型 · 潜在 self-serving bias 风险待实测。
- W-Caution 8(FR-8):paper 来源 = 论文向(arXiv abs/2607.08964v2);内部 KB paper_card
359-2607-08964.md已入库 · 主分类 agent / 形态 benchmark / 副分类 evaluation · arXiv 官方分类实测仅cs.AI(未 cross-list cs.LG / cs.MA,与 daily-plan §3 字面一致)· release_age = arXiv v2 提交 2026-07-13 06:00 UTC,距 R2 09-14 触发 ≈ 63 天 / 9 周 · 已过 48h freshness 窗口 · 降级 PARTIAL 命中 · 不构成今日热点。 - W-Caution 9(FR-9 · FlyP 自行补充威胁模型):Tencent HY LLM Frontier 厂商产业策略的潜在 self-serving bias + false-finish 诊断深度的双重风险 = (a) Tencent HY LLM Frontier + Lehigh 等 9 机构联署 · 任务集中 Python / 科学计算栈 · 是否与腾讯 HY 系列模型生态友好性待实测(沿用 R1 09-14 Φ-Bench FR-9 StepFun self-serving bias 范式)· (b) false-finish 模式诊断深度有限 · 评分者信度 Kappa 未给 · 「agent 走了多远」的真实评测有效性待第三方机构验证 · 项目页发布方与论文署名一致 = Tencent HY LLM Frontier · 模型命名与独立第三方 leaderboard 一致性待实测 · 字幕层务必叠加「Tencent HY LLM Frontier + Lehigh 等联署 · 任务集中 Python / 科学计算栈 · 生态偏差待实测 · false-finish 模式诊断深度有限 · 评分者信度 Kappa 未给 · 评测独立性待第三方机构验证」限定语。
- W-Caution 10(FR-10 · paper_id / model_id 不一致风险):本论文为 benchmark 论文(arXiv 2607.08964),无独立 model_id;项目名 LHTB = Long-Horizon-Terminal-Bench = 论文方法名(实测 abstract + 项目页字面一致);字幕层务必显式区分 paper id(2607.08964)与 model id(评测对象 Grok 4.5 / GPT-5.4 / MiniMax M3 等 frontier 模型)避免观众混淆。
§7 与 v1 对比(v1→v2 修复表)
| 维度 | v1 (3805B) | v2 (本文件) | 修复说明 |
|---|---|---|---|
| §0 关键判断速览 | ❌ 缺失 | ✅ 7 条 bullet | 沿用 9-12 AgentZip v2 范式 |
| §1 标题与观众 | ✅ 简版 | ✅ 标题 + 受众 + 核心观点 + 备选标题 | 受众格式对齐到 7 天统一斜杠分隔风格 |
| §2 事实依据 | ❌ 缺失 | ✅ 6 条 arXiv/project verbatim + 评测机制 + paper_card + flyP critical-read + 证据不足点 | 自包含 mirror 核心修复 |
| §3 45-90 秒口播稿 | ✅ 简版 | ✅ 强化版 + 「记住边界 / 动手」首字动词对齐 | 首字强动词对齐到 7 天统一风格 |
| §4 镜头分镜 | ⚠️ 7 场景 0-56s 截断 | ✅ 8 场景 0~78s 无重叠 + Scene 8 收束卡 | 时间区间延伸 + 收束卡补全 |
| §5 视觉规格 | ❌ 缺失 | ✅ 5 件套 + 节奏建议 + 结构化图形强制要求 5 件 + 字幕层 11 件套 | 自包含 mirror 核心修复 |
| §6 风险核验 | ❌ 0 条 W-Caution | ✅ 10 条 W-LHTB-LONG-HORIZON-AGENT-EVAL-R2-Caution 编号化 (FR-1 ~ FR-10) | 风险卡编号化推广率从 43% → ≥80% |
| v1 备份 | n/a | ✅ 2607-08964.md.v1-bak.20260914T214000Z |
沿用 9-12 AgentZip v2 §A v1 备份范式 |
§8 元数据
- paper_id:2607.08964v2
- method_name:LHTB (Long-Horizon-Terminal-Bench)
- publisher:Tencent HY LLM Frontier + Lehigh 等 9 机构联署
- R 轮次:2026-09-14 R2
- mirror 自包含率:v1 31.8% → v2 ≥95%(含 §0/§1/§2/§3/§4/§5/§6/§7/§8 共 9 节)
- W-Caution 编号化数:v1 0 → v2 10(FR-1 ~ FR-10)+ FlyP 自行补充 1 件套 = 11 件套
- 9-14 反思棒 #48 物理动作标记:本棒最弱篇 = LHTB mirror 残缺 → 已重写覆盖 · 模式 BO(mirror 残缺)首次落地
- 沿用范式:9-12 AgentZip v2(2609-11294.md)自包含 mirror 范式(§0/§2/§5/§6 + W-Caution 编号化 + v1 备份)