Long-Horizon-Terminal-Bench:测出 Agent 长时序执行极限 · 干货攻略

  • 链接: https://x.com/_akhaliq/status/2076742842769158545
  • 分类: x-tips
  • 来源: X @_akhaliq
  • 作者: Jay
  • 更新: 2026-07-30

这是什么

Long-Horizon-Terminal-Bench(LHTB)是一个评测 Agent 在长时序终端任务上持续工作能力的基准测试,2026 年 7 月由来自腾讯(Tencent HY LLM Frontier)、Lehigh University、University of Maryland、University of Georgia、University of Minnesota、NUS、HK PolyU 等机构的 Zongxia Li 等人联合发布,论文收录于 arXiv #2607.08964

其核心设计哲学是:大多数 Agent 评测关注"能不能开始做事",LHTB 关注"能不能持续把事做完"。

与主流评测的本质区别:

传统终端评测(如 Terminal-Bench 2) LHTB
任务时长 几分钟~30 分钟 平均 85 分钟
评测方式 最终结果 pass/fail 连续部分信用(0→1)
Agent 步数 20~30 步 平均 231 步
Token 消耗 较低 平均 9.9M tokens / 任务
自报进度 计入 不计入——仅验证 replay

每任务运行一次需要 53~71 小时(模型不同有差异),评测套件完整跑完成本极高。


为什么值得关注

核心问题: 当前最强 Agent 在需要"数百步连续依赖操作"的任务上表现究竟如何?

典型长时序任务举例: - 从零构建一个系统、安装依赖、修复兼容性问题 - 复现一篇论文的实验(给定 paper,不给代码) - 完整调试一个编译器 toolchain - 多阶段 ML 训练 pipeline 的完整运行与调参 - 玩一局需要数百步的交互式游戏

这些场景中,Agent 不是不能开始,而是无法维持连贯状态、会在中途失去目标、提前宣布完成、或烧完预算只剩一半

LHTB 用三个设计轴直击这个痛点: 1. Long horizon:每个任务平均消耗 9.9M tokens 和 231 步——没有任何捷径可走 2. Resistance:隐藏验证器(hidden verifier)、确定性种子、重放式评分,让 memorization 和 reward hacking 零收益 3. Graded reward:连续部分信用,哪怕任务没完全解决,也能知道 Agent 走了多远


核验过程

官方来源(已全部读取)

  1. GitHub README (zli12321/LHTB):包含完整的任务列表、目录结构、评测命令、依赖说明、排行榜快照(July 2026)。数据点:46 任务、9 分类、Leaderboard top3 数字(见下)。
  2. arXiv 论文 (arXiv:2607.08964, July 2026):Abstract + Introduction,详细描述了评测设置、模型列表、指标定义(pass@1 @ 0.95 reward threshold)、部分关键数字(GPT-5.5 达 15.2% pass@1 @ 0.95 threshold;全模型均值 4.3%)。
  3. 项目主页 (zli12321.github.io/LHTB):Visual report,包含 benchmark 设计哲学、任务分类可视化、unison-paper-reproduction 案例拆解、全模型结果雷达图。
  4. BenchGen 摘要benchgen.com 汇总页交叉验证了排行榜数字(2026-07 数据),与 GitHub README 一致。

关键数字交叉验证

指标 GitHub README(July 2026 快照) arXiv 论文 一致性
任务数量 46 46
分类数量 9 9
平均 Token/任务 未直接写 9.9M ✅(Blog 页确认)
平均执行时间 未直接写 85.3 分钟 ✅(Blog 页确认)
平均 Episodes 未直接写 ~231 ✅(Blog 页确认)
Best model Grok 4.5 (0.505 mean reward) GPT-5.5 (15.2% pass@1 @ 0.95) ⚠️ 评测配置不同,见文末说明
任务未解决数 29/46 ✅(Blog 确认)
成本效率 MiniMax M3 $6.13/task ✅(Blog 确认)

⚠️ 不一致说明:GitHub README 排行榜和 arXiv 论文中 Best model 排名存在差异(README 中 Grok 4.5 排第一,论文中 GPT-5.5 pass@1 最高)。原因推测:README 为更新后的 live leaderboard(包含更多模型如 Claude Fable 5 等 18 个),论文为初始提交版本(15 个模型);两者评测时使用的模型版本和配置也可能不同。攻略以 README live leaderboard 为准(更近期的 July 2026 快照),同时在排行榜部分注明论文数字。


上手步骤

环境准备

# 克隆仓库(LFS 文件较大)
git lfs install
git clone https://github.com/zli12321/LHTB.git
cd LHTB
git lfs pull

# macOS ARM 用户需指定平台
export DOCKER_DEFAULT_PLATFORM=linux/amd64

安装评测 Harness

Harness 有两个版本,强烈建议使用 LHTB 打包的修改版

# 选项 A:LHTB 修改版 Harbor(支持 continue-until-timeout,推荐)
pip install -e ./harbor

# 选项 B:上游原版 Harbor(不支持 continue-until-timeout,30 个任务会以单次方式运行,分数偏低)
uv tool install harbor
# 或
pip install harbor

关键差异:continue_until_timeout = true 时,Agent 在 90 分钟预算内持续工作、每次 declare 完成后自动继续,直到超时才停止;原版 Harbor 会在 Agent 首次 declare 完成时就停止,分数明显偏低。

验证安装(跑 3 个 Oracle 任务)

harbor run -c configs/examples/oracle_smoke.yaml

运行评测

# 填入你的 API Key(不在 YAML 文件中,明智)
export OPENAI_API_KEY=sk-...

# 单任务试跑(OpenAI 兼容接口)
harbor run -c configs/examples/terminus2_openai.yaml

# 通过 OpenRouter
export OPENROUTER_API_KEY=sk-or-v1-...
harbor run -c configs/examples/terminus2_openrouter.yaml

# 全套 46 任务评测
export OPENAI_API_KEY=sk-...
harbor run -c configs/examples/full_benchmark.yaml

结果输出到 ./jobs/ 目录(已 git-ignored)。

查看任务列表

# 列出所有任务目录
ls tasks/

# 查看具体任务指令
cat tasks/unison-paper-reproduction/instruction.md
cat tasks/commit0-multilib-tdd/instruction.md

配置文件说明

配置文件 用途
oracle_smoke.yaml 3 个 Oracle 任务,验证安装是否正常
terminus2_openai.yaml 通过 OpenAI 兼容 API 跑 Terminus-2 harness
terminus2_openrouter.yaml 同上,通过 OpenRouter
full_benchmark.yaml 完整 46 任务套件

任务分类一览

分类 任务数 示例
Interactive games & puzzles 8 2048, sokoban, chess-mate
Multimodal & imaging analysis 6 scientific-figure-data-reconstruction, dicom-radiology-audit
Software & reverse engineering 7 commit0-multilib-tdd, riscv-core-debug
Scientific computing & simulation 6 nbody-accel-iterative, su2-airfoil-regression
Earth, climate & energy 6 modflow6-groundwater-regression-audit, matpower-opf-regression
Systems, performance & security 5 duckdb-optimizer-closure, poc-exploit-craft
Research reproduction 5 unison-paper-reproduction, foldseek-paper-reproduction
APEX professional workflows 4 apex-investment-banking-matter, apex-law433-matter

排行榜(July 2026 快照,来源:GitHub README)

⚠️ 排行榜为 live leaderboard(GitHub README),数字可能随评测配置差异与论文数字不一致。以下以 README 为准。

排名 模型 厂商 Mean Reward 解决数 (R≥0.95) 均成本/任务
1 Grok 4.5 xAI 0.505 13/46 $11.19
2 Claude Sonnet 5 Anthropic 0.497 8/46 $60.37
3 Claude Opus 4.8 Anthropic 0.492 9/46 $39.11
4 Claude Fable 5 Anthropic 0.487 12/46 $73.11
5 GPT-5.6-sol OpenAI 0.451 7/46 $21.14
6 GPT-5.5 OpenAI 0.445 7/46 $21.46
7 MiniMax M3 MiniMax 0.385 3/46 $6.13

关键发现: - 29/46 任务从未被任何模型解决(R≥0.95),Benchmark 远未饱和 - 价格 ≠ 性能:MiniMax M3($6.13/task,得分 0.385)优于 GPT-5.4($27.57/task,得分 0.272) - Claude Fable 5 均分 0.487 排第四,但以 12/46 解决数列第四高,部分信用比分项比均值更公平 - ~55% 的 model×task 运行落在 0.1–0.2 reward 区间——说明大多数尝试只完成了极少量有效工作

📄 论文补充数字(arXiv v1, 15 个模型):GPT-5.5 pass@1 @ 0.95 reward = 15.2%,完美 reward (1.0) = 10.9%;全模型均值分别 4.3% 和 1.7%。与 README 排行榜数字存在差异,原因见上文核验说明。


坑与适用边界

🔴 部署前必知的坑

  1. Docker 必须是 Linux/amd64:很多 LHTB 镜像是 amd64 only,苹果芯片机器必须 export DOCKER_DEFAULT_PLATFORM=linux/amd64,否则构建失败。
  2. 用修改版 Harbor:直接 pip install harbor 装的是上游原版,30 个长时序任务会以单次方式评测,分数比 LHTB 官方数字低很多。务必用 pip install -e ./harbor
  3. 全量评测成本极高:单模型跑完 46 任务需 53~71 小时(按任务超时 90 分钟上限),完整评测 18 个模型需要 ~1000+ 小时。不要轻易跑 full_benchmark.yaml,除非你有耐心或足够的 API 额度。
  4. API Key 不要进 YAML:示例配置故意不包含 key,所有 key 通过环境变量传入,防止泄露。
  5. LFS 大文件:APEX world zip 和视频文件超过 100MB,需要先 git lfs pull,否则任务环境不完整。

🟡 适用边界

  • 适合:评测 Coding Agent、DevOps Agent、科研 Agent 的长时序能力边界;对比模型在持续性任务上的实际差异;发现 Agent 的"中途放弃"行为模式。
  • 不适合:快速原型验证(跑一次要几天);非 terminal 环境(如纯 API 调用)评测;对比短任务效率。
  • 重要提醒:排行榜反映的是在 Terminus-2 harness + 相同 prompt 下的结果,换 harness 或 prompt 可能完全改变排名——Benchmark 的公平性仅在相同评测框架下成立。

一句话结论

LHTB 揭示了一个被长期忽视的 Agent 能力盲区:持续数百步不失去目标。即使最强模型也只解决了约 28% 的任务(严格标准),且部分信用评分揭示价格与性能几乎无关——这意味着长时序执行才是当前 Agent 真正的瓶颈所在。