Long-Horizon-Terminal-Bench:测出 Agent 长时序执行极限 · 干货攻略
- 链接: https://x.com/_akhaliq/status/2076742842769158545
- 分类: x-tips
- 来源: X @_akhaliq
- 作者: Jay
- 更新: 2026-07-30
这是什么
Long-Horizon-Terminal-Bench(LHTB)是一个评测 Agent 在长时序终端任务上持续工作能力的基准测试,2026 年 7 月由来自腾讯(Tencent HY LLM Frontier)、Lehigh University、University of Maryland、University of Georgia、University of Minnesota、NUS、HK PolyU 等机构的 Zongxia Li 等人联合发布,论文收录于 arXiv #2607.08964。
其核心设计哲学是:大多数 Agent 评测关注"能不能开始做事",LHTB 关注"能不能持续把事做完"。
与主流评测的本质区别:
| 传统终端评测(如 Terminal-Bench 2) | LHTB | |
|---|---|---|
| 任务时长 | 几分钟~30 分钟 | 平均 85 分钟 |
| 评测方式 | 最终结果 pass/fail | 连续部分信用(0→1) |
| Agent 步数 | 20~30 步 | 平均 231 步 |
| Token 消耗 | 较低 | 平均 9.9M tokens / 任务 |
| 自报进度 | 计入 | 不计入——仅验证 replay |
每任务运行一次需要 53~71 小时(模型不同有差异),评测套件完整跑完成本极高。
为什么值得关注
核心问题: 当前最强 Agent 在需要"数百步连续依赖操作"的任务上表现究竟如何?
典型长时序任务举例: - 从零构建一个系统、安装依赖、修复兼容性问题 - 复现一篇论文的实验(给定 paper,不给代码) - 完整调试一个编译器 toolchain - 多阶段 ML 训练 pipeline 的完整运行与调参 - 玩一局需要数百步的交互式游戏
这些场景中,Agent 不是不能开始,而是无法维持连贯状态、会在中途失去目标、提前宣布完成、或烧完预算只剩一半。
LHTB 用三个设计轴直击这个痛点: 1. Long horizon:每个任务平均消耗 9.9M tokens 和 231 步——没有任何捷径可走 2. Resistance:隐藏验证器(hidden verifier)、确定性种子、重放式评分,让 memorization 和 reward hacking 零收益 3. Graded reward:连续部分信用,哪怕任务没完全解决,也能知道 Agent 走了多远
核验过程
官方来源(已全部读取)
- GitHub README (
zli12321/LHTB):包含完整的任务列表、目录结构、评测命令、依赖说明、排行榜快照(July 2026)。数据点:46 任务、9 分类、Leaderboard top3 数字(见下)。 - arXiv 论文 (
arXiv:2607.08964, July 2026):Abstract + Introduction,详细描述了评测设置、模型列表、指标定义(pass@1 @ 0.95 reward threshold)、部分关键数字(GPT-5.5 达 15.2% pass@1 @ 0.95 threshold;全模型均值 4.3%)。 - 项目主页 (
zli12321.github.io/LHTB):Visual report,包含 benchmark 设计哲学、任务分类可视化、unison-paper-reproduction 案例拆解、全模型结果雷达图。 - BenchGen 摘要:
benchgen.com汇总页交叉验证了排行榜数字(2026-07 数据),与 GitHub README 一致。
关键数字交叉验证
| 指标 | GitHub README(July 2026 快照) | arXiv 论文 | 一致性 |
|---|---|---|---|
| 任务数量 | 46 | 46 | ✅ |
| 分类数量 | 9 | 9 | ✅ |
| 平均 Token/任务 | 未直接写 | 9.9M | ✅(Blog 页确认) |
| 平均执行时间 | 未直接写 | 85.3 分钟 | ✅(Blog 页确认) |
| 平均 Episodes | 未直接写 | ~231 | ✅(Blog 页确认) |
| Best model | Grok 4.5 (0.505 mean reward) | GPT-5.5 (15.2% pass@1 @ 0.95) | ⚠️ 评测配置不同,见文末说明 |
| 任务未解决数 | 29/46 | — | ✅(Blog 确认) |
| 成本效率 | MiniMax M3 $6.13/task | — | ✅(Blog 确认) |
⚠️ 不一致说明:GitHub README 排行榜和 arXiv 论文中 Best model 排名存在差异(README 中 Grok 4.5 排第一,论文中 GPT-5.5 pass@1 最高)。原因推测:README 为更新后的 live leaderboard(包含更多模型如 Claude Fable 5 等 18 个),论文为初始提交版本(15 个模型);两者评测时使用的模型版本和配置也可能不同。攻略以 README live leaderboard 为准(更近期的 July 2026 快照),同时在排行榜部分注明论文数字。
上手步骤
环境准备
# 克隆仓库(LFS 文件较大)
git lfs install
git clone https://github.com/zli12321/LHTB.git
cd LHTB
git lfs pull
# macOS ARM 用户需指定平台
export DOCKER_DEFAULT_PLATFORM=linux/amd64
安装评测 Harness
Harness 有两个版本,强烈建议使用 LHTB 打包的修改版:
# 选项 A:LHTB 修改版 Harbor(支持 continue-until-timeout,推荐)
pip install -e ./harbor
# 选项 B:上游原版 Harbor(不支持 continue-until-timeout,30 个任务会以单次方式运行,分数偏低)
uv tool install harbor
# 或
pip install harbor
关键差异:
continue_until_timeout = true时,Agent 在 90 分钟预算内持续工作、每次 declare 完成后自动继续,直到超时才停止;原版 Harbor 会在 Agent 首次 declare 完成时就停止,分数明显偏低。
验证安装(跑 3 个 Oracle 任务)
harbor run -c configs/examples/oracle_smoke.yaml
运行评测
# 填入你的 API Key(不在 YAML 文件中,明智)
export OPENAI_API_KEY=sk-...
# 单任务试跑(OpenAI 兼容接口)
harbor run -c configs/examples/terminus2_openai.yaml
# 通过 OpenRouter
export OPENROUTER_API_KEY=sk-or-v1-...
harbor run -c configs/examples/terminus2_openrouter.yaml
# 全套 46 任务评测
export OPENAI_API_KEY=sk-...
harbor run -c configs/examples/full_benchmark.yaml
结果输出到 ./jobs/ 目录(已 git-ignored)。
查看任务列表
# 列出所有任务目录
ls tasks/
# 查看具体任务指令
cat tasks/unison-paper-reproduction/instruction.md
cat tasks/commit0-multilib-tdd/instruction.md
配置文件说明
| 配置文件 | 用途 |
|---|---|
oracle_smoke.yaml |
3 个 Oracle 任务,验证安装是否正常 |
terminus2_openai.yaml |
通过 OpenAI 兼容 API 跑 Terminus-2 harness |
terminus2_openrouter.yaml |
同上,通过 OpenRouter |
full_benchmark.yaml |
完整 46 任务套件 |
任务分类一览
| 分类 | 任务数 | 示例 |
|---|---|---|
| Interactive games & puzzles | 8 | 2048, sokoban, chess-mate |
| Multimodal & imaging analysis | 6 | scientific-figure-data-reconstruction, dicom-radiology-audit |
| Software & reverse engineering | 7 | commit0-multilib-tdd, riscv-core-debug |
| Scientific computing & simulation | 6 | nbody-accel-iterative, su2-airfoil-regression |
| Earth, climate & energy | 6 | modflow6-groundwater-regression-audit, matpower-opf-regression |
| Systems, performance & security | 5 | duckdb-optimizer-closure, poc-exploit-craft |
| Research reproduction | 5 | unison-paper-reproduction, foldseek-paper-reproduction |
| APEX professional workflows | 4 | apex-investment-banking-matter, apex-law433-matter |
排行榜(July 2026 快照,来源:GitHub README)
⚠️ 排行榜为 live leaderboard(GitHub README),数字可能随评测配置差异与论文数字不一致。以下以 README 为准。
| 排名 | 模型 | 厂商 | Mean Reward | 解决数 (R≥0.95) | 均成本/任务 |
|---|---|---|---|---|---|
| 1 | Grok 4.5 | xAI | 0.505 | 13/46 | $11.19 |
| 2 | Claude Sonnet 5 | Anthropic | 0.497 | 8/46 | $60.37 |
| 3 | Claude Opus 4.8 | Anthropic | 0.492 | 9/46 | $39.11 |
| 4 | Claude Fable 5 | Anthropic | 0.487 | 12/46 | $73.11 |
| 5 | GPT-5.6-sol | OpenAI | 0.451 | 7/46 | $21.14 |
| 6 | GPT-5.5 | OpenAI | 0.445 | 7/46 | $21.46 |
| 7 | MiniMax M3 | MiniMax | 0.385 | 3/46 | $6.13 |
| … | … | … | … | … | … |
关键发现: - 29/46 任务从未被任何模型解决(R≥0.95),Benchmark 远未饱和 - 价格 ≠ 性能:MiniMax M3($6.13/task,得分 0.385)优于 GPT-5.4($27.57/task,得分 0.272) - Claude Fable 5 均分 0.487 排第四,但以 12/46 解决数列第四高,部分信用比分项比均值更公平 - ~55% 的 model×task 运行落在 0.1–0.2 reward 区间——说明大多数尝试只完成了极少量有效工作
📄 论文补充数字(arXiv v1, 15 个模型):GPT-5.5 pass@1 @ 0.95 reward = 15.2%,完美 reward (1.0) = 10.9%;全模型均值分别 4.3% 和 1.7%。与 README 排行榜数字存在差异,原因见上文核验说明。
坑与适用边界
🔴 部署前必知的坑
- Docker 必须是 Linux/amd64:很多 LHTB 镜像是 amd64 only,苹果芯片机器必须
export DOCKER_DEFAULT_PLATFORM=linux/amd64,否则构建失败。 - 用修改版 Harbor:直接
pip install harbor装的是上游原版,30 个长时序任务会以单次方式评测,分数比 LHTB 官方数字低很多。务必用pip install -e ./harbor。 - 全量评测成本极高:单模型跑完 46 任务需 53~71 小时(按任务超时 90 分钟上限),完整评测 18 个模型需要 ~1000+ 小时。不要轻易跑 full_benchmark.yaml,除非你有耐心或足够的 API 额度。
- API Key 不要进 YAML:示例配置故意不包含 key,所有 key 通过环境变量传入,防止泄露。
- LFS 大文件:APEX world zip 和视频文件超过 100MB,需要先
git lfs pull,否则任务环境不完整。
🟡 适用边界
- 适合:评测 Coding Agent、DevOps Agent、科研 Agent 的长时序能力边界;对比模型在持续性任务上的实际差异;发现 Agent 的"中途放弃"行为模式。
- 不适合:快速原型验证(跑一次要几天);非 terminal 环境(如纯 API 调用)评测;对比短任务效率。
- 重要提醒:排行榜反映的是在 Terminus-2 harness + 相同 prompt 下的结果,换 harness 或 prompt 可能完全改变排名——Benchmark 的公平性仅在相同评测框架下成立。
一句话结论
LHTB 揭示了一个被长期忽视的 Agent 能力盲区:持续数百步不失去目标。即使最强模型也只解决了约 28% 的任务(严格标准),且部分信用评分揭示价格与性能几乎无关——这意味着长时序执行才是当前 Agent 真正的瓶颈所在。