让 AI Agent 跑 85 分钟、烧掉 1000 万 token,最强模型也只能拿 15 分——长程 Agent 的天花板被测出来了

  • 关联论文:2607.08964

如果有人告诉你:

"我的 AI Agent 可以连续工作 1.5 小时、调用几百次工具、消耗近 1000 万 token——而且,最后还能把任务做完。"

你大概率会想:这不就是"AI 打工"该有的样子吗?

但 2026 年 7 月新出的 Long-Horizon-Terminal-Bench 告诉你一个反直觉的真相:

当前最强 AI 模型,在"长工时 + 长上下文 + 多步迭代"的真实场景下:0.95 阈值一次通过率只有 15.2%;要求"零错完成"直接掉到 10.9%;全模型平均,连 5% 都不到。

AI 离"接管你一天的活"还差一个数量级。这套基准,就是那张让你看清这个差距的"体检报告"。


一句话先抛:为什么这件事重要

过去几年 Agent 评测大多是 5–30 分钟的小任务:修一个 bug、查一条 Wikipedia、解一道 LeetCode。

真实工作流长什么样?

  • 修一个 bug + 跑通整套 CI;
  • 按论文复现一个实验;
  • 基于多模态数据做多步分析。

这些任务动辄几十分钟到几小时、几百步迭代、几十万行上下文。传统 benchmark 完全测不出来。

Long-Horizon-Terminal-Bench(以下简称 LH-Terminal-Bench)就是为了回答一个问题:

当前最强 AI Agent,在"长工时真实工作流"上,到底能打几分?

答案:头部 15 分 / 平均 4 分(百分制)。


它的三大反常识设计

反常识 1:评分不是"对 / 错"二元,而是"半路卡在哪都能给分"

传统终端 benchmark 只看最后"任务完没完成"——一个 Agent 跑了 80% 中间步骤、最后一步漏掉一个 flag,和一个 Agent 第一步就走错方向,拿到的分数都是 0

LH-Terminal-Bench 不一样:每条任务被拆成几十个可机评的子任务,每个独立打分(0.0 ~ 1.0),最后加权聚合。

def aggregate(subtask_scores, weights):
    # 例:复现问题 0.1 + 定位根因 0.25 + 修复正确 0.35 + CI 全过 0.30
    return sum(s * w for s, w in zip(subtask_scores, weights))

好处是双重的: - 诊断价值:精确定位"Agent 是卡在复现、定位、还是修复"。 - 训练价值:这种 dense reward 比"0 / 1"二元信号强一个数量级,能直接当 RL 的奖励源。

反常识 2:同时报两个阈值——"产业可用性"和"严格正确性"

论文同时报告两个数字:

  • 0.95 阈值(部分奖励):聚合奖励达到 0.95 即视为通过。允许极少量低权重子任务失败。
  • 1.0 阈值(完美奖励):必须全对,零容错。

对应两种真实场景

  • 0.95 阈值 ≈ "产业可用性"——关键交付到位就算交付成功。
  • 1.0 阈值 ≈ "严格正确性"——金融 / 医疗 / 自动驾驶,任何错漏都不行。

最强模型:0.95 阈值 15.2%,1.0 阈值 10.9%。差距看似小,但放到"金融 / 医疗 / 自动驾驶"领域,那 4.3 个百分点就是"能不能上线"的生死线

反常识 3:把"成本画像"明确给出

LH-Terminal-Bench 公开了单任务平均成本

指标 数值 类比
Tokens / 任务 9.9M 一整本百科全书
Episodes / 任务 231 调用工具 231 次
执行时间 / 任务 85.3 分钟 比一场电影还长

按 OpenAI $2.5/MTokens 算,单任务约 $25;完整跑 46 条 × 15 模型 ≈ $17000。

这个数字对学术界和中小团队是真实门槛——做这个方向的研究前,先算算预算。


任务池规模:46 条 × 9 大类,是不是太少了?

是。46 条确实偏小(对比 SWE-bench Verified 的 500+)。

但作者有自己的取舍:

  • 算力可控:每次完整跑约 $17000/模型,15 个模型就是 $250000+,小样本反而能保证横评深度。
  • 任务真实:46 条任务都是"小时级真实工作流",每条都需要数小时人工设计 + 沙箱配置。
  • 类别覆盖:9 大类(实验复现 / 软件工程 / 多模态分析 / 交互游戏 / 科学计算等)避免"只会写代码"的偏置。

代价是单类任务统计显著性不足——4–5 条任务做模型排序,置信区间宽。


对工程团队的三条可落地建议

建议 1:用 dense-subtask 评分替换二元 pass/fail

LH-Terminal-Bench 最值钱的输出是方法论:把"内部业务流"拆成"可机评子步骤",用加权聚合给分,比让 LLM 当评委靠谱得多。

建议 2:用 9.9M tokens / 85 min 当"单任务成本上限"

规划 Agent 选型 PoC 时,把 LH-Terminal-Bench 的资源画像当成基准——自家任务如果超过这个数,要考虑"是不是任务设计错了"。

建议 3:失败归因,按 5 类定位优化方向

预期 5 类失败:①规划失败 ②上下文遗忘 ③工具调用错 ④早期试错成本 ⑤验证闭环缺失。当自家 Agent 跑挂时,按这 5 类归因,能直接定位优化方向。


写在最后

AI 圈过去几年最大的错觉,是把"短任务高分"等同于"长任务能打"。

LH-Terminal-Bench 用 46 条小时级任务、9.9M tokens/任务、15 个前沿模型横评,把"长程 Agent 还差多远"量化到具体基线

下次再看到 AI 公司宣传"我们的 Agent 能自主完成 X 任务"——你可以反问一句:

"它在 Long-Horizon-Terminal-Bench 上的 pass@1 是多少?0.95 阈值还是 1.0 阈值?跑了多少小时?"

📎 论文:https://arxiv.org/abs/2607.08964

💬 评论区聊聊:你团队里有没有"Agent 跑长任务跑崩"的经历?最后卡在哪一步?🤔

人工智能 #AI科普 #Agent #大模型 #基准测试 #评测 #长上下文 #强化学习 #LLM #论文分享 #技术分享 #AI前沿 #开发者 #AI落地


三个标题变体

  1. 最强 AI 跑 85 分钟、烧 1000 万 token、通过率只有 15%——长程 Agent 的天花板被测出来了
  2. AI Agent 不是不能干,是"长工时就掉链子"——这套新基准给你看清楚差在哪
  3. 从 15.2% 到 1.7%:长程 Agent 评测告诉你,AI 离"接管一天工作"还差多远

小红书风格卡片文案(可直接发布)

🤖 AI Agent 跑 85 分钟烧 1000 万 token 通过率只有 15% 🤖

如果有人说"我的 AI Agent 可以连续工作 1.5 小时、调用几百次工具、消耗近 1000 万 token——而且最后还能把任务做完"——你大概想:这不就是"AI 打工"该有的样子吗?

但 2026 年 7 月新出的 Long-Horizon-Terminal-Bench 告诉你反直觉的真相:

😱 最强 AI 在"长工时 + 长上下文 + 多步迭代"的真实场景下: - 0.95 阈值通过率:15.2% - 1.0 阈值(零错)通过率:10.9% - 全模型平均:4.3% / 1.7%

AI 离"接管你一天的活"还差一个数量级 📉

📌 反常识 1:评分不是"对 / 错"二元 每条任务拆成几十个可机评子任务,独立打分(0.0~1.0),最后加权聚合

跑了 80% 步骤的 Agent 不再和"第一步就走错"拿一样的 0 分 既是诊断工具,也是 RL 训练的 dense reward

📌 反常识 2:同时报两个阈值 - 0.95 阈值 ≈ 产业可用性(关键交付到位就算通过) - 1.0 阈值 ≈ 严格正确性(金融/医疗/自动驾驶,零容错) - 头部 15.2% vs 10.9% 的差距,是"能不能上线"的生死线

📌 反常识 3:成本画像明明白白 | 指标 | 数值 | 类比 | |---|---|---| | Tokens / 任务 | 9.9M | 一整本百科全书 | | Episodes / 任务 | 231 | 调工具 231 次 | | 执行时间 / 任务 | 85.3 分钟 | 比一场电影还长 |

📌 46 条 × 9 大类,是不是太少了? 是!但算力可控 + 任务真实 + 类别覆盖,代价是单类统计显著性不足

📌 对工程团队的三条建议:

1️⃣ 用 dense-subtask 评分替换二元 pass/fail —— 方法论是 LH-Terminal-Bench 最值钱的输出 2️⃣ 9.9M tokens / 85 min 当"单任务成本上限" —— 超过就要考虑任务设计 3️⃣ 失败归因按 5 类定位 —— 规划 / 上下文 / 工具调用 / 早期试错 / 验证闭环

💡 为什么这件事和你有关:

AI 圈过去几年最大的错觉,是把"短任务高分"等同于"长任务能打"。

下次再看到 AI 公司宣传"我们的 Agent 能自主完成 X 任务"—— 反问一句:"它在 LH-Terminal-Bench 上的 pass@1 是多少?0.95 还是 1.0?跑了多少小时?" 🤔

📎 论文:https://arxiv.org/abs/2607.08964 💬 评论区聊聊:你团队里有没有"Agent 跑长任务跑崩"的经历?最后卡在哪一步?🤔

人工智能 #AI科普 #Agent #大模型 #基准测试 #评测 #长上下文 #强化学习 #LLM #论文分享 #技术分享 #AI前沿 #开发者 #AI落地