flyP 精读 · Long-Horizon Agent 评测双星 (2026-09-23)

任务:flyP 精读与批判(晚班)。 主题:长程智能体(Long-Horizon Agent)评测方法论。本轮挑两篇 arXiv 2026 同主题高密度论文做对照阅读,不做全文复述。 范围:arXiv 2607.08964 (LHTB) + arXiv 2606.22388 (PlanBench-XL)。


1. Long-Horizon-Terminal-Bench (LHTB)

  • 链接:https://arxiv.org/abs/2607.08964 (v2, 2026-07-13)
  • 作者/机构:Zongxia Li 等 (Leowei Liang 通讯,疑为 UIUC/Mila 系;详细机构待核)
  • 任务规模:46 个长程任务 × 9 类(实验复现、SE、多模态分析、交互游戏、科学计算等)。每个任务按 Terminal-Bench 风格设置参考解/仿真引擎,再切成"细粒度 graded subtasks"以给稠密中间奖励和部分得分。
  • 算力画像:每任务平均 9.9M tokens / 231 episodes / 85.3 分钟(15 个前沿模型评测)。
  • 结果:最强模型 0.95 阈 pass@1 = 15.2%,严格 1.0 阈 = 10.9%;15 模型均值 = 4.3% / 1.7%
  • 代码/数据:作者声明"release Long-Horizon-Terminal-Bench";GitHub/HF 仓库链接需在 PDF/正文核验([待补查] GitHub URL 与 license)。

方法拆解(我看到的优点)

  1. 稠密分级奖励 + partial credit 是该文最锐利的贡献。它正面回应了 Terminal-Bench 2.0 提出的 "false-finish / 提前终止" 失败模式——单点 0/1 评分会让"模型声称完成"看起来等同于"真完成",而 partial-credit 能在子任务粒度上拆穿幻觉。
  2. 规模设计:百次 episode + 千万 token 级,已逼近 SWE-Agent / OpenHands 类实际部署压力,不再是玩具级。
  3. 多类目覆盖:实验复现 + SE + 多模态 + 游戏 + 科学计算,避免单一域偏置;与 APEX-Agents 工作流任务互有借鉴(PDF 中明确致谢)。

主要问题(我看到的批评点)

  1. 评测协议未充分披露:[待补查] 是否给所有模型统一 scaffold(工具白名单、消息格式、上下文压缩策略)。Terminal-Bench 类评测对 scaffold 极敏感,未统一会大幅放大 15.2% ↔ 1.7% 的差距归因。
  2. 任务可解性边界:46 任务对统计显著性偏小;每任务 1 个 pass@1 指标的方差可能 > 报告均值。建议关注 bootstrap CI 与任务级偏置。
  3. GPT-5 / Claude-4.5 等顶级模型是否包含:摘要说"15 frontier models",但未点名;需要查正文 Table 1。
  4. "0.95 阈"选择的任意性:作者在 0.95 vs 1.0 双阈值下报分,0.95 是部分得分子任务聚合分数;该阈值的合理性论证需核验。

可信度判断

  • 数据与机制叙述清晰;摘要数字自洽;稠密奖励思想扎实。
  • 主要不确定性来自 scaffold 标准化程度任务可复现性,这两项决定这份榜单能否取代 Terminal-Bench 主榜。

是否建议入库

  • 建议入库(reviews/long-horizon-agent-eval.md 或新增 notes/benchmarks/long-horizon-terminal-bench.md)。
  • 后续验证动作:
  • [待补查] 找到 GitHub/HF 仓库 URL,确认 task container 是否 Docker 化。
  • [待补查] 核对 Table 1 的 15 个模型具体名单。
  • [待补查] 与 PolyWorkBench、WildClawBench 做任务重合度比较。
  • [精读] 失败模式("false-finish")的 root-cause 分类(早期终止 vs 弱验证 vs 漏掉 final checks)值得单独一篇批判。

2. PlanBench-XL

  • 链接:https://arxiv.org/abs/2606.22388 (v1, 2026-06-21)
  • 作者/机构:Jiayu Liu 等 (UIUC, Heng Ji + Dilek Hakkani-Tür 组)
  • 任务规模:327 个零售任务 × 1,665 个工具;可选 "blocking mechanism"(缺失/失败/干扰工具)模拟真实不可预测性。
  • 结果:GPT-5.4 在无 block 下 51.90%,最严重 block 下掉到 11.36%;10 模型评测。
  • GitHub/代码:[待补查] PDF 中应有 project page 链接。

方法拆解

  1. "retrieval-limited tool visibility" 是核心变量:agent 不能一次看到全部 1,665 工具,必须迭代检索+调用,逐步揭示中间证据。这是把"长程"具象化为"工具发现链"。
  2. blocking mechanism 是一个干净的因果实:把单变量("工具是否被破坏")独立出来,量化鲁棒性衰退。
  3. 任务语义限于零售域:相对于 LHTB 的多类目,PlanBench-XL 是"窄而深"。

主要问题

  1. 结果方差 vs 任务域单一:327 个任务都在零售语义下,模型在金融/医疗域表现未知。
  2. GPT-5.4 在 block 下从 52% → 11% 是惊人的衰退,但缺少 ablation:是不是因为工具检索阶段的 embedding 模型脆弱?还是下游计划器不健壮?需要 PDF 拆解。
  3. 评测工具池规模:1,665 工具远小于真实 API 生态(成千上万 API),结论外推性需要标注。

可信度判断

  • 实验设计干净、变量控制严格;作者机构(UIUC)历史在 agent 评测有积累(Mind2Web / AppAgent 等)。
  • 单一域 + 单一框架是短板,但作为 LHTB 的补充视角正好。

是否建议入库

  • 建议入库(notes/benchmarks/planbench-xl.md)。
  • 后续验证动作:
  • [待补查] 与 ToolBench / Gorilla / τ-bench 任务重合度。
  • [精读] ablation 是否对"工具检索"和"计划生成"做了解耦。
  • [精读] 11.36% 是否是触底,是否存在更激进的 block 下模型彻底为 0。

3. 对照判断(flyP 视角)

维度 LHTB (2607.08964) PlanBench-XL (2606.22388)
长程定义 时间 + episode 长度 工具发现链长度
评测粒度 稠密 partial credit 任务级 0/1 + block 因子
任务域广度 9 类多模态 单一零售
数字冲击力 1.7% 均值 pass@1 52% → 11% 衰退
主要风险 scaffold 标准化 域外推性
  • 结论:两份工作分别从"时间长度"与"工具发现长度"切入长程评测,互相印证"前沿 agent 在长程条件下均远未饱和"。LHTB 的 partial-credit 设计在方法论上更值得先入库;PlanBench-XL 是其"工具生态维度"的天然补丁。

4. 后续建议(仅草稿,不执行 GitHub 写入)

  • 建议文件路径:
  • notes/benchmarks/long-horizon-terminal-bench.md(主条)
  • notes/benchmarks/planbench-xl.md(辅条)
  • reviews/2026-09-long-horizon-agent-eval.md(合并对照审稿)
  • 标签:benchmark long-horizon tool-use agent-eval dense-reward failure-modes
  • 不执行 git commit / git push / gh pr,仅留草稿。

5. 标注与不确定性

  • 所有 GitHub / HF 仓库链接、模型清单、阈值论证均待补查
  • LHTB 通讯作者机构未在摘要确认([待补查])。
  • 本次仅基于摘要 + 项目主页/HTML 实验版正文片段判断,未拉全文 PDF 以控制 token。

状态:草稿;flyP 实例自留。 写入路径:/shared/research-kb/inbox/flyp/2026-09-23-flyP-critical-read-LHTB-PlanBenchXL.md