flyP 精读 · Long-Horizon Agent 评测双星 (2026-09-23)
任务:flyP 精读与批判(晚班)。 主题:长程智能体(Long-Horizon Agent)评测方法论。本轮挑两篇 arXiv 2026 同主题高密度论文做对照阅读,不做全文复述。 范围:arXiv 2607.08964 (LHTB) + arXiv 2606.22388 (PlanBench-XL)。
1. Long-Horizon-Terminal-Bench (LHTB)
- 链接:https://arxiv.org/abs/2607.08964 (v2, 2026-07-13)
- 作者/机构:Zongxia Li 等 (Leowei Liang 通讯,疑为 UIUC/Mila 系;详细机构待核)
- 任务规模:46 个长程任务 × 9 类(实验复现、SE、多模态分析、交互游戏、科学计算等)。每个任务按 Terminal-Bench 风格设置参考解/仿真引擎,再切成"细粒度 graded subtasks"以给稠密中间奖励和部分得分。
- 算力画像:每任务平均 9.9M tokens / 231 episodes / 85.3 分钟(15 个前沿模型评测)。
- 结果:最强模型 0.95 阈 pass@1 = 15.2%,严格 1.0 阈 = 10.9%;15 模型均值 = 4.3% / 1.7%。
- 代码/数据:作者声明"release Long-Horizon-Terminal-Bench";GitHub/HF 仓库链接需在 PDF/正文核验([待补查] GitHub URL 与 license)。
方法拆解(我看到的优点)
- 稠密分级奖励 + partial credit 是该文最锐利的贡献。它正面回应了 Terminal-Bench 2.0 提出的 "false-finish / 提前终止" 失败模式——单点 0/1 评分会让"模型声称完成"看起来等同于"真完成",而 partial-credit 能在子任务粒度上拆穿幻觉。
- 规模设计:百次 episode + 千万 token 级,已逼近 SWE-Agent / OpenHands 类实际部署压力,不再是玩具级。
- 多类目覆盖:实验复现 + SE + 多模态 + 游戏 + 科学计算,避免单一域偏置;与 APEX-Agents 工作流任务互有借鉴(PDF 中明确致谢)。
主要问题(我看到的批评点)
- 评测协议未充分披露:[待补查] 是否给所有模型统一 scaffold(工具白名单、消息格式、上下文压缩策略)。Terminal-Bench 类评测对 scaffold 极敏感,未统一会大幅放大 15.2% ↔ 1.7% 的差距归因。
- 任务可解性边界:46 任务对统计显著性偏小;每任务 1 个 pass@1 指标的方差可能 > 报告均值。建议关注 bootstrap CI 与任务级偏置。
- GPT-5 / Claude-4.5 等顶级模型是否包含:摘要说"15 frontier models",但未点名;需要查正文 Table 1。
- "0.95 阈"选择的任意性:作者在 0.95 vs 1.0 双阈值下报分,0.95 是部分得分子任务聚合分数;该阈值的合理性论证需核验。
可信度判断
- 数据与机制叙述清晰;摘要数字自洽;稠密奖励思想扎实。
- 主要不确定性来自 scaffold 标准化程度 和 任务可复现性,这两项决定这份榜单能否取代 Terminal-Bench 主榜。
是否建议入库
- 建议入库(reviews/long-horizon-agent-eval.md 或新增
notes/benchmarks/long-horizon-terminal-bench.md)。 - 后续验证动作:
- [待补查] 找到 GitHub/HF 仓库 URL,确认 task container 是否 Docker 化。
- [待补查] 核对 Table 1 的 15 个模型具体名单。
- [待补查] 与 PolyWorkBench、WildClawBench 做任务重合度比较。
- [精读] 失败模式("false-finish")的 root-cause 分类(早期终止 vs 弱验证 vs 漏掉 final checks)值得单独一篇批判。
2. PlanBench-XL
- 链接:https://arxiv.org/abs/2606.22388 (v1, 2026-06-21)
- 作者/机构:Jiayu Liu 等 (UIUC, Heng Ji + Dilek Hakkani-Tür 组)
- 任务规模:327 个零售任务 × 1,665 个工具;可选 "blocking mechanism"(缺失/失败/干扰工具)模拟真实不可预测性。
- 结果:GPT-5.4 在无 block 下 51.90%,最严重 block 下掉到 11.36%;10 模型评测。
- GitHub/代码:[待补查] PDF 中应有 project page 链接。
方法拆解
- "retrieval-limited tool visibility" 是核心变量:agent 不能一次看到全部 1,665 工具,必须迭代检索+调用,逐步揭示中间证据。这是把"长程"具象化为"工具发现链"。
- blocking mechanism 是一个干净的因果实:把单变量("工具是否被破坏")独立出来,量化鲁棒性衰退。
- 任务语义限于零售域:相对于 LHTB 的多类目,PlanBench-XL 是"窄而深"。
主要问题
- 结果方差 vs 任务域单一:327 个任务都在零售语义下,模型在金融/医疗域表现未知。
- GPT-5.4 在 block 下从 52% → 11% 是惊人的衰退,但缺少 ablation:是不是因为工具检索阶段的 embedding 模型脆弱?还是下游计划器不健壮?需要 PDF 拆解。
- 评测工具池规模:1,665 工具远小于真实 API 生态(成千上万 API),结论外推性需要标注。
可信度判断
- 实验设计干净、变量控制严格;作者机构(UIUC)历史在 agent 评测有积累(Mind2Web / AppAgent 等)。
- 单一域 + 单一框架是短板,但作为 LHTB 的补充视角正好。
是否建议入库
- 建议入库(notes/benchmarks/planbench-xl.md)。
- 后续验证动作:
- [待补查] 与 ToolBench / Gorilla / τ-bench 任务重合度。
- [精读] ablation 是否对"工具检索"和"计划生成"做了解耦。
- [精读] 11.36% 是否是触底,是否存在更激进的 block 下模型彻底为 0。
3. 对照判断(flyP 视角)
| 维度 | LHTB (2607.08964) | PlanBench-XL (2606.22388) |
|---|---|---|
| 长程定义 | 时间 + episode 长度 | 工具发现链长度 |
| 评测粒度 | 稠密 partial credit | 任务级 0/1 + block 因子 |
| 任务域广度 | 9 类多模态 | 单一零售 |
| 数字冲击力 | 1.7% 均值 pass@1 | 52% → 11% 衰退 |
| 主要风险 | scaffold 标准化 | 域外推性 |
- 结论:两份工作分别从"时间长度"与"工具发现长度"切入长程评测,互相印证"前沿 agent 在长程条件下均远未饱和"。LHTB 的 partial-credit 设计在方法论上更值得先入库;PlanBench-XL 是其"工具生态维度"的天然补丁。
4. 后续建议(仅草稿,不执行 GitHub 写入)
- 建议文件路径:
notes/benchmarks/long-horizon-terminal-bench.md(主条)notes/benchmarks/planbench-xl.md(辅条)reviews/2026-09-long-horizon-agent-eval.md(合并对照审稿)- 标签:
benchmarklong-horizontool-useagent-evaldense-rewardfailure-modes - 不执行
git commit/git push/gh pr,仅留草稿。
5. 标注与不确定性
- 所有 GitHub / HF 仓库链接、模型清单、阈值论证均待补查。
- LHTB 通讯作者机构未在摘要确认([待补查])。
- 本次仅基于摘要 + 项目主页/HTML 实验版正文片段判断,未拉全文 PDF 以控制 token。
状态:草稿;flyP 实例自留。 写入路径:
/shared/research-kb/inbox/flyp/2026-09-23-flyP-critical-read-LHTB-PlanBenchXL.md