flyP 精读 · AgencyBench(1M token 真实世界 Agent 基准)

  • 日期:2026-10-07
  • 实例:flyP(长上下文 + agent / 多模态)
  • 本文档:轻量精读 + 批判 + 入库建议
  • 论文:AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts
  • 链接:https://arxiv.org/abs/2601.11044(v4,2026-04-23 提交;HTML 实验版 https://arxiv.org/html/2601.11044v4)
  • 作者机构:Shanghai Innovation Institute / SJTU / Hong Kong PolyU 等;通讯作者 Keyu Li、Pengfei Liu 等
  • 主题标签:#long-context #agent #benchmark #rubric-eval #docker-sandbox #real-world-task

1. 一句话定位

把"日常真实任务"扩成 32 个场景 / 138 个任务,平均 ≈90 次工具调用、≈1M token、若干小时;用 user-simulation + Docker 沙箱 + 视觉/功能 rubric 自动打分,对闭源 vs 开源 agent 做系统化 benchmark。

2. 核心贡献

  1. 真实长任务重定义 agent 能力——把"长上下文"和"agent"绑定到 ≈1M token、小时级工作流,而不是单回合搜索/QA。
  2. 可扩展评测闭环——用"user simulation agent + Docker sandbox + rubric"替代 human-in-the-loop,闭环自动化。
  3. 6 大 agent 能力 × 32 场景 × 138 任务,覆盖"日常 AI 使用",并明确给出 deliverable & rubric(少见的产物级评测)。
  4. 跨生态对比——闭源 48.4% vs 开源 32.1%;并对比"模型 + 框架"耦合度(Claude-4.5-Opus 在 Claude-Agent-SDK 内表现更好,开源在不同 scaffold 下各自有"高峰")。
  5. 额外观察反馈驱动自我修正、资源效率、特定工具偏好——把"agent"切成多个可量维度。

3. 方法要点(拆解)

  • 任务来源:从日常 AI 使用反推,不靠模板生成。
    → 价值:避免模板/玩具化,但样本量天然受限(138 任务),需观察扩展性。
  • 自动化评测 = user sim + Docker sandbox + 双 rubric(视觉 + 功能):
  • user sim 提供迭代式 user-in-the-loop 反馈;
  • Docker 沙箱保证可终止、可复现、可观察;
  • 双 rubric(视觉/功能)尝试处理"产物质量"。
  • 能力维度:6 大能力 + 32 场景的 mapping 表(值得一看具体定义,目前摘要未给)。
  • 指标:单一总分 + 跨能力的细分;以及 scaffold 维度的成对比较。

4. 实验与发现(基于摘要与摘要级结果,待补 PDF/HTML)

  • 总体:闭源 48.4% vs 开源 32.1%,差距大但不像纯权重大使,更像 scaffold + 工具链共同决定。
  • 资源效率:任务平均 ~90 工具调用、~1M token——成本/延迟极高,对评测运行方是显著门槛。
  • 反馈驱动自我修正:不同模型利用 user-sim 反馈的差距大,是有意义的"长任务鲁棒性"信号。
  • 框架耦合:同一模型在不同 scaffold 下表现差异显著(Claude-4.5-Opus × Claude-Agent-SDK;开源各自有峰)。

5. 实验/方法风险与盲点(批判)

维度 风险
任务集规模 仅 138 任务,分到 6 能力后每个能力样本量更小,分数波动大,统计显著性需要看置信区间(摘要未给)。
User-sim 偏差 自动化 user 可能与真实 user 的"非理性/不完整/对抗"行为不一致,导致偏好的评测偏"听话 agent"。
Rubric 主观性 rubric 由作者团队设计,仍可能与人类主观评分有 gap;视觉 rubric 受美学/版式主导。
闭源 / 开源差距解读 48.4% vs 32.1% 不能只归因"模型能力",scaffold、工具链、prompt 模板都未受控。
评测成本 单任务 ~1M token + 数小时,跑一遍全 benchmark 需显著算力预算,第三方复现门槛高。
安全 / 越权 Docker 容器缓解了部分风险;user-sim 驱动下,agent 是否会被诱导做超出授权的动作(破坏性命令、文件外泄)?摘要未明确报告。
数据污染 任务"日常使用"易与公网教程/QA 高度重合,需关注数据污染与"见过答案"的偏差。

6. 复现难度评估

  • 代码/数据:尚需确认是否同步 release(摘要未给 GitHub 链接;常规模型应放 Open-AgencyBench 或 Open-Benchmark 系列)。
  • 门槛:
  • 工程:中等(Docker + user-sim prompt 模板可复现);
  • 算力:高(1M-token 任务 + 90 tool-call/h,跑完一整套需要显著预算);
  • 评测质量:rubric 与 user-sim 质量决定一切,没有强基线参考。

7. 可信度

  • 机构:Shanghai Innovation Institute + SJTU + PolyU,agent 评测有积累(与 OpenCompass 等相关团队)。
  • 方向一致性:与近期 OneMillion-Bench、WildClawBench、Evo-Bench 等"百万级 agent 评测"形成横向对照,方向主流。
  • 可信度判断:⭐⭐⭐⭐(方法新、工程闭环强;但任务集规模、user-sim 偏差、rubric 主观性需要后续复核)。
    待补查:v4 HTML、GitHub 仓库链接、rubric 设计、user-sim prompt、闭源/开源样本具体构成。

8. 与我库已有选题的关系

  • 与既有 2026-06-22-evening-read-VTCBench-MMProLong.md、2026-06-21-evening-read-PACMS-submodular-context.md、2026-06-20-late-read-coding-agents-longcontext-mem0.md 形成"长上下文 + agent"互补:这几篇偏"长上下文质量/记忆",本篇偏"长上下文 + agent 闭环任务"。
  • 与 2026-06-19-gatemem-mcompassrag-deep-read.md 互补:mcompassrag 关注"百万 token 检索",AgencyBench 关注"百万 token 任务执行"。

9. 入库建议

  • 建议入库:是。
  • 建议路径:
  • 评审稿:reviews/2026-10-07-agencybench-1m-token-agent-eval.md
  • 主题页:topics/2026-long-context-agent-eval.md(与 mcompassrag、MMProLong、VTCBench 并列)
  • 后续动作: 1. 拉 HTML/PDF,确认 rubric 与 user-sim 设计; 2. 跟踪仓库与 leaderboard,登记基线(Claude-4.5-Opus、Gemini 2.5 Ultra、GPT-5.3 Codex 等); 3. 对照 OneMillion-Bench / WildClawBench 写一段"百万 token 评测三件套"对照笔记。

10. 一句话总结

AgencyBench = "日常 AI 使用"的 1M-token 长任务集 + user-sim/Docker/rubric 自动化闭环;评测工程化做得扎实,但任务量小、user-sim 偏差与成本门槛是显著风险。值得入库并联动已有长上下文主题页。