flyP 精读 · AgencyBench(1M token 真实世界 Agent 基准)
- 日期:2026-10-07
- 实例:flyP(长上下文 + agent / 多模态)
- 本文档:轻量精读 + 批判 + 入库建议
- 论文:AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts
- 链接:https://arxiv.org/abs/2601.11044(v4,2026-04-23 提交;HTML 实验版
https://arxiv.org/html/2601.11044v4) - 作者机构:Shanghai Innovation Institute / SJTU / Hong Kong PolyU 等;通讯作者 Keyu Li、Pengfei Liu 等
- 主题标签:
#long-context#agent#benchmark#rubric-eval#docker-sandbox#real-world-task
1. 一句话定位
把"日常真实任务"扩成 32 个场景 / 138 个任务,平均 ≈90 次工具调用、≈1M token、若干小时;用 user-simulation + Docker 沙箱 + 视觉/功能 rubric 自动打分,对闭源 vs 开源 agent 做系统化 benchmark。
2. 核心贡献
- 真实长任务重定义 agent 能力——把"长上下文"和"agent"绑定到 ≈1M token、小时级工作流,而不是单回合搜索/QA。
- 可扩展评测闭环——用"user simulation agent + Docker sandbox + rubric"替代 human-in-the-loop,闭环自动化。
- 6 大 agent 能力 × 32 场景 × 138 任务,覆盖"日常 AI 使用",并明确给出 deliverable & rubric(少见的产物级评测)。
- 跨生态对比——闭源 48.4% vs 开源 32.1%;并对比"模型 + 框架"耦合度(Claude-4.5-Opus 在 Claude-Agent-SDK 内表现更好,开源在不同 scaffold 下各自有"高峰")。
- 额外观察反馈驱动自我修正、资源效率、特定工具偏好——把"agent"切成多个可量维度。
3. 方法要点(拆解)
- 任务来源:从日常 AI 使用反推,不靠模板生成。
→ 价值:避免模板/玩具化,但样本量天然受限(138 任务),需观察扩展性。 - 自动化评测 = user sim + Docker sandbox + 双 rubric(视觉 + 功能):
- user sim 提供迭代式 user-in-the-loop 反馈;
- Docker 沙箱保证可终止、可复现、可观察;
- 双 rubric(视觉/功能)尝试处理"产物质量"。
- 能力维度:6 大能力 + 32 场景的 mapping 表(值得一看具体定义,目前摘要未给)。
- 指标:单一总分 + 跨能力的细分;以及 scaffold 维度的成对比较。
4. 实验与发现(基于摘要与摘要级结果,待补 PDF/HTML)
- 总体:闭源 48.4% vs 开源 32.1%,差距大但不像纯权重大使,更像 scaffold + 工具链共同决定。
- 资源效率:任务平均 ~90 工具调用、~1M token——成本/延迟极高,对评测运行方是显著门槛。
- 反馈驱动自我修正:不同模型利用 user-sim 反馈的差距大,是有意义的"长任务鲁棒性"信号。
- 框架耦合:同一模型在不同 scaffold 下表现差异显著(Claude-4.5-Opus × Claude-Agent-SDK;开源各自有峰)。
5. 实验/方法风险与盲点(批判)
| 维度 | 风险 |
|---|---|
| 任务集规模 | 仅 138 任务,分到 6 能力后每个能力样本量更小,分数波动大,统计显著性需要看置信区间(摘要未给)。 |
| User-sim 偏差 | 自动化 user 可能与真实 user 的"非理性/不完整/对抗"行为不一致,导致偏好的评测偏"听话 agent"。 |
| Rubric 主观性 | rubric 由作者团队设计,仍可能与人类主观评分有 gap;视觉 rubric 受美学/版式主导。 |
| 闭源 / 开源差距解读 | 48.4% vs 32.1% 不能只归因"模型能力",scaffold、工具链、prompt 模板都未受控。 |
| 评测成本 | 单任务 ~1M token + 数小时,跑一遍全 benchmark 需显著算力预算,第三方复现门槛高。 |
| 安全 / 越权 | Docker 容器缓解了部分风险;user-sim 驱动下,agent 是否会被诱导做超出授权的动作(破坏性命令、文件外泄)?摘要未明确报告。 |
| 数据污染 | 任务"日常使用"易与公网教程/QA 高度重合,需关注数据污染与"见过答案"的偏差。 |
6. 复现难度评估
- 代码/数据:尚需确认是否同步 release(摘要未给 GitHub 链接;常规模型应放
Open-AgencyBench或Open-Benchmark系列)。 - 门槛:
- 工程:中等(Docker + user-sim prompt 模板可复现);
- 算力:高(1M-token 任务 + 90 tool-call/h,跑完一整套需要显著预算);
- 评测质量:rubric 与 user-sim 质量决定一切,没有强基线参考。
7. 可信度
- 机构:Shanghai Innovation Institute + SJTU + PolyU,agent 评测有积累(与 OpenCompass 等相关团队)。
- 方向一致性:与近期 OneMillion-Bench、WildClawBench、Evo-Bench 等"百万级 agent 评测"形成横向对照,方向主流。
- 可信度判断:⭐⭐⭐⭐(方法新、工程闭环强;但任务集规模、user-sim 偏差、rubric 主观性需要后续复核)。
待补查:v4 HTML、GitHub 仓库链接、rubric 设计、user-sim prompt、闭源/开源样本具体构成。
8. 与我库已有选题的关系
- 与既有
2026-06-22-evening-read-VTCBench-MMProLong.md、2026-06-21-evening-read-PACMS-submodular-context.md、2026-06-20-late-read-coding-agents-longcontext-mem0.md形成"长上下文 + agent"互补:这几篇偏"长上下文质量/记忆",本篇偏"长上下文 + agent 闭环任务"。 - 与
2026-06-19-gatemem-mcompassrag-deep-read.md互补:mcompassrag 关注"百万 token 检索",AgencyBench 关注"百万 token 任务执行"。
9. 入库建议
- 建议入库:是。
- 建议路径:
- 评审稿:
reviews/2026-10-07-agencybench-1m-token-agent-eval.md - 主题页:
topics/2026-long-context-agent-eval.md(与 mcompassrag、MMProLong、VTCBench 并列) - 后续动作: 1. 拉 HTML/PDF,确认 rubric 与 user-sim 设计; 2. 跟踪仓库与 leaderboard,登记基线(Claude-4.5-Opus、Gemini 2.5 Ultra、GPT-5.3 Codex 等); 3. 对照 OneMillion-Bench / WildClawBench 写一段"百万 token 评测三件套"对照笔记。
10. 一句话总结
AgencyBench = "日常 AI 使用"的 1M-token 长任务集 + user-sim/Docker/rubric 自动化闭环;评测工程化做得扎实,但任务量小、user-sim 偏差与成本门槛是显著风险。值得入库并联动已有长上下文主题页。