AgentVista · 多模态 Agent 在真实视觉长任务下的评测基准(精读 + 批判)

1. 一句话定位

第一个把"真实多模态场景 + 长视域混合工具调用"放在一起考的多模态 agent 评测基准,刻意压低 SOTA 分数,逼迫业界承认当下多模态 agent 离实用还有结构性差距。

2. 核心贡献

  1. 任务设计:25 个子领域、7 大类(涵盖日常照片、屏幕截图、技术示意图、交通地图等),每条任务都要求 agent 在多轮工具使用中完成"看图→检索/计算/搜索→再次看图→得出唯一可验证答案"的闭环。
  2. 混合工具栈:开放 web_search / image_search / page_navigation / code_interpreter(stateful Jupyter)四类工具,覆盖检索 + 图像处理 + 编程三类操作,工具 schema 完整,由模型自主决定调用顺序。
  3. 难度信号:明确给出"硬例需要 25+ 轮工具调用"的统计;最强 Gemini-3-Pro + tools 也只有 27.3% 总分;这种"压低 SOTA"的设计本身就是贡献,提供了后续评测时的上限参照。
  4. 评估对象:已对多家 SOTA 多模态 agent(Gemini-3-Pro、GPT 系列、Claude、Qwen-VL 等)做了横评,便于横向对比。

3. 方法拆解(精读视角)

  • 数据构造:采用"真实图像 + 真实问题 + 唯一可程序验证答案"的范式,避免 LLM-as-judge 偏差(这一点和之前看过的 WeaveBench、LongShOTBench 的"轨迹级自动判分"思路接近,但 AgentVista 把验证器下沉到工具输出层,更可靠)。
  • 长视域控制:没有硬截断轮次,而是允许 25+ 轮的开放式推理;评测指标应该在轨迹成本(步数、token)与最终准确率之间做帕累托,这一点比 VCA 等"好奇心驱动"的方法更可控。
  • 评测协议:用 deterministic evaluator 替代 LLM-judge,对最终答案做可执行校验,比"主观评分"鲁棒性更高,复现门槛更低。

4. 主要问题与可信度风险

风险维度 具体判断 严重度
数据污染 25 子领域 7 大类使用真实网络图像,静态集合仍可能被未来模型在预训练阶段看到
工具稳定性 依赖 Serper.dev、Jupyter 等外部服务,可复现性受 API 配额影响 中高
评分偏置 deterministic evaluator 对"格式敏感"任务友好,但开放式自然语言答案可能误判
模型覆盖 评测集中在闭源旗舰;开源多模态 agent 样本不足,可能低估开源潜力
长视域饱和 25+ 轮调用对闭源旗舰来说仍有上界(成本与延迟),实际部署指标可能比"27.3%"更难看
安全/红队 基准本身没有攻击/越狱维度,只能衡量"能力"不能衡量"安全鲁棒性"

整体可信度:中高。论文方法论清晰、代码与数据公开、社区已可复现;但要注意它本质上是"通用能力考试",不是安全/对抗基准。

5. 与之前精读的对照

  • WeaveBench(CUA hybrid trajectory judge):WeaveBench 关注"轨迹级人机混合判分",AgentVista 关注"工具执行级 deterministic 判分",两者互补。
  • Agent-as-a-Judge(survey):AgentVista 是该 survey 里"长视域混合工具"类目的代表案例之一。
  • LongShOTBench / LongAttnComp:长视频/长上下文 vs 长视域工具调用;AgentVista 把"长"换成了"工具轮次",是新维度。
  • MATP-BENCH:AgentVista 是开放域,MATP 是定理证明垂直域,两者都强调"可执行验证"。

6. 是否建议入库

建议入库,理由:

  1. 题目命中"多模态 agent 评测"主线,与 flyP 既有的 WeaveBench / Agent-as-a-Judge / LongShOTBench 形成"评测谱系"完整闭环。
  2. 提供可执行评测器 + 公开 leaderboard,未来 review 多模态 agent 工作时可作为"必跑基准"之一。
  3. 工具栈设计有借鉴价值,必要时可作为团队内部"长视域 agent smoke test"蓝本。

7. 建议落地动作

  • notes 路径notes/benchmarks/multimodal-agent/AgentVista-2026-06-27.md(摘要 + 复现 checklist + 与 WeaveBench/LongShOTBench 对照表)。
  • review 路径:暂不入 reviews/,待至少 2 篇后续工作在该基准上的实验数据出现再写正式 review。
  • 复现难度:中等。需要外部 API key(Serper、Jupyter 资源),建议至少跑 1 个闭源旗舰 + 1 个开源多模态 agent 做对照。
  • 后续验证(待补查): 1. 拉取 GitHub 仓库的 data/eval/leaderboard/ 三个目录,确认任务 schema、答案校验器实现细节。 2. 对照 HuggingFace papers 页面"Models citing this paper",抓取 1-2 篇引用此基准的工作做交叉验证。 3. 关注是否出现"开源多模态 agent + AgentVista"的复现报告(搜 GitHub Issues / Discord / 知乎专栏)。

8. 速读结论

  • 核心价值:把"长视域混合工具调用"做成可程序验证的评测基准,方法论扎实。
  • 主要弱点:依赖外部 API、覆盖开源模型不足、没有安全/对抗维度。
  • 适合作为 flyP "评测谱系"主题页新增条目,建议先写 notes,后写 review。

本条精读为 flyP 独立产出,不引用原文长段;如需引用请回到 arXiv 原页核对最新版本。