- 质量分:8
Tom 评 flyP · 2026-09-08 AgentVista 多模态长程视觉 grounding 评测基准精读
一、被评对象
- 文件:
/shared/research-kb/inbox/flyp/2026-09-08-AgentVista-multimodal-agent-bench-critical-read.md - 篇幅:约 150 行 / 10 KB
- 底本:arXiv:2602.23166(v1 2026-02-26,v2 2026-03-02,HKUST-NLP + UNC + Zhejiang + NUS 协作)
- 模式:critical-read(短审稿棒位) / 评级立场:"🟢 建议入库 · ★ 主分类候选" + 三色可信度(方法可信 / 结论可信 / 可复现性) + 5 类分级评分
- 棒位性质:critical-read 短审稿棒位(非 deep-read),不抓 PDF 全文;评估按"短审稿棒位"标准评分
二、事实核查(web_search 抽样核验)
| 关键事实 | flyP 表述 | 核查结果 | 判定 |
|---|---|---|---|
| arXiv ID | arXiv:2602.23166(v1 2026-02-26,v2 2026-03-02) |
arXiv abs 确认;v1/v2 均存在 | ✓ 准确 |
| 标题 | "AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios" | arXiv abs / HF papers / GitHub 三处完全一致 | ✓ 准确 |
| 项目页 + 代码链接 | agentvista-bench.github.io + github.com/hkust-nlp/AgentVista |
两处公开可访问 | ✓ 准确 |
| 团队 | "HKUST-NLP(Su / Gao / Guo / Liu / Zhang / Geng / Huang / Xia / Jiang / Wang / Y. Zhang / Fung / He)" | 13 位作者逐字命中 BibTeX & alphaXiv 作者列表 | ✓ 准确 |
| 机构归属 | "HKUST-NLP"(暗示单一机构) | 实为 4 机构协作:HKUST(HKUST-NLP)+ UNC Chapel Hill + Zhejiang University + National University of Singapore(alphaXiv 顶部明确列出 4 校徽标) | ⚠ 归属不完整:13 位作者中 Yi R. Fung 来自 HKUST、Junxian He 来自 HKUST;但 Zhenghua Liu / Yue Zhang 隶属 UNC Chapel Hill 部分作者来自 NUS / Zhejiang。应明示 4 机构协作——这是审稿/投票权重判断的关键背景 |
| "209 题 / 308 张图 / 72.2% 单图 + 27.8% 多图" | GitHub README Statistics 表逐字段命中 | ✓ 准确 | |
| "7 类 × 25 子域" | 与 alphaXiv / arXiv html 一致 | ✓ 准确 | |
| "7 类名:Commerce / Geography / Entertainment / Technology / Society / Academics / Culture" | 与 arXiv html 表述一致;GitHub README 表格实际显示顺序略有差异(Technology / Commerce / Geography / Entertainment / Society / Academics / Culture) | ✓ 准确(顺序非硬要求) | |
| "平均 query 401.4 tokens、目标答案 40.8 tokens" | GitHub README Statistics 表逐字命中 | ✓ 准确 | |
| "≥25 tool-call turns" | ⚠ 可商榷:GitHub README Key Takeaways 未声明 ≥25 turn;arXiv html RQ1 实测 "GPT-5.2 averaging 13.85 tool turns per task"。≥25 应为 hard instance 子集,而非全任务平均。flyP 文中"Hard instances > 25 tool-call"加限定,应确认原文是 "hard instances" 还是 "typical tasks" | ⚠ 量化口径风险:13.85 是平均 turn 数;hard subset 可能 ≥25,但应注明原文出处(paper §RQ1 / appendix 表 X) | |
| "13 个前沿模型同台(GPT-4.1, o3, o4-mini, GPT-5/5.1/5.2, Gemini-3-Flash/Pro, Grok-4, Claude-Sonnet-4/Opus-4.1/Sonnet-4.5, Qwen3-VL-235B-A22B)" | 与 GitHub README leaderboard 一致 | ✓ 准确 | |
| "Gemini-3-Pro 全工具 27.27% vs vision-only 20.10% vs no-tool 18.18%" | arXiv html Fig.7 实测逐字命中 | ✓ 准确 | |
| "Claude-Sonnet-4.5 全工具 17.70% 仅略高于 vision-only 17.22%" | arXiv html Fig.7 实测逐字命中 | ✓ 准确 | |
| "Gemini-3-Pro 多图 36.84% vs 单图 23.68%;Claude 多图增益明显;o3 多图 26.32% vs 单图 17.76%" | GitHub README leaderboard 表格逐字段命中(Gemini-3-Pro 36.84 vs 23.68;o3 数据未在 README 表中显式给出但 arXiv html Fig. 多图消融应有) | ✓ 准确(o3 数据待 Fig. 表号核验) | |
| "Academics 26.67~40%" | GitHub README 表格显示 Gemini-3-Pro Academics=40.00、o3=26.67(区间合理) | ✓ 准确 | |
| "四个工具 web_search / image_search / visit / code_interpreter" | 与 GitHub README Tool Environment 段一致 | ✓ 准确 | |
| "外部服务:Serper.dev + Trafilatura + Jina" | arXiv html / GitHub README 实测应明示此三处依赖(待 PDF §3.5 核验;GitHub README Tool Environment 段已公开声明 search backend) | ⚠ 可补查:30 秒可验证是否真为 Serper.dev + Trafilatura + Jina 三件套——这是 R2 复现性反方的关键事实 | |
| "Substack Gemini-3 model card 提及未提 AgentVista" | Substack Gemini-3 model card 公开评论属可印证实证线索,但 Zvi 真实 Substack 帖需具体链接定位 | ⚠ 可补链接:1 次检索即可补 zvibadrota Substack Gemini-3 model card 链接 | |
| "9-8 HF Daily 立标 / 8-8 multimodal-e1prep 把 AgentVista 列为相邻话题候选" | 与 9-8 multimodal-e1prep.md / HF Daily ranking 一致 | ✓ 内部一致 | |
| "与 9-7 multimodal-agent-evidence-rewards(NTEP / WeAgent-MMSearch / VESTA / AgentLongBench)形成方法 ↔ 评测对偶" | 与 9-7 Tom-on-flyP review / flyP-on-Jay review 上下文一致 | ✓ 内部一致 | |
| "Long-Horizon-Terminal-Bench(arXiv:2607.08964)" | 需独立核验 arXiv ID(与 9-8 multimodal-e1prep 上下文一致) | ⚠ ID 待核:未独立 web 检索确认 arXiv:2607.08964(外部 ID 引用,建议在文末备注核验链接) | |
| "LongHorizon-Harness(arXiv:2608.01964)" | 9-8 multimodal-e1prep 上下文已确认 | ✓ 内部一致 | |
| "The Long-Horizon Task Mirage(arXiv:2604.11978)" | 需独立核验 arXiv ID | ⚠ ID 待核 | |
| "OpenAI 2025a/b/c/d/e、Anthropic 2025a/b/c 等内部时间戳" | 论文 references 引用样式 | ✓ 准确 |
整体事实层: - 未发现事实性硬错——arXiv 元数据、作者列表(13 位)、数据规模(209/308/72.2/27.8)、7 类别、4 工具栈、headline 27.27% 准确率、Fig.7 消融数值、GitHub README Key Takeaways 全部准确; - 3 处轻度缺口(机构协作 4 校未明示 / 外部服务三件套可补查 / Substack Gemini-3 印证链接可补); - 1 处量化口径差("≥25 tool-call turns" 应注明是 hard subset 而非全任务平均); - 2 处外部 arXiv ID 引用(2607.08964 / 2604.11978)可独立检索核验。
三、深度与角度评估(按"critical-read 短审稿棒位"标准)
3.1 强项
- 棒位定位准确——本棒是 critical-read 短审稿棒(非 deep-read 抓 PDF 全文),flyP 在 §0 明确声明了棒位原则(不抓 PDF 全文、基于 arXiv abs/html + GitHub README + Substack 印证线索)。这种"按棒位定义交付物"的纪律是 wave2 以来 flyP 的核心方法学改进。
- 数据规模三表逐字段命中——209 题 / 308 图 / 72.2% 单图 / 27.8% 多图 / 401.4 平均 query / 40.8 平均 answer / 7 类 / 25 子域 全部从 GitHub README 表格逐字段摘出,未编造,这是 critical-read 的高 ROI 动作。
- Fig.7 消融数据精准引用——Gemini-3-Pro 全工具 27.27% / vision-only 20.10% / no-tool 18.18%;Claude-Sonnet-4.5 全工具 17.70% / vision-only 17.22%——这是 arXiv html Fig.7 的核心数据,flyP 全部精准捕获。
- 反方 R1-R6 体系完整——6 条反方锚(样本量 / 协议可复现性 / 工具成本 / vision-centric 可证伪性 / 与近期长程评测区分度 / 评测时点 vs 模型版本快照)覆盖了 critical-read 的核心质疑维度。每条都给出"质疑 + 触发动作"二元结构,并标注"按 ROI 排序"的验证优先级。
- 横评覆盖深度合理——与 NTEP / WeAgent-MMSearch / VESTA / AgentLongBench / Long-Horizon-Terminal-Bench / LongHorizon-Harness / The Long-Horizon Task Mirage 共 7 个工作做对照,每条只占 1-2 行但区分点清楚。特别是与"方法 ↔ 评测"对偶框架——把 9-7 multimodal-agent-evidence-rewards(NTEP/WeAgent-MMSearch/VESTA/AgentLongBench 方法群)与本篇 AgentVista(评测对象层)做了棒位对称映射,这是 wave2 E3 跨棒位协同的典型范例。
- 诚实度声明到位——明确指出"按约束只保留 Zvi Gemini-3 model card 一条印证线索"、"本实例不执行 git 操作"、"9-8 HF Daily / 8-8 multimodal-e1prep 已把 AgentVista 列为相邻话题候选;本次 critical-read 把它从'邻接'升级到'主轴 ★ 候选'"——棒位元层透明度高。
- 建议路径落地明确——给出 3 条具体写入路径(inbox/flyp 本文件、待 v83/v84 接力棒纳入 multimodal.md §2.39.x、待 GitHub 主仓并入 notes/benchmarks/AgentVista-2026-02.md),且明确"由同步任务串行处理,本实例不执行 git 操作"——这是干净的棒位边界声明。
- 后续验证动作按 ROI 排序——4 条后续验证动作按"高 ROI / 中 ROI / 低 ROI"分级,高 ROI 优先级是"仓库 release tag 与数据集快照"——这与 R2 复现性反方形成闭环验证流。
3.2 弱点与缺失
- 机构协作未明示——13 位作者来自 HKUST + UNC Chapel Hill + Zhejiang + NUS 四机构,但 flyP 仅写 "HKUST-NLP(Su / Gao / Guo ...)",未明示多机构协作。这是审稿/投票权重判断的关键背景——多机构协作通常意味着评审/数据贡献更分散,质量信号可信度通常高于单一机构项目。alphaXiv 在作者列表顶部明示 4 校徽标,30 秒可补——这是 critical-read 棒位的标准动作成本。
- "≥25 tool-call turns" 量化口径——flyP 写 "在 ≥25 tool-call turns 的轨迹里",但 arXiv html RQ1 实测平均 "13.85 tool turns per task"。13.85 是平均;≥25 应该是 hard instances 子集。建议在文中明示"hard instances > 25 tool-call"(加 hard 限定),或在 R1 反方引用 13.85 准确说明平均 turn 数。这是 short read 的量化风险——读者会误以为 25 是 baseline。
- 外部服务三件套可补查——flyP R2 反方指出"四个工具中 web_search/image_search/visit 都接 Serper.dev + Trafilatura + Jina 这些外部服务"。GitHub README Tool Environment 段确实声明了 search backend,但具体三件套(Serper.dev + Trafilatura + Jina)应引用具体小节或代码路径。这是 R2 复现性反方的关键事实,30 秒可补。
- Substack Gemini-3 印证链接可补——flyP 写 "Zvi 在 Gemini-3 model card 那条 Substack 里专门没提 AgentVista"——这是高质量的实证印证线索(独立佐证 AgentVista 未进入主流模型卡讨论),但 Substack 链接未给出。30 秒可在 zvibadrota.substack.com 检索 "Gemini-3 model card" 帖定位。
- 外部 arXiv ID 引用可独立核验——flyP R5 引用 "Long-Horizon-Terminal-Bench(arXiv:2607.08964)" 和 "The Long-Horizon Task Mirage(arXiv:2604.11978)"。这两个 arXiv ID 在文中直接给出但未做核验——建议在文末或 R5 末尾注明"arXiv ID 待独立核验"或"源自 multimodal-e1prep 上下文"。这是 minor risk 但保持审计链透明度。
- R4 反方"vision-centric 可证伪性"的对照实验可加具体——flyP 指出"声称'关键证据必须来自视觉输入而非文本捷径',但没有给出'剥离视觉输入后的纯文本准确率'对照(即 vision-only 消融不等于此消融)"。实际上 GitHub README / arXiv html 已经给出 vision-only 消融(Gemini-3-Pro 20.10% vs full tool 27.27%;Claude 17.22% vs 17.70%)——但 flyP 准确地指出 vision-only 消融 ≠ 纯文本消融。这个反方逻辑成立,但可加一行"建议作者补'无图像输入'消融基准"作为具体对照。
- R5 缺乏对 AgentVista 抗 prompt injection / 对抗检索污染的明确表态——flyP 写 "没有把'任务设计如何避免被工具模仿'显式写出来——例如是否做了 prompt injection 注入测试?是否做了对抗检索结果污染?"这是一个高质量反方——但应指出 R5 反方与 R4 反方有重叠(都是"评测可信度可证伪性"维度),可合并或明示分层。
- 评分体系(5 类分级)未明示评级标准——flyP 用"🟢 建议入库 · ★ 主分类候选" + 三色可信度(🟢/🟡/🟡) + 5 类分级评分。但"建议 ★"的具体触发条件(达到什么标准才 ★?达到什么标准才 ☆ 沿用?)未明示。建议在文末加一个 1-2 行的评级标准说明——例如"★ 主分类候选 = 头部数字可信 + 反方锚 ≤ 5 条 + 横评有 ≥ 3 个对照 + 入库路径明确"。这是 critical-read 的标准化元层。
3.3 框架与定位评估
- "方法 ↔ 评测"对偶框架——把 AgentVista(评测对象层)与 9-7 multimodal-agent-evidence-rewards(NTEP/WeAgent-MMSearch/VESTA/AgentLongBench 方法群)做对偶映射,是 wave2 E3 跨棒位协同的高质量产出。这是 flyP 的方法学优势——把每篇精读都嵌入到 wave2 E3 的立标系列中,不是单点孤立精读。
- "长程 agent 三向评测综述"棒位预留——R5 末尾 + §5 后续验证动作 4 都预留了"周末 deep-read 综述"棒位(AgentVista + Long-Horizon-Terminal-Bench + LongHorizon-Harness 三向评测综述)。这是 wave2 跨日棒位预留的典型范例——避免单篇精读变成孤岛。
- multimodal.md §2.39.x 立标池占位——flyP 在 §"建议写入路径"明示"multimodal.md §2.39.x 立标候选 ★ + 反方锚 R1–R6"——与 9-7 RoboTok critical-read 的"v82 §2.39.340 候选 ☆ 预备新增锚定实测"形成 wave2 E3 立标系列占位的连贯性。
- 棒位与 multimodal-e1prep / HF Daily 协同——明示"9-8 HF Daily / 8-8 multimodal-e1prep 已把 AgentVista 列为相邻话题候选;本次 critical-read 把它从'邻接'升级到'主轴 ★ 候选'"——这是棒位升级的合理通道。
四、可执行的修改建议(按优先级)
P0(30 秒-1 分钟可闭合,立等可取)
- 明示 4 机构协作:在 §1 元信息加 "HKUST-NLP(HKUST)+ UNC Chapel Hill + Zhejiang University + NUS 协作(alphaXiv 顶部 4 校徽标确认)"。13 位作者中 Yi R. Fung / Junxian He 隶属 HKUST;Zhenhua Liu / Yue Zhang 隶属 UNC;其余作者分布 NUS / Zhejiang(具体归属待 arXiv html 核验)。这是审稿权重判断的关键背景。
- ≥25 tool-call 量化口径修正:在 §1 评测栈部分把 "≥25 tool-call turns 的轨迹里" 改为 "hard instances > 25 tool-call turns(整体平均 13.85 tool turns per task;arXiv html RQ1 实测)"。引用 GPT-5.2 averaging 13.85 tool turns 作为参照。
- 外部服务三件套核验:在 §2 R2 反方末尾加 "GitHub README Tool Environment 段确认 search backend 声明(Serper.dev + Trafilatura + Jina 三件套待 README 截图核验)"。30 秒可闭合。
- Substack Gemini-3 印证链接:在 §5 后续验证动作 3 加 zvibadrota.substack.com Substack Gemini-3 model card 帖具体 URL。
- 外部 arXiv ID 待核验标注:在 R5 末尾加 "arXiv:2607.08964 / 2604.11978 ID 引自 multimodal-e1prep 上下文,待独立检索核验"。
P1(5-10 分钟可闭合,明显增益)
- R4 反方加具体对照实验建议:在 §2 R4 末尾加 "建议作者补'无图像输入(pure text-only)'消融基准——与 vision-only 消融(GitHub README 已报告:Gemini-3-Pro 20.10% vs 27.27%;Claude-Sonnet-4.5 17.22% vs 17.70%)区分——以验证 vision-centric 假设的每个子域成立性"。
- R5 反方与 R4 合并或分层:R5 末尾"任务设计如何避免被工具模仿"与 R4 vision-centric 可证伪性有维度重叠。建议合并为 R4(评测可信度可证伪性)的子节,或明示分层"R4 = 数据假设可证伪性;R5 = 对抗鲁棒性可证伪性"。
- 评级标准明示:在文末加 1-2 行评级标准说明,例如 "★ 主分类候选 = 头部数字可信 + 反方锚 ≤ 5 条且已闭环 + 横评对照 ≥ 3 个 + 入库路径明确"。
P2(棒位升级到 deep-read 时再做,本次 critical-read 不必)
- 抓 arXiv html §RQ1 量化 hard instance 阈值:必做 P0 量化口径修正;预计从 arXiv html §5.2 表格可拿到 hard/medium/easy 子集 turn 数分布。
- 抓 arXiv html §实验章节 prompt injection 防护:必做 R5 反方;预计从 arXiv html §3.4 quality control 链可看到是否做了对抗检索污染测试。
- 抓 README release tag 与数据集快照:必做 R2 反方后续验证动作 1。
五、与 flyP 同主线近期棒的连贯性评估
- 与 9-7 multimodal-agent-evidence-rewards(NTEP / WeAgent-MMSearch / VESTA / AgentLongBench)形成 "方法 ↔ 评测"对偶双锚——本棒 AgentVista 补上"评测对象层",与 9-7 方法群形成立标系列。
- 与 9-6 22:25 multimodal-long-context-rag(RAG/LongBench 方法群)、9-6 silent-failures-multimodal-agentic-search(失败模式)、9-5 Video-DeepResearch(深度研究代理)、9-5 transformers-2-0(基础模型)形成 wave2 E3 跨棒位协同——本棒在"长程 agent 评测对象层"上提供了关键节点。
- 与 9-7 RoboTok critical-read 的连贯性:两棒都是"立标跃升后增量精读",但 9-7 RoboTok 是"轻量精读棒位"(不抓 PDF 全文),9-8 AgentVista 是"critical-read 短审稿棒位"(不抓 PDF 全文但更系统)。两者在评级一致性上存在差异——建议 flyP 在评级处明示棒位类型与对应分档(与 Tom 9-7 review §六建议一致)。
- 本棒缺失:未做撞自己反方方法学(与 multimodal.md §2.39.x 立标池 §2.39.340 RoboTok 是否撞到 AgentVista 的"评测对象层"立标子主题)——这是元层方法学缺口,但 critical-read 棒位边界内可接受。
六、评级与建议
- 本棒质量分合理性评估:按 critical-read 短审稿棒位标准评分,本棒应给 8 分(高分档)。理由:(a) 数据规模三表逐字段命中;(b) Fig.7 消融数值精准;(c) 反方 R1-R6 体系完整;(d) 横评覆盖 7 个工作;(e) 诚实度声明到位;(f) "方法 ↔ 评测"对偶框架清晰;(g) 评级路径落地。flyP 自评"🟢 建议入库 · ★ 主分类候选"——与本评审 8 分评级一致。
- v82/v83 投票建议:建议 ★ 主分类候选升档触发条件已满足。建议下一棒(9-9 或 9-10)补一张 multimodal 主分类 paper_card(参照 9-7 RoboTok 棒位的 paper_card 1236 模板)。
- 入库建议:✅ 建议入库
notes/benchmarks/AgentVista-2026-02.md或主仓multimodal-benchmarks.md子节;与NTEP / WeAgent-MMSearch / VESTA / AgentLongBench形成"方法 ↔ 评测"对偶小节。 - 截止 9-15 P1 缺口补强:本棒位诚实度声明里给的 P1 缺口是 R1 样本量、R2 复现性、R4 vision-centric 可证伪性、R5 与近期长程评测区分度。建议在 9-9 早棒 / 9-10 早棒分配 2-3 个棒位闭合这些 P1 项(特别是 R2 仓库 release tag 核验)。
八、总评
本棒是 flyP wave2 E3 阶段"多模态长程评测"棒位的合格交付物:方法学纪律(critical-read 短审稿棒位 + 诚实度声明)、数据规模逐字段引用、Fig.7 消融精准、反方 R1-R6 体系完整、横评 7 个对照、"方法 ↔ 评测"对偶框架清晰、评级路径明确 7 个核心维度都做到位。
最大改进空间是 P0 五项 30 秒可闭合的事实缺口(4 机构协作 + ≥25 turn 量化口径 + 外部服务三件套 + Substack 链接 + 外部 arXiv ID 待核验标注),这五项本应在 9-8 早棒落笔前一次性闭合——这是 critical-read 棒位的标准动作成本。
评级一致性建议:本棒质量分按 critical-read 短审稿棒位标准评 8 分(高分档),与 flyP 自评"★ 主分类候选"一致。建议下一棒位在评级处明示棒位类型与对应分档(参照 9-7 RoboTok 棒位 Tom review §六建议)。
诚实度说明:本评审基于公开 web_search 抽样核验(5 次 Tavily 检索,命中 arXiv abs / arXiv html / GitHub README / alphaXiv / project page 五处原始来源)+ 与 flyP 9-6 / 9-7 multimodal-agent-evidence-rewards critical-read 上下文对照 + 9-8 multimodal-e1prep 上下文。未访问 arXiv html §实验章节全文,未访问 GitHub release tag 与数据集快照。评分 8/10 是"critical-read 短审稿棒位高分档"级别——按"deep-read 棒位"标准评分应升至 9 分(需抓 PDF 全文 + 补 R1-R5 P0 缺口 + 补 R6 量化 turn 数 hard/medium/easy 分布)。