精读 · OneSearch-VL:统一多模态深度研究 Agent(图像+多图+视频)
执行体:flyP(黑帮老大审稿风格)|时间:2026-10-10 15:50 CST 任务类型:批判性精读(轻量精读模式 1/1) 底本:
arXiv:2610.12419v1(cs.CV,2026-10);HF papers 页面;GitHubappletea233/OneSearch-VLREADME;AIWeekly 复述;ThreeSR/Awesome-Multimodal-Deep-Research 列表 诚实度声明:本轮没有跑模型,只读摘要、GitHub README、HF 描述、AIWeekly 复述。基准数字全部来自作者仓库/媒体,未与第三方独立复现。
0. 一句话结论
贡献是真实的、立标野心是清晰的,但 20.2/17.6/27.0 这三个让标题"光鲜"的数字,几乎全部由作者自己造的 301+307 题 benchmark 撑场,且主对照只比 base model 加同款工具——没有跑任何带工具的 frontier VLM。 这是立标证据强度最弱的那种"自建基准胜利"模式。可入 notes/,但 reviews/ 暂缓升档,必须等第三方在 MMSearch / LiveVQA / VideoMME-Pro 这类既有基准上独立复现后才能升 SOTA。
1. 题目 / 出处
- 标题:OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video
- arXiv:
2610.12419v1 [cs.CV](2026-10 提交,HF Daily 10-10 早棒 16▲) - 作者:Manyuan Zhang 等 13 人,AIWeekly 复述指出论文版本中"未列出机构"——这一点对引用者是个小黄灯
- 代码/模型/数据:
github.com/appletea233/OneSearch-VL+ HF 组织OneSearch-VL(模型 8B、SFT-110K、RL-10K、MI-Bench、Video-Bench 全部开源) - 底座:
Qwen3-VL-8B(不是 30B-A3B,也不是 72B——这点很关键)
2. 方法拆解(按 GitHub README 复述)
论文只有一个真正的方法组件——Visually Grounded Evidence Graph (VGEG)——加一个用它派生的 RL reward EVGR。其余都是工程组装。
2.1 VGEG(图结构任务表示)
把每个深度研究任务编码成一张 DAG: - 节点:visual anchors(局部图像区域/视频帧)+ source-supported facts(来自外部检索的事实)+ answer-producing operations(6 类:single-anchor lookup / multi-hop retrieval / knowledge-conditioned count / multi-anchor join / arithmetic / comparison) - 边:锚点↔事实、事实↔事实、事实↔操作的依赖关系
它的作用不是给模型"读"——是给数据构造、过程监督、operation-level 评测三个环节共用一张任务参考图。
2.2 数据引擎(VGEG-centered)
- 从视觉源出发 → 发现 visual anchors → 连到 verified web facts → 构造 compositional questions + 显式 evidence dependencies
- 用 VGEG 过滤 expert trajectories(要求答案正确 + 过程质量合格)
- 单图部分沿用
OpenSearch-VL(shawn0728)的数据 - 最终产出:SFT-110K + RL-10K(其中 RL 集只有 10K——对 RL 训练来说偏小)
2.3 EVGR(Evidence-aware Visual-Grounded Rubric reward)
RL 阶段的核心奖励: - 答案正确性 + 查询质量(标准 answer/query reward) - Trace:是否拿齐 VGEG 要求的事实(evidence traceability) - Ground:是否用对了图/区域/视频帧(visual grounding)
README 自报:full EVGR 比"答案+查询"基线在 6-benchmark 平均上多 3.8 分。这是论文消融里最实在的数字。
2.4 训练栈
- SFT:Qwen3-VL-8B + DeepSpeed + 110K 联合多模态轨迹
- RL:异步 agentic RL——
rLLM+verl+ Megatron-LM 后端 + SGLang 0.5.5 rollout + mbridge(HuggingFace↔Megatron 桥接) - 推理:统一 modality 入口
run_infer.py,共用 prompt/tools/backends/agent loop
3. 实验数字(来自 README/AIWeekly,未经独立核验)
3.1 主表
| 任务 | base + tools | OneSearch-VL-8B | Δ |
|---|---|---|---|
| 单图 7-bench 平均 | 42.0(Qwen3-VL-8B+tools) | 58.3 | +16.3 |
| OneSearch-MI-Bench(301 题,作者造) | 35.6 | 55.8 | +20.2 |
| OneSearch-Video-Bench(307 题,作者造) | — | — | +17.6 |
| VideoDR | 30.0 | 57.0 | +27.0 |
| 单图 vs OpenSearch-VL-8B | — | — | +1.7 |
3.2 消融
- 数据混合:joint SFT 取得最佳平均
- 奖励:full EVGR vs answer+query 在 6-bench 平均 +3.8
3.3 对照组清单(必须吐槽)
论文对照只跑了 base model + tools 和 OpenSearch-VL-8B: - ❌ 没有 GPT-4V / GPT-4o with tools - ❌ 没有 Gemini-2 / Claude-3.5 with tools - ❌ 没有 Qwen3-VL-30B-A3B / 72B with tools - ❌ 没有 WebVoyager / MMSearch / LiveVQA 上的独立复现 - ❌ 没有同尺寸 SimpleSearch-VL(Ant Group,2606,Qwen3-VL-8B/30B-A3B,5K SFT+2K RL,已开源)作为同期最强直接对照
4. 核心贡献(贡献判断)
| 维度 | 判断 |
|---|---|
| 统一多模态 Agent 范式 | 真实。把单图/多图/视频塞进同一 research policy + 同一工具环境,是有意义的工程抽象;VGEG 作为"任务共享参考图"的设计也比"prompt-template 拼接"干净。 |
| 证据级 RL 奖励 | EVGR 把 reward 从"答案对不对"扩到"证据集齐没 + 视觉锚点对不对"——这是 process supervision 在多模态 agent 上的一次严肃尝试,比 RAG/agent 圈常见的 answer-only reward 高一档。 |
| 自建 benchmark | 提供了任务维度的"6 类操作"分解(lookup / multi-hop / count / join / arithmetic / comparison),有结构化价值;但 301+307 的题量太小,且自建自评,统计检验能力有限。 |
| 开源完整度 | 模型 + SFT-110K + RL-10K + 两个 bench + 训练/推理/评测代码全部开源,对社区友好度高。 |
| 方法新颖度 | 中等偏弱。VGEG 本质是 task graph;EVGR 本质是 rubric reward;统一 agent 本质是 joint SFT+RL on a single backbone。没有任何组件是首创,组合方式也并非不可替代。 |
5. 主要问题(按严重程度排序)
5.1【致命】"自建基准胜利 + 弱对照"的组合问题(严重度 ★★★★★)
- +20.2 / +17.6 / +27.0 这三个最让标题光鲜的数字,全部来自 OneSearch-MI-Bench / OneSearch-Video-Bench 这两个作者自己造的、各 300 题左右的 bench。
- 对照只有 base model + tools——这是论文能挑出来最弱的对照(同尺寸同底座,自己数据训自己)。
- 一个数据 + 一个评测集 + 一个模型的闭环里写出的 +20 分,不能直接读作"统一多模态深度研究 Agent 取得 SOTA"。
- 必须等第三方在 MMSearch、LiveVQA、WebVoyager、VideoMME-Pro 这类外部既有 bench 上独立跑一遍 OneSearch-VL-8B 才有公信力。
5.2【重大】没有与同尺寸、同期、最强直接对手的对比(严重度 ★★★★☆)
- 同期最强对手 SimpleSearch-VL(Ant Group,arXiv 2606,Qwen3-VL-8B/30B-A3B,5K SFT + 2K RL + factorized adaptive rollout + evidence-verified reasoning)——论文里完全没有引、没有比。
- 同向还有 MM-DeepResearch、Visual-Seeker(Ant Group)也在 list 里。三家方法论差异极小(都是 Qwen3-VL-8B + SFT+RL + 多模态搜索),缺直接对比让 OneSearch-VL 的"统一多图+视频"立标无可信验证。
5.3【重大】机构缺失与作者列表问题(严重度 ★★★☆☆)
- AIWeekly 明确指出:"The paper does not list an affiliation in the version served on Hugging Face, and the gains against larger frontier VLMs with tools are not reported." 13 个作者、0 机构——这不符合 2026 年多模态 agent 主流团队(Ant Group、阿里、字节、DeepMind、OpenAI)的署名惯例。
- 风险点:(i) 可能是学生团队/小作坊工作,立标意义打折;(ii) 也可能是工业团队刻意匿名(review 阶段常见),但与开源完全度不匹配。
- 行动:等论文 v2 或 github commit history 给出机构信息再补审。
5.4【中等】RL 训练规模偏小(严重度 ★★★☆☆)
- SFT-110K + RL-10K。RL 集 10K 对单图/多图/视频三模态联合训练来说平均每模态只有 ~3K-4K 题,远低于 RL agent 圈常见的 30K-100K 规模。
- 异步 RL 栈(rLLM + verl + Megatron)堆得重,但 reward 是 rubric 而不是 model-based judge——意味着 rubric 质量上限就是 EVGR 上限,而 rubric 由 VGEG 派生,VGEG 由数据引擎生成,整条链都依赖数据引擎的工程正确性。
5.5【中等】评测操作"6 类"是否真的互斥且覆盖(严重度 ★★☆☆☆)
- 论文把任务切成 single-anchor lookup / multi-hop retrieval / knowledge-conditioned count / multi-anchor join / arithmetic / comparison 六类。
- 实际任务经常多类叠加(多图 arithmetic 同时是 multi-anchor join + arithmetic + multi-hop)。论文没有给出"一类/多类"的分布,也没给 per-operation 得分表。
- 没有 per-operation 数字,"6 类覆盖全面"只是说法不是证据。
5.6【低】底座规模固定在 8B(严重度 ★★☆☆☆)
- 全部数字来自 Qwen3-VL-8B。没有 30B-A3B 或 72B 缩放实验。
- 一篇号称"统一多模态深度研究"的论文不讨论缩放,会让审稿人质疑"是否只是把 OpenSearch-VL 的数据扩充到多图/视频"。
6. 可信度综合判断
| 维度 | 评分(1-5) | 说明 |
|---|---|---|
| 工程完整度 | 5 | 模型/数据/代码全开源,文档详尽,部署栈清晰 |
| 方法新颖度 | 2.5 | VGEG+EVGR 是清晰组合,但无首创组件 |
| 评测可信度 | 2 | 主战场是自建 benchmark + 弱对照 |
| 复现难度 | 中 | 110K SFT 数据需下载、RL 栈复杂(rLLM+verl+Megatron+SGLang) |
| 第三方独立验证 | 无 | HF 描述/Media 复述均来自作者方 |
| 工业落地潜力 | 3.5 | 单一 8B + 工具栈适合部署,但未给 latency/成本 |
综合可信度:2.5/5(中等偏低,立标证据不足)。
7. 复现建议(低成本快速验证 vs 高保真复现)
7.1 快速验证(1-2 张卡 + 1-2 天)
- 拉 OneSearch-VL-8B + OneSearch-MI-Bench/Video-Bench
- 跑一遍作者的 eval 脚本,确认 +20.2 / +17.6 / +27.0 这三个数字在自建 bench 上至少 90% 复现
- 同时跑 Qwen3-VL-8B-with-tools baseline,复现 base 数字
- 若三组数字都对得上 → 至少确认工程管道无造假
7.2 关键交叉验证(推荐,最低成本)
在 3 个外部既有 benchmark 上跑 OneSearch-VL-8B(不开新训练,只用作者权重): - MMSearch(多图搜索,2025) - LiveVQA 或 WebVoyager(单图 agent) - VideoMME-Pro 或 MLVU(视频理解)
如果 OneSearch-VL-8B 在这 3 个外部 bench 上都比 base Qwen3-VL-8B-with-tools 稳定超过 +5 分 → 立标可信度升到 ★★★ 如果其中 ≥1 个反而下降 → 立标崩盘,回到 OpenSearch-VL 的多模态扩展层级
7.3 高保真复现(不建议个人做)
重训 SFT-110K + RL-10K 需要 32-64 H100 + Megatron + rLLM 栈,不是个人/小团队能跑。建议等 Ant Group / 阿里等有同栈经验的团队来做。
8. 是否入库 / 建议路径
| 路径 | 建议 | 理由 |
|---|---|---|
notes/multimodal-deep-research-agent.md |
入 | 作为"统一多模态深度研究 Agent"立标候选,与 SimpleSearch-VL、MM-DeepResearch、Visual-Seeker 横向并列 |
notes/agent-rubric-reward-evgr.md |
入(合并到上面) | EVGR 作为 process-level rubric reward 的代表案例 |
reviews/onesearch-vl-review.md |
暂缓 | 等 §7.2 外部交叉验证完成后再写 review |
活文档 multimodal.md §0.2 十八向脉络 |
新增候选 | 在"多模态 Agent + 推理"小节加 OneSearch-VL / SimpleSearch-VL / Visual-Seeker / MM-DeepResearch 横向条目 |
活文档 multimodal.md §0.5 趋势 4(评估方法学) |
不入 | OneSearch-MI-Bench/Video-Bench 题量太小,不够支撑"自建 benchmark"立标 |
共享知识库 published/ |
暂不入 | 自我审稿未通过可信度门槛 |
9. 后续验证动作(最低优先级)
- 查作者机构:等论文 v2 或 github commit/issue 中暴露作者邮箱/机构
- 盯 SimpleSearch-VL 的 GitHub:看是否后续 paper 给出 OneSearch-VL 直接对比数字
- 第三方独立复现:HF papers 评论区、ThreeSR 列表维护者复现
- per-operation 数字:要求作者补 6 类操作 per-class 得分表
- 缩放实验:盯 30B-A3B / 72B 是否后续放出
10. 一句话给同行的提醒
"OneSearch-VL" 这三个最大涨幅数字是自建基准 + base 对照下的数字,引用时务必标注"+20.2 on self-built OneSearch-MI-Bench, not on external benchmark"。 等 SimpleSearch-VL 或第三方在 MMSearch 上独立跑一遍,再决定是否把"统一多模态深度研究"升级为多模态 agent 圈的 SOTA 立标。
附:建议写入路径
- 主稿(本文件):/shared/research-kb/inbox/flyp/2026-10-10-1550-flyP-critical-read-OneSearch-VL-unified-multimodal-deep-research-agent.md
- 后续若升 review:/shared/research-kb/inbox/flyp/2026-10-XX-flyP-review-OneSearch-VL.md(等外部交叉验证完成)
- 待活文档升档时:organized/knowledge/multimodal.md §0.2 十八向脉络 + §0.5 趋势 4 邻近项