date: 2026-08-05 round: R2 arxiv: https://arxiv.org/abs/2608.01827 source: /shared/video-kb/scripts/tom/2026-08-05_R2_deepvoyager-vl-vision-in-loop-search-short-video-script.md
title: DeepVoyager-VL · 视觉证据前移 round: R2 date: 2026-08-05 slug: deepvoyager-vl-vision-in-loop-search
DeepVoyager-VL · 视觉证据前移
1. 标题与观众
- 标题:DeepVoyager-VL · 视觉证据前移
- 目标观众:多模态搜索 / RAG / Deep Search 方向研发工程师 / 工业级 MLLM Agent 平台架构师 / 知识助手产品经理
- 一句话核心观点:把视觉证据从输入/输出端前移到中间推理环节,让多模态搜索 Agent 在 10 个基准上稳定提升,且不依赖 RL。
3. 45-90 秒口播稿
多模态搜索 Agent,视觉一直只干两件事。 看图、答图,中间推理从来不参与。 DeepVoyager-VL 把视觉证据从首尾前移到中间推理环节。 核心引擎是多模态事件图,节点是事件、实体、视觉对象。 边是时序、因果、共现、空间。 用这张图合成带中间视觉依赖和长推理链的训练样本。 Agent 框架做主动视觉获取,显式决定现在该调一张图。 三种动作:文本检索、图像检索、按需图像加载。 视觉检索从配角升格为与文本检索并列的一等工具。 训练范式是 SFT-only,没有 RL。 10 个多模态搜索基准上稳定提升,30B-A3B 在 9/10 上最佳。 VisBrowse-Bench 最大 +30.7,平均 58.6。 论文未附 GitHub 仓库,按需图像加载要求环境暴露图像 API。 多模态 deep search 不等于文本检索增强,第十三视角补齐。
4. 镜头分镜
- 镜头 1 · 0-6 秒 · 标题卡
- 屏幕文字:DeepVoyager-VL · 视觉证据前移
- 画面元素:中央大字标题,右下 arXiv 编号 2608.01827,深蓝底 + 视觉光斑
- 运动方式:轻微推近,标题淡入
- 镜头 2 · 6-16 秒 · 风险卡
- 屏幕文字:视觉只在输入/输出端 · 中间步骤几乎不推动继续检索 · 没有为长程多轮设计
- 画面元素:三栏痛点并排,现有方法 / 期望 / 缺位三色对比
- 运动方式:三栏从左到右逐个点亮
- 镜头 3 · 16-30 秒 · 流程图
- 屏幕文字:多模态事件图 → 中间视觉依赖 · 长推理链 → 三种动作(文本检索 / 图像检索 / 按需图像加载)→ SFT-only
- 画面元素:左为事件图节点 + 边示意,中为合成样本流,右为 Agent 三动作分叉,尾标 SFT-only fine-tune
- 运动方式:事件图先入,样本流依次点亮,三动作分叉展开,SFT 节点缓推
- 镜头 4 · 30-46 秒 · 证据卡
- 屏幕文字:10 个基准 · 30B-A3B 9/10 最佳 · avg 58.6 · 最大 +30.7 (VisBrowse-Bench) · SFT-alone +55.2% / +44.0%
- 画面元素:四枚数字徽章排开 + 基准列表缩略,主色高亮最大提升
- 运动方式:数字徽章逐个弹入,基准列表横向滑动展示
- 镜头 5 · 46-60 秒 · 风险卡
- 屏幕文字:GitHub 0 命中 · 合成数据偏置 · SFT-only 长程天花板 · 按需图像加载依赖图像 API · 10 基准协议未完整公开
- 画面元素:五行警示条,黄色描边,首行加粗 GitHub 0 命中
- 运动方式:警示条由浅入深推进
- 镜头 6 · 60-76 秒 · 行动清单
- 屏幕文字:多模态事件图合成 · 中间视觉依赖约束 · 按需图像加载 first-class · SFT-only 也能打长程 · 事件图节点管理上下文
- 画面元素:五步清单竖排,序号加粗,逐条配图标
- 运动方式:逐条向上展开
- 镜头 7 · 76-90 秒 · 落版卡
- 屏幕文字:多模态 deep search ≠ 文本检索增强 · 视觉证据 ≠ 图注文本压缩 · 第十三视角补齐
- 画面元素:底部条幅,左侧 arXiv 编号,右侧关键限定语
- 运动方式:整体轻微上推并定版