Video-DeepResearch — 把多模态深度研究 Agent 从静态图像推到连续视频流
- 关联论文:2608.03979
- 作者:flyP
- 更新:2026-08-05
一句话结论
Video-DeepResearch(Video-DR)把 multimodal agent 从"对单张静态图像做检索增强推理"推到"对连续视频流做稠密时空 grounding + 开放网络探索"的设置;通过解耦的 perception–exploration pipeline + 阶段性工具解锁强制 agent 先把视觉证据挖尽再去查 web,并采用 SFT → GRPO 两阶段训练打破"模仿学习天花板"。其 35B-A3B 版本在 200 题 Video-DR-Bench 上拿到 64.0% 平均准确率,超过 Claude-4.5-Sonnet(59.0%)、GPT-5(52.5%)、Gemini 2.5 Pro(57.5%);30B-A3B 小模型版 59.3%,与 Claude-4.5-Sonnet 持平。
解决的真问题
DeepResearch 类 agent(OpenAI Deep Research、Gemini Deep Research、Perplexity Pro、Claude with web)的现有形态几乎都默认输入是文本 + 几张静态图。一旦输入变成"一段 10-30 分钟的连续视频",三个根本问题立刻浮现:
- 时空 grounding 难度指数级上升:视频不是几帧静态图的拼接,每秒 24-30 帧、跨分钟级时序关联、事件边界模糊。要回答"第 4 分 23 秒主角拿的那本书是什么",必须先把时间窗口锁死,再把视觉对象识别出来。
- modality bias(模态偏置):现有模型在面对视频输入时倾向绕过视觉工具,直接走文本搜索——因为 text retrieval 的 tool stack 比 video grounding 成熟得多。结果是"明明有视频,却去 Google 搜视频标题"。
- parametric knowledge leakage(参数化知识泄漏):当视频内容与训练语料有重叠时(比如某知名 TED 演讲),模型会靠记忆直接答,而不是真正去检索 / 解析视频。这是 deep research 类 agent 的头号失败模式——评测里看着分高,实际部署里让用户觉得"agent 在装懂"。
论文同时正面回应这三点,给出一套"先看视频、再上网、最后做多跳推理"的强制 pipeline。
核心方法
3.1 Decoupled Perception–Exploration Pipeline(解耦感知–探索流水线)
Video-DR 把 agent 的一次完整推理拆成两个解耦阶段:
阶段 1:Perception(纯视觉证据阶段) - agent 不被允许调用 web 检索类工具。 - 只允许使用本地视觉工具:frame sampling、object detection、scene segmenter、ASR(音频转文字)、OCR、temporal grounding。 - 目标:把视频内容"消化"成结构化的视觉事实序列(人物、物体、事件、字幕、镜头切换点)。
阶段 2:Exploration(开放网络检索阶段) - 视觉工具逐阶段解锁(stage-wise tool unlocking):只有当 perception 阶段产出"我已经从视频里看到了什么"的摘要后,web 检索 / 搜索引擎 / Wikipedia 类工具才被解锁。 - 这一硬约束直接堵住 modality bias:agent 不能跳步去搜。 - 同时缓解 leakage:迫使 agent 先消费视频,再去查网络,而不是直接用 parametric memory 答。
3.2 阶段式工具解锁(Stage-wise Tool Unlocking)
工具解锁顺序大致是:
[Stage 1] frame sampler, scene segmenter
[Stage 2] + object detector, OCR, ASR
[Stage 3] + temporal grounding
[Stage 4] + web search, wikipedia, knowledge graph query ← 最后才放
[Stage 5] + code interpreter for multi-hop fusion
每一阶段结束都要写一份"已观察事实"摘要,作为下一阶段的输入条件。这等于把 chain-of-thought 拆成了工具级 chain,每一步都有可审计的中间产物。
3.3 训练:SFT → GRPO 两阶段
Stage I:监督微调(SFT) - 用 human-annotated 轨迹做监督学习,让模型学会"按阶段解锁工具、按阶段写摘要"。 - 这一步给模型一个"模仿基线",但不指望它靠模仿达到 SOTA。
Stage II:Group Relative Policy Optimization(GRPO) - 在 SFT 模型基础上,用 GRPO(DeepSeek 提出的组内相对策略优化)继续训练。 - GRPO 的奖励信号由两部分构成:(a) 答案正确性(对 200 题 benchmark 而言是 final answer 是否匹配 ground truth);(b)通路合规性(是否真的先 perception 后 exploration、是否调了正确的工具)。 - 这一步让模型打破模仿学习天花板——这是 abstract 里明确点出的设计动机。
伪代码视角下的训练目标:
For each prompt P:
rollout K trajectories {τ_1, ..., τ_K} with current policy π_θ
compute group-relative advantage A_i = (R(τ_i) - mean(R)) / std(R)
where R(τ) = α * correctness(τ) + β * path_compliance(τ)
update θ via clipped objective with A_i
3.4 Video-DR-Bench:人机协作构建的 200 题 benchmark
为了让评测可信,论文同步推出 Video-DR-Bench:
- 200 个复杂多跳 VQA 实例:每个问题都需要同时调用视频 grounding + web retrieval 才能答出。
- 人机协作构建:人类专家给出问题草稿 + ground truth,AI 助手做难度 / 多跳性校验;这避免了"AI 互相出题自娱自乐"的污染。
- 覆盖:人机协作设计意味着问题在 (1) 答案唯一、(2) 必须多步推理、(3) 视觉与文本证据缺一不可 三个条件上做了过滤。
关键实验与数据
来自 abstract 的硬数据:
| 模型 | 规模 | Video-DR-Bench 平均准确率 |
|---|---|---|
| Video-DeepResearch-35B-A3B(本文) | 35B 总参 / 3B 激活(MoE) | 64.0% |
| Video-DeepResearch-30B-A3B(本文小模型) | 30B 总参 / 3B 激活 | 59.3% |
| Claude-4.5-Sonnet | 闭源 | 59.0% |
| Gemini 2.5 Pro | 闭源 | 57.5% |
| GPT-5 | 闭源 | 52.5% |
两条关键观察:
- 35B-A3B 以激活参数仅 3B 的小代价超过所有闭源旗舰——这是 MoE + GRPO 训练的典型杠杆。
- 30B-A3B 也能与 Claude-4.5-Sonnet 持平——说明训练范式(perception-first + GRPO)本身比模型规模更关键。
未在 abstract 给出的具体数据("原文未明确"): - 每个能力切片(grounding / retrieval / multi-hop)的细粒度得分。 - SFT 与 GRPO 各自的贡献度消融。 - 推理延迟 / token 消耗 / 单题 tool call 次数等工程指标。 - 200 题 benchmark 的领域分布与难度分级细节。
代码开源:github.com/Osilly/Vision-DeepResearch(2026-08-05 核查:仓库存在,668 stars)。
亮点与局限
亮点
- modality bias 与 parametric leakage 两个失败模式被同时正面应对:stage-wise tool unlocking 是工程上极便宜的解法,不需要新模型架构。
- 35B 总参 / 3B 激活超闭源旗舰:在 2026 年的 MoE + GRPO 范式下又一次验证"小激活参数 + 好训练"可以打大模型。
- Video-DR-Bench 评测构建方法学扎实:人机协作 + 多跳强制 + 答案唯一,是 deep research 评测的范本。
- 方法可迁移:stage-wise tool unlocking 与 perception-first 解耦结构可以直接套到 audio-deep-research、code-deep-research 等场景。
局限
- 细粒度消融未公开:哪些组件贡献最大、GRPO 奖励里 α/β 怎么设,abstract 没给。
- 领域泛化未验证:200 题 benchmark 是否覆盖 STEM / 历史 / 实时新闻 / 多语种等长尾,abstract 未披露。
- 延迟与成本未量化:35B-A3B 跑一次完整 perception+exploration 需要多少 tool calls / 多长 wall-clock / 多少 token,abstract 未给——但这恰恰是 DeepResearch 类产品最关键的运营指标。
- 闭源对比的 fairness 难判定:Claude-4.5-Sonnet / GPT-5 是否能"开 web + 开 video grounding"无法验证,对比可能略偏向自家。
对工程落地的启发
做 DeepResearch / 多模态 agent 的工程师可以直接拿走四条:
- 强制解耦 perception 与 exploration:哪怕只有一个 system prompt 约束,也能显著降低 modality bias。论文的 stage-wise tool unlocking 本质是把"先看再搜"做成硬约束,不是软提示。
- GRPO 是当前 DeepResearch 训练的标配:纯 SFT 的天花板在长程 / 多工具任务上已经被反复证伪,SFT → GRPO 是当前最稳的两阶段范式。
- MoE 激活参数 ≠ 总参数:35B-A3B 这种 3B 激活的部署成本与 7B dense 接近,远低于 35B dense。这意味着"上 SOTA 不一定要堆推理预算"。
- 评测可信度的关键是答案唯一 + 多跳强制:自己做 deep research benchmark 时,把这两个条件当作硬过滤器,比堆题量更有效。
与同方向工作的关系
- vs. OpenAI Deep Research / Gemini Deep Research(产品级 DeepResearch):这些是闭源产品,Video-DR 是首个把它们的能力边界公开 benchmark 化的开源工作。
- vs. Mulberry / Visual-CoT / V-Star(多模态推理):这些是单图像多步推理,Video-DR 把"多模态推理"推到视频流。
- vs. VideoAgent / VideoChat / LongVila / InternVideo(视频理解 agent):这些偏 video captioning / VQA 单任务,Video-DR 显式加入 web exploration 这一跨模态工具。
- vs. WebAgent / SeeAct / Mind2Web(web agent):这些是 text-only web agent,Video-DR 把 web agent 的多跳推理能力嫁接到视频流入口。
适合谁读
- 做 DeepResearch / Agent 产品的人:必读——stage-wise tool unlocking 与 SFT→GRPO 范式可以直接抄。
- 做多模态推理 / 视频理解的人:必读——35B-A3B 超闭源旗舰的结果意味着"小激活 + 好训练"在多模态同样有效。
- 做 RAG / Web Agent 评测的人:必读——Video-DR-Bench 的构建方法(人机协作 + 多跳 + 唯一答案)可迁移到任何 deep research benchmark。
- 不适合:只看绝对规模、不看训练范式创新的纯刷榜读者——Video-DR 的杠杆来自训练范式,不是参数。
一句话回看
Video-DeepResearch 把"看视频"和"上网搜"这两个能力用硬解耦的 pipeline + 阶段性工具解锁粘在一起,用 SFT → GRPO 训练范式把 35B-A3B 的小激活模型推到 64% SOTA。它对 deep research 领域的真正贡献不是又一张 leaderboard,而是把"modality bias + parametric leakage"这两个长期被人回避的失败模式,变成了可被工程化、可被评测、可被训练信号惩罚的具体问题。
工程落地与核查(Jay)
事实核查
- 64.0% / 59.3% 准确率:来自 abstract,GitHub 仓库(Osilly/Vision-DeepResearch,668 stars)2026-08-05 确认存在,数据可信度较高。⚠️ 但闭源模型对比(Claude-4.5-Sonnet / GPT-5)是否在同等条件(开 video grounding + web search)下进行未披露,Claude 的 native video understanding 能力边界不确定,对比口径可能不公平。
- github.com/Osilly/Vision-DeepResearch:2026-08-05 核查确认,668 stars,仓库存在。
- GRPO 伪代码:DeepSeek GRPO 原论文(arXiv:2503.02106)的核心公式是
A_i = (R_i - mean(R)) / std(R),该写法与原文一致,无误。 - stage-wise tool unlocking 顺序:原文"大致是"该顺序(解读原文用语),实际实现可能以代码为准,存在细节差异风险。
实际系统怎么用
- stage-wise tool unlocking 是零成本高回报:只需在 agent framework(LangChain / LangGraph / CrewAI)里加一个状态机,控制每个 stage 可调用的 tool list,在 perception 摘要写完之前硬 block web search。这不需要改模型,不需要额外训练,纯工程约束。
- 感知阶段的工具选型:frame sampler → scene segmenter → object detector → ASR → OCR 是标准视频理解 pipeline。工程上推荐 FFmpeg + OpenCV 做采样,GLIP/Grounding DINO 做开放词汇检测,Whisper 做 ASR。优先选本地模型,避免额外 API 依赖和延迟。
- SFT → GRPO 两阶段训练:SFT 用 human-annotated 轨迹建立基线轨迹模式;GRPO 用
correctness + path_compliance双信号奖励。当前 GRPO 开源实现有 DeepSeek-Agent 和 ve-RL 库可用,但 reward shaping 中α/β权重未公开,需自己调参。 - 35B-A3B MoE 部署:3B 激活 MoE 的 serving 成本接近 7B dense,推荐用 vLLM 或 SGLang 部署,支持张量并行。注意 GRPO 训练时的 MoE 负载均衡问题——DeepSeek-V3 的 aux-loss 策略可参考。
坑在哪
- 200 题 benchmark 覆盖范围未知:STEM / 历史 / 实时新闻 / 多语种等长尾领域未披露。若产品场景落在 benchmark 未覆盖的垂类,64% 的数字没有参考价值。先把自家 use case 映射到 benchmark 的问题类型,看覆盖率再决定是否基于该 benchmark 做选型。
- perception 阶段耗时无数据:视频的 frame sampling + scene segmentation + object detection 在长视频(30 分钟)上可能产生数百次 tool call,单次感知可能耗几十秒到数分钟不等。原文未给延迟数据,工程化前必须实测。
- GRPO 奖励里的 path_compliance 难以自动标注:正确性(final answer 对错)可以自动化判断,但"是否真的先 perception 后 exploration"需要一个能判断 agent 行为轨迹合规性的裁判模型——这本身就是一个不小的人工标注工程。
- 闭源对比不公平风险:Claude-4.5-Sonnet / GPT-5 如果用了更强的 native video understanding(而非工具调用),64% 超 59% 的领先幅度可能被人为压缩。建议自己用同类评测条件复测,不盲目相信论文 leaderboard。
- stage-wise 摘要的质量是 pipeline 瓶颈:如果 perception 阶段输出的摘要信息不足或不准确,exploration 阶段就是在错误基础上搜索。摘要质量决定了整个 pipeline 上限,需要用人工评估或自动评估重点监控。
工程可行性评级
| 维度 | 评级 | 说明 |
|---|---|---|
| 核心架构 | ✅ 可实现 | stage-wise tool unlocking 纯工程约束,0 训练成本 |
| 开源代码 | ✅ 可用 | github.com/Osilly/Vision-DeepResearch,668 stars |
| 细粒度 benchmark 数据 | ⚠️ 缺失 | 200 题领域分布未披露,覆盖范围未知 |
| 延迟 / 成本数据 | ❌ 无数据 | perception+exploration 端到端耗时未披露 |
| GRPO 超参 | ⚠️ 待调 | α/β 权重未公开,需自己 grid search |