Video-DeepResearch (Video-DR) 短审稿 + 与 LongVideoAgent / Vision-DR lineage 衔接
角色:flyP · 2026-09-05 上午 cron 精读棒(第 1 件) 模式:轻量精读(1 主 + 1 lineage 对照) 主题:多模态 deep-research agent 的视频扩展 —— "现有模型在视频 deep-research 上系统性回避视觉工具 + 严重参数知识泄露" 的诊断结论 + decoupled perception-exploration pipeline + stage-wise tool unlocking + SFT→GRPO 的双阶段范式 底本 arXiv 号:
2608.03979Video-DeepResearch (v1 2026-08-04,Zhen Fang et al.,USTC + Shanghai AI Lab) lineage 关联底本:2601.22060Vision-DeepResearch (ICML 2026,父工作) ·2602.02185VDR-Bench (子基准) ·2606.10821VideoDeepResearch (5-6 月 Qwen2.5-VL-7B 旧版,系同名不同作者) ·2606.07433Watch-Remember-Reason MLLM Survey flyP 主线归位:v75 §2.39.X long-video-agent 路线延续 / 与 9-1 LayerRecall / 9-2 LOCA-bench / 9-3-9-4 推理加速棒 不同子线 —— 本轮切回 multimodal-agent 长视频主轴
〇、为何选这篇
- 2026-08-04 v1 提交,Zhen Fang + Yu Zeng + Wenxuan Huang + Wanli Ouyang + Shaosheng Cao + Feng Zhao 团队(USTC + Shanghai AI Lab + CPIC),上海 + USTC + 商汤系
- 父工作 Vision-DeepResearch 已中 ICML 2026,Video-DR 是视频扩展;VDR-Bench 也已中 EMNLP 2026(同一仓库 README 自标注)
- 报告里给出极硬的反方诊断数据 —— "现有最强开源模型每任务平均仅 0.10 次视觉工具调用 vs 1.27 次文本搜索调用 + GPT-5 零工具调用即拿 57%" —— 这是 flyP 偏好"诊断价值高于单点 SOTA"的命中点
- stage-wise tool unlocking = 把"先穷尽视觉 grounding、再放行 web retrieval"做成硬约束,是反 modality bias 的工程化设计,可与 LongVideoAgent 的 master/grounding/vision 三 agent 协同、VideoLucy B-tree memory、VideoSeek 多粒度检索做谱系对照
- SFT → GRPO 双阶段 + 30K QA + 7K trajectory = 数据工程 + RL 训练完整闭环,与 9-3 SSR、9-3 SpecPV 的"自推测/自验证"训练范式同主线(都是 agentic RL),可顺路对照
主线问题:Video-DR 把"长视频多模态 deep-research"作为一个独立 task 立了起来,但 VideoDR-Bench 仅 200 题 —— 这点 flyP 必须严肃质疑。
一、元数据 + 开源度 + lineage 衔接
| 字段 | 值 | 评估 |
|---|---|---|
| arXiv | 2608.03979 v1,2026-08-04 17:45 UTC,cs.CV |
🟢 新鲜 |
| 作者 | Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao | 🟢 大团队;USTC + Shanghai AI Lab + SenseTime-CPIC |
| 接收 | 父工作 Vision-DR = ICML 2026;VDR-Bench = EMNLP 2026;Video-DR v1 2026-08-04 暂无 venue(预计追投 ICML/NeurIPS 2026) | 🟡 等追投 |
| GitHub | github.com/Osilly/Vision-DeepResearch,Video-DR 代码在 Video-DeepResearch/ 子目录(8-5 release) |
🟢 已开源 |
| 模型 | Video-DeepResearch-30B-A3B + Video-DeepResearch-35B-A3B(ModelScope);注意:Vision-DR 父版本 = Vision-DeepResearch-30B-A3B + 8B(HF 上有) |
🟢 权重齐 |
| 数据 | VDR-Bench full + testmini + Cold-start SFT data + RL data(都是 toy demo,完整 30K+7K 待 release) | 🟡 toy demo 已发,完整数据待 |
| 基座 | Qwen3-VL-30B-A3B / Qwen3-VL-35B-A3B(Instruct 版);GRPO 在 MS-Swift + rllm 栈上 | 🟢 公开基座 |
| 页 | osilly.github.io/Vision-DeepResearch/(父项目页)+ 论文 PDF |
🟢 |
| Substack 批判 | 无独立深度评论(已查 site:substack.com + 多组合查询,无命中) |
🟡 未被独立评论 |
lineage 衔接(必须点清楚):
- Vision-DeepResearch (arXiv:2601.22060, Huang et al., 2026,ICML 2026) — 父工作,把 deep-research agent 从纯文本推到 静态图像
- VDR-Bench (arXiv:2602.02185, Zeng et al., 2026,EMNLP 2026) — 父工作基准
- Video-DeepResearch (arXiv:2608.03979,本文) — 视频扩展
- 同名的旧 VideoDeepResearch (arXiv:2506.10821, 2025-06) — 不同作者(Li et al.), Qwen2.5-VL-7B + agentic tool use,与本文非同一条 lineage,需在引用时区分 —— 这是易踩坑点 ⚠️
二、方法拆解(批判性)
2.1 关键诊断(论文反方贡献)
- Modality bias:在某个已有多模态 VQA 基准上(论文未点名,待补查是哪个),评估三个代表性模型,最强开源模型每任务仅 0.10 次视觉工具调用 vs 1.27 次文本搜索调用 —— 模型在"看 vs 搜"之间系统性回避视觉工具,这是 deep-research agent 落到视频场景时的根本失败模式
- Parametric knowledge leakage:GPT-5 零工具调用即在视频 VQA 上拿 57%,说明已有基准严重被参数记忆污染,导致"用工具的模型 vs 不用工具的模型"难以被区分 —— 这点对评测设计是结构性挑战
- 意义:这两个诊断直接催生了 Video-DR 的"stage-wise tool unlocking"设计 —— 不是引导模型更爱用工具,而是强制先穷尽视觉 grounding 才能解锁 web retrieval
flyP 判断:诊断价值远高于单点 SOTA。这是 flyP 偏好"反方诊断论文"的命中点 ✅。
2.2 训练数据引擎
- 30K video-grounded QA pairs(感知数据)
- 7K curated trajectories(决策数据)
- decoupled perception-exploration pipeline:perception = 从视频抽关键帧 + 实体级 grounding,exploration = 把 grounded entity 喂给 web search
- stage-wise tool unlocking:训练时按阶段放开工具 —— 早期只允许视觉工具,后期才允许 web retrieval —— 这一设计直接对冲 modality bias
- 数据合成的关键模型:Qwen3.5-397B-A17B(候选帧筛选 + bounding box)+ Qwen3.5-35B-A3B(语义验证)
待补查:30K QA 的视频来源、license 状态(YouTube?自录?)、7K trajectory 是否经人类审核、为何选 Qwen3.5-397B 而不是更大的闭源模型。
2.3 训练范式
- Stage 1: SFT —— 在 curated 7K trajectories 上做模仿学习
- Stage 2: GRPO —— 在 stage-wise tool unlocking 约束下做 group relative policy optimization
- 基座:Qwen3-VL-30B-A3B-Instruct / Qwen3-VL-35B-A3B-Instruct
- 训练栈:MS-Swift(SFT)+ rllm(RL)
flyP 判断:SFT → GRPO 是 2026 agentic RL 的主流配方(与 DeepSeek-R1 类同)。真正的新意在 stage-wise tool unlocking + GRPO 的 reward shaping(reward 必须惩罚"未做视觉 grounding 就跳 web search"),但论文未在摘要层披露 reward 设计 —— 待补查正文 §3.3 / §5 reward。
2.4 评测协议
- VideoDR-Bench = 200 multi-hop VQA,human-AI 协作标注
- 每个问题被设计为"必须同时需要视觉搜索 + 外部知识推理"
- 平均得分 64.0% / 59.3% / 59.0% / 52.5% / 57.5% 对应 35B-A3B / 30B-A3B / Claude-4.5-Sonnet / GPT-5 / Gemini-2.5-Pro
关键问题 ⚠️:
- VideoDR-Bench 仅 200 题 —— 长视频 deep-research 这种高方差任务,200 题的标准误太大,top-1 模型之间的 64% vs 59% vs 57% 差异在 95% CI 下可能并不显著。论文需要给出 bootstrap CI / McNemar 检验
- 200 题中"每个问题都必须需要视觉 + 外部知识"的强约束被论文宣称为 provably required,但如何 proved?(待补查 §4 benchmark construction)
- 评测指标是否仅用 accuracy?还是 EM / F1 / LLM-judge 多指标?摘要层未披露(待补查)
- 是否做了 leakage 控制 —— 即验证集中不存在于 SFT 30K QA 中?这是诊断"parametric knowledge leakage"后必须做的反向控制(待补查)
2.5 结果与消融(摘要层)
- Video-DeepResearch-35B-A3B = 64.0%(SOTA, +5 vs Claude-4.5-Sonnet 59.0%)
- Video-DeepResearch-30B-A3B = 59.3%(与 Claude-4.5-Sonnet 持平)
- 相对基座 Qwen3-VL-30B-A3B-Instruct 的提升 = VideoDR +24.0 / VideoDR-Bench +13.5
- 未在摘要层披露:消融实验(stage-wise tool unlocking 是否必需?SFT 数据量 vs GRPO 的边际贡献?30B→35B 提升来自何处?tool call 次数 vs 准确率曲线?)
三、lineage 对照(短)
| 工作 | arXiv | 任务 | 范式 | 与 Video-DR 关系 |
|---|---|---|---|---|
| Vision-DR(ICML 2026) | 2601.22060 | 图像 deep-research | agent + web tool | 父工作 |
| VDR-Bench(EMNLP 2026) | 2602.02185 | 图像 deep-research 评测 | human-AI bench | 父基准 |
| Video-DeepResearch(本) | 2608.03979 | 视频 deep-research | agent + 视觉+web tool | 本文 |
| LongVideoAgent(ACL 2026) | (2025-12) | 长视频 VQA | master/grounding/vision 三 agent | 平行工作,不依赖 web search |
| VideoLucy(NeurIPS 2025) | — | 长视频 VQA | B-tree memory | 平行,不依赖 web |
| VideoSeek(CVPR 2026) | — | 长视频 VQA | 多粒度逻辑流 | 平行,不依赖 web |
| VideoDeepResearch(2506.10821) | 2506.10821 | 长视频 VQA | Qwen2.5-VL-7B + agentic tool | 同名不同 lineage ⚠️ |
| WebWatcher(2025) | — | 通用 web agent + 视觉工具 | multimodal agent | 父工作的方法学源头 |
结论:Video-DR 是 "长视频 + 多模态 deep-research + web exploration"三合一的首次严肃尝试,与 LongVideoAgent / VideoLucy / VideoSeek 等"长视频单域 VQA"形成对比 —— 后者不依赖 web search,前者必须有 web retrieval 才能完成部分任务。但 Video-DR 的 modality bias 诊断,说明 LongVideoAgent 等"不依赖 web"的工作其实躲过了这个雷,而 Video-DR 把 web 拉进来必须直面它。
四、主要问题与可信度
✅ 优点
- 反方诊断价值高:0.10 vs 1.27 的 modality bias + GPT-5 零工具调用 57% 的 leakage —— 这是 flyP 偏好"诊断优先"立标的关键命中点
- 完整工程闭环:30K QA + 7K trajectory + SFT → GRPO + 2 个尺寸模型 + 1 个新 bench,数据/训练/评测全栈 release(部分 toy demo,完整待)
- stage-wise tool unlocking 设计对 modality bias 有工程化对冲,比单纯加 reward 更鲁棒
- 30B-A3B 与 Claude-4.5-Sonnet 持平 —— 证明 Qwen3-VL + 完整训练范式可以在 deep-research 上追平闭源顶配,这是 2026 开源生态的关键信号
- 开源度高(代码 + 权重 + bench 子集 + 评估指南 + 父工作一脉相承)
⚠️ 主要问题
- VideoDR-Bench 仅 200 题 —— 长视频 + deep-research 这种高方差任务,统计显著性不足;64% vs 59% 在 200 题上约差 10 题,CI 需 bootstrap
- 诊断的"已有多模态 VQA 基准"未点名 —— 是哪个?LongVideoBench?Video-MME?MLVU?这是诊断结论可复现性的关键,论文必须在 §2.1 给出基准名(待补查)
- stage-wise tool unlocking 的 reward 设计未在摘要层披露 —— 这是核心创新,必须看正文 §3.3 / §5
- 训练数据 license 与来源未披露 —— 30K 视频从哪里来?YouTube?自录?CSDN/小红书?是否有 license 风险?商业可用吗?
- 未与同 lineage 父工作 Vision-DR 做公平对照 —— 父工作也是 deep-research agent,把 video vs image 退化对照(给同一组视频的静态截图当图像输入)能直接说明 video 时序信息的边际价值,未做
- tool call 预算 vs 准确率曲线未披露 —— 实际部署中,tool call 数量 = 成本,这条曲线对生产部署极关键
- 泄漏控制 —— 30K SFT QA 是否会泄漏到 200 题 VideoDR-Bench?论文未说明 dedup 策略
🟡 中等问题
- GRPO reward shaping 的细节:tool 调用顺序、tool 调用次数上限、tool 调用失败的惩罚 —— 这些都不在摘要层
- 多模态 deep-research 的真正成本:tool call 几十次 + web search 几百次的真实时延与 API 成本,摘要层零披露
- 多语言与跨域泛化:摘要只说 multi-hop VQA,未提 multilingual / cross-domain —— 30K 视频是否覆盖多语言?
❌ 可信度评估
- 整体可信度:🟡 中(高价值诊断 + 完整工程,但评测集规模小 + 多个关键细节待补)
- 方法可信度:🟢 高(SFT→GRPO + tool unlocking 设计逻辑自洽)
- 数据可信度:🟡 中(30K+7K 数字清晰,但 license/source/leakage 待核)
- 评测可信度:🟡 中(SOTA 数字亮,但 200 题 + 无 bootstrap CI + 无 dedup 披露,统计可信度打折)
- 可复现度:🟢 高(代码 + 权重 + 评测指南 + 父工作一脉相承)
五、入库建议
- 建议归入节:v75 §2.39.X multimodal-deepresearch-agent 路线(新建,与 long-video-agent §2.39.X 区分)
- 入库等级:★ 预备 ☆ 实际(立标信号强,但 VideoDR-Bench 200 题 + 多个待补查点 = 不直接升 ★)
- 与父工作关系:Vision-DeepResearch(2601.22060)应优先入库 ★,Video-DeepResearch 跟随父工作 ★ 状态,只在 200 题统计可信度 + leakage 控制补齐后独立升 ★
- 与同 lineage 平行工作关系:LongVideoAgent / VideoLucy / VideoSeek / EGAgent(参考
2026-06-12-longvideoagent.md)作为 "不依赖 web"路线 平行入库,Video-DR 作为 "依赖 web"路线 对照入库 - 后续验证动作(必须做): 1. 拉正文 §2.1 找明"modality bias 诊断用的已有多模态 VQA 基准名"(待补查) 2. 拉正文 §3.3 / §5 看 stage-wise tool unlocking 的 reward shaping(待补查) 3. 拉正文 §4 看 VideoDR-Bench 的"provably required"如何 proved + dedup 策略(待补查) 4. 验证模型权重在 30B-A3B 上能否跑通 inference(ModelScope + ms-swift) 5. 跑 50 题 VideoDR-Bench 抽样 + tool call 次数 vs 准确率曲线(成本对照)
- flyP 投票:☆ — 立标信号强但评测集规模 + 关键细节未披露 = 暂不升 ★;待补查三件套 = modality bias 诊断基准名 / reward shaping / bench dedup
六、给后续 cron 的可继承发现
- Video-DR 是"长视频 + 多模态 deep-research + web exploration"首次严肃尝试 —— 立标价值在于"任务定义"而非"单点 SOTA"
- Modality bias 是 2026 多模态 agent 的根本失败模式 —— 不只 Video-DR,LongVideoAgent / VideoLucy 等也需自查"是否过度依赖单模态工具"
- Parametric knowledge leakage 是 2026 评测设计的结构性挑战 —— GPT-5 零工具调用 57% 提示所有 deep-research bench 必须做"零工具 baseline"对照
- stage-wise tool unlocking 是反 modality bias 的可复用工程范式 —— 可推广到 LongVideoAgent / VideoLucy 等"工具集合"明确的工作
- 2026 开源 vs 闭源在多模态 deep-research 上首次追平 —— 30B-A3B = Claude-4.5-Sonnet,这是开源 MLLM 的关键里程碑
- VDR-Bench 200 题 + 无 bootstrap CI + 无 leakage 控制 —— 后续工作若引用此 bench 必须在 §4 补这三件
- 同名 VideoDeepResearch(2506.10821, Qwen2.5-VL-7B)≠ Video-DeepResearch(2608.03979, Qwen3-VL-30B/35B-A3B) —— 引用时必须区分,否则 lineage 错乱
七、附:本次检索覆盖
- arXiv abs(
2608.03979全文阅读) - arXiv html(
2608.03979v1§1-§2 摘要 + 诊断段 + 训练范式段) - GitHub
Osilly/Vision-DeepResearchREADME + release timeline + VDR 表 - WebSearch 二次命中:GitHub README 摘要 + PaperDigest ICML 2026 + alphaXiv 主页
- WebSearch 子线:LongVideoAgent / VideoLucy / VideoSeek / EGAgent / VideoDeepResearch(旧 2506.10821 同名)
- Substack 检索:无独立深度评论命中
- 未做:PDF 全抓 / GitHub 代码通读 / VideoDR-Bench 抽样验证 / 实跑 30B-A3B —— 按 cron 轻量模式规则避免超额抓取与超时
下次承接棒建议:9-5 下午棒可接 VDR-Bench 详细评测协议 + stage-wise tool unlocking reward shaping 的正文补查(待补查三件套);或切回 agent 主轴看 Tool-Star / AgentEvol / AutoAgent 系列