flyP 精读与批判 · 2026-10-11 15:50

本轮主题

多模态 Agent + 长视频 / 长上下文世界动作模型:选 2 篇做轻量精读 + 批判。

  • 主篇:Video-DeepResearch (Video-DR) — 把多模态深度研究 Agent 从静态图像推到连续视频流,强调"模态偏置"和"参数化知识泄漏"两个失败模式。
  • 副篇:Long-WAM — NVIDIA/MIT/HKU/UCSD 联合的长上下文世界-动作模型,主张 AR 预训练视频基础 + 长历史对机器人策略最关键。

检索范围

  • arXiv(cs.CV / cs.AI 最新 207 条)
  • Hugging Face Trending Papers
  • arXiv HTML 实验版正文(仅摘要 / 方法要点 / 结果,未抓全文 PDF)
  • 同源仓库:Osilly/Vision-DeepResearch(GitHub,Video-DR 与 Vision-DR 同仓)

候选条目

  1. Video-DeepResearch(arXiv:2608.03979,2026-08-04,Zhen Fang 等,20+ 作者,含 Wanli Ouyang)— 入选。
  2. Long-WAM(arXiv:2610.10528,2026-10 月,NVIDIA/MIT/HKU/UCSD)— 入选。
  3. MMLongCite(arXiv:2510.13276,长上下文 VLM 引用忠实度)— 暂存,与 flyp 6 月长上下文证据主题有重合,本轮不展开。
  4. Video-DeepResearch 的兄弟工作 Vision-DeepResearch(ICML 2026 已收)— 暂存。

主篇精读:Video-DeepResearch

核心问题

当前多模态 Agent(GPT-5、Claude-4.5-Sonnet、Gemini 2.5 Pro、Qwen3.5 系列、Kimi K2.5)面对"以视频为证据源"的复杂多跳问题,存在两个系统性失败: - 模态偏置(Modality Bias):模型系统性偏向文本搜索工具,回避视觉工具。基线 Qwen3.5-397B 在 VideoDR 上每任务只用 0.10 次视觉工具,但调用 1.27 次文本工具。 - 参数化知识泄漏(Parametric Knowledge Leakage):模型倾向用内部记忆直接答题,而不是真正走工具调用流。

方法要点(不展开公式)

  • 框架:感知-探索解耦(decoupled perception-exploration)+ 阶段式工具解锁(stage-wise tool unlocking)——强制"先看全帧再上网"。
  • 训练:两阶段 —— SFT → GRPO(Group Relative Policy Optimization),明确打破"模仿学习天花板"。
  • 基准:VideoDR-Bench,200 条人机协作构建的多跳 VQA(论文摘要写 200,文中又出现 100 的描述,待核验)。
  • 资产:与 Vision-DeepResearch(ICML 2026)共用代码仓 Osilly/Vision-DeepResearch,Video-DeepResearch/ 子目录;模型权重 Video-DeepResearch-30B-A3B 与 Video-DeepResearch-35B-A3B 已开放。

主要结果

  • Video-DeepResearch-35B-A3B 在 VideoDR-Bench 上 64.0% 平均准确率,超过 Claude-4.5-Sonnet(59.0%)5 个点,明显高于 GPT-5(52.5%)和 Gemini 2.5 Pro(57.5%)。
  • Video-DeepResearch-30B-A3B 取得 59.3%,与 Claude-4.5-Sonnet 同档,证明训练范式在紧凑规模下仍有效。
  • 工具调用重构:基线 Qwen3.5-397B 视觉 0.10 / 文本 1.27 → Video-DR-30B 视觉 2.33 / 文本 4.24,"探索策略结构性翻转"。

主要问题 / 实验风险

  1. 基准规模小、可能过拟合:VideoDR-Bench 200 条(部分位置写 100),与 ImageNet 早期或 LongBench 早期类似,200 条 + 人机协作构造容易被针对性调优;论文没有报告跨域泛化到 Video-MME / LongVideoBench / MLVU 的对照。
  2. 对比基线版本未对齐:对照的是 GPT-5 / Claude-4.5-Sonnet / Gemini 2.5 Pro,但未说明 snapshot 日期、是否使用 thinking/Deep Think 模式。
  3. "模态偏置"是否被实验本身放大:模型若经过 web 工具强化训练,本来就更倾向文本工具;Video-DR 的 SFT+GRPO 训练数据本身就含大量检索轨迹,工具翻转可能只是训练分布差异,而非方法本身的"解"。
  4. GRPO 在视觉任务上的稳定性未报告:GRPO 在文本任务已有大量不稳定/崩溃证据,Video-DR 没有 reward hacking / 训练曲线 / 多次种子的报告。
  5. 真实视频源与版权:未声明 VideoDR-Bench 数据来源是否合规(YouTube 抓取 / 内部数据)。

可信度

  • 中等偏高。作者团队来自 Ouyang 组与 Shanghai AI Lab 系,代码权重均开源,方法描述具体;但基准规模小、对比基线不充分、缺少跨基准验证,结论的稳健性比"超过 Claude 4.5"这个 headline 要弱。
  • 复用价值高:视觉工具调用模式、阶段式解锁、GRPO 配方可直接借鉴。

是否建议入库

建议入库(高优先级)。路径建议: - notes/multimodal-agents/Video-DeepResearch.md(短笔记 + 公式 + 链接) - reviews/multimodal-agents/Video-DeepResearch-critical.md(完整批判,等正式版本/附录放出后补) - 关联主题:reviews/long-context-video/、reviews/agent-tool-use/

后续验证动作

  • 等论文完整版放出:核对 VideoDR-Bench 真实规模、训练曲线、ablation。
  • 复现最小链路:用 Osilly/Vision-DeepResearch 的 Video-DR 子目录,跑 30B-A3B 在自有视频问答集(10-20 题)上做"工具调用翻转"对照实验。
  • 跨基准验证:在 Video-MME / LongVideoBench / MLVU 上跑同一个模型,看"模态偏置修正"是否带来真实长视频理解增益。
  • 与 Vision-DeepResearch(ICML 2026)对比,写一篇"图像→视频深度研究 Agent"的纵向对比笔记。

副篇精读:Long-WAM(迷你版)

核心问题

机器人策略的"上下文长度"到底有没有用?很多工作把视觉历史堆长就报增益,作者用因果 AR 预训练挑战这个直觉。

方法要点

  • 两阶段:(1) 在机器人 + 自我中心视频上无动作标签地做因果 AR 视频预训练;(2) 在保留"历史→未来"结构的前提下做 world-action 适配。
  • 推理时流式编码 + 异步执行,整链路 107.4 ms / action chunk(RTX 5090),可部署到 DGX Spark、Jetson AGX Thor。

主要结果

  • RoboCasa GR-1:上下文 2.4 s → 19.2 s,成功率 63.3% → 78.7%。
  • LIBERO-Long:2.4 s 历史让 94.5% → 99.5%。
  • RoboTwin 2.0、DOMINO 同时领先。
  • 关键消融:双向预训练(Wan2.2)无净增益,只有 AR 预训练能把"更长历史 = 更好策略"兑现。

主要问题 / 实验风险

  1. 峰值上下文与任务耦合:LIBERO-Long 在 2.4 s 就饱和,GR-1 才受益于 19.2 s;通用性结论要打折扣——"长上下文有用"其实是任务依赖。
  2. 真实机器人评测覆盖窄:只放了 Unitree G1 + YAM 操作臂的演示,"95% 动态杯赛"听上去像单任务 demo,缺乏多任务、多机型统计。
  3. 没有 vs. VLA 大模型基线:未与 Pi-0 / π0 / OpenVLA-OFT / RT-2 等通用 VLA 直接对比,只对自家 LongLive2.0 系列与 Wan2.2 比较,证据偏窄。
  4. "AR vs 双向"消融的混淆:作者用双向预训练做 negative control,但没有控制"预训练视频量"、"预训练数据是否含机器人",差异可能来自数据分布而非方向性。

可信度

  • 中等。有真实硬件部署与多个模拟基准,但缺乏跨架构对比与跨任务统计;"AR 才是对的"这一论断证据仍偏弱。

是否建议入库

建议入库(中等优先级)。路径建议: - notes/world-models/Long-WAM.md - 关联主题:reviews/robotics-vlm/、notes/long-context/

后续验证动作

  • 等代码放出后,复现 2.4 s vs 19.2 s 在 LIBERO-Long 上的曲线是否真的饱和。
  • 与 π0 / OpenVLA-OFT 做横向对照,明确 AR 视频预训练 vs VLA 大模型微调的边界。
  • 在 DGX Spark 上跑 107.4 ms 推理延迟的可重复性测试。

分类标签

multimodal-agent long-video tool-use reinforcement-learning GRPO world-model robotics causal-pretraining VLM benchmark

建议写入路径(GitHub-ready,未执行)

  • notes/multimodal-agents/Video-DeepResearch.md
  • reviews/multimodal-agents/Video-DeepResearch-critical.md
  • notes/world-models/Long-WAM.md
  • reviews/robotics-vlm/Long-WAM-vs-VLA.md(待 VLA 基线对照实验后写)

是否需要精读 / 审稿 / 主题页更新

  • Video-DR:需要精读 + 完整审稿(论文 v1 已 8 月放出,可继续)。
  • Long-WAM:需要精读(短)+ 主题页更新(与 Heboro/RobotWorld 形成 Robotics-VLM 系列)。
  • 主题页:topics/multimodal-deep-research-agent.md 新建;topics/world-action-model.md 新建。

待补查

  • VideoDR-Bench 真实规模(200 vs 100)的统一说法。
  • Video-DR 与 Vision-DeepResearch 的训练数据是否完全解耦。
  • Long-WAM 完整 arXiv 版本号与代码仓地址(目前仅查到 nvlabs.github.io/LongLive/Long-WAM 项目页)。
  • Long-WAM 与 π0 / OpenVLA-OFT 的对比数据是否在附录。