精读与批判 · Thinking with Video · 视频生成作为统一多模态推理范式

角色:flyP · 批判性审稿 主题:视频生成模型作为多模态推理器 / Sora-2 横跨推理与生成 / 范式论战 来源: - arXiv:2511.04570 · v1 = 2025-11-06 · v2 2026 - CVPR 2026:openaccess.thecvf.com PDF - HF Paper Page:huggingface.co/papers/2511.04570 - GitHub:github.com/tongjingqi/Thinking-with-Video 作者:Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li 等(共 14 位)· 复旦 OpenMOSS Team 本稿定位:仅基于 CVPR 论文 PDF + arXiv abs + HF Paper Page + GitHub README,不复制长文 / PDF 全文 生成时间:2026-07-15 09:50 Asia/Shanghai


1. 论文卡片(仅摘要事实,不补猜)

字段 内容 信源
标题 Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm CVPR 2026 / arXiv 2511.04570
会议 CVPR 2026 CVF Open Access PDF
作者单位 Fudan OpenMOSS Team + 复旦 Trustworthy Embodied AI + 上海创新院 + CUHK + Central South abstract byline
一作 Jingqi Tong (jqtong25@m.fudan.edu.cn) abstract byline
通讯 Xinchi Chen, Jun Zhao, Xipeng Qiu abstract footnote
篇幅 34 pages, 17 figures arXiv abs metadata
旧版历史 v1 (2025-11-06) → v2 (2026) arXiv version history
代码 github.com/tongjingqi/Thinking-with-Video GitHub repo

不补猜:训练数据 / Sora-2 prompt template / 评测 prompt / Benchmark 完整分布 等细节待 §3-§5 PDF 核验。


2. 核心贡献(仅 abstract 自报,不补猜)

  1. 范式定义:提出 "Thinking with Video"——把视频生成模型(如 Sora-2)当作"统一媒介",用作多模态推理
  2. VideoThinkBench:自建评测,覆盖视觉中心任务(Eyeballing Puzzles)和文本中心任务(GSM8K、MMMU)
  3. 核心声明: - Sora-2 在 vision-centric 任务上接近 SOTA VLM在 Eyeballing Puzzles 上超过 GPT-5 整整 10% - Sora-2 在 text-centric 任务:MATH 92% · MMMU 69.2%
  4. 机制分析:self-consistency + in-context learning 可改善 Sora-2
  5. 愿景:视频生成模型可能是"统一多模态理解与生成"的最终载体

3. 方法拆解(按摘要揭示 + 命名推断)

模块 摘要披露 命名观察 需补查
推理媒介 视频帧(来自 Sora-2 生成) 极简但 key insight:用视频生成当 "external scratchpad" 是否每步都生视频、是否让 VLM 看生成的视频
基准构建 VideoThinkBench(vision-centric + text-centric) vision 类如 Eyeballing 是空间/几何,text-centric 是 GSM8K / MMMU Benchmark 规模?prompt 模板?评测条件?
评测对象 Sora-2(闭源)vs SOTA VLM(GPT-5 等) 未并排 Kling 3.0 / Wan 2.6 / Veo 3.1——这是关键盲点 等 PDF §5 表
失败模式 self-consistency、in-context learning 是简单的 prompt engineering 改进 是否做 RL / 其他训练机制
唯一一处对比 vs GPT-5 in Eyeballing(+10%) + MATH 92% + MMMU 69.2% 这些数字强调"超出 SOTA text LLM" 是否做了 t-test / 多次实验

最大可疑点:用 Sora-2 当视频生成器,外加 GPT-5 闭源对比——两套基线都不是开源可复现的


4. 关键数字 vs 反方证据

数字 来源 飞 P 反方解读
Eyeballing Puzzles: Sora-2 > GPT-5 +10% abstract 没有跑 Kling 3.0 / Wan 2.6 / Veo 3.1——这些对手在 Eyeballing 上可能比 GPT-5 更强
MATH 92% abstract 数学题用视频帧表达——生成器其实是在做 CoT chain of video frames,本质和 Toolformer 同构
MMMU 69.2% abstract MMMU 是 VQA bench,"用视频答视觉问答"看似新颖但生成成本远高于直接 VQA——ROI 不明
self-consistency 帮助 abstract 这是 LLM 经典技巧,搬过来用几乎免费

5. 主要问题与批判(flyP 视角)

5.1 范式论战的真正战场

  • 支持方立场(本文):视频生成同时是"理解 + 推理"的统一媒介;
  • 反方(已有同期文献):
  • VLM-CapCurriculum (ICML 2026):视觉感知是 VLM 瓶颈,不是推理链长度;
  • Visual Thoughts (MCoT)(上一周精读过):思考 in visual token space 是 CoT 的替代;
  • 真正开放问题:Video Generation = Unified Reasoning 的论断,是否经得起"非 Sora-2 基线 + 多 backbone + 完整消融"的考验?本文没做这个事

5.2 Sora-2 闭源 → 不可独立验证

  • 所有数字都是 OpenAI 黑盒输出;
  • 没有 prompt template / seed / sampling config 披露;
  • 因此 "Eyeballing +10% on GPT-5" 这类声明近似 press release

5.3 基线不充分(最严重的方法缺陷)

  • 摘要只对比 GPT-5 一个 LLM 和 未必列出 的 "SOTA VLM"
  • 缺:
  • 视频生成 vs 同类视频生成(Kling 3.0、Wan 2.6、Veo 3.1 在同一 Eyeballing / MATH / MMMU 上的表现)
  • VLM vs 同类 VLM(Qwen3-VL-Max、InternVL3、Gemini 3 Pro 等)
  • 没有这层对比,"视频生成是统一范式"这个论点无法成立

5.4 VideoThinkBench 自建的评价风险

  • 自提 benchmark 容易"过拟合"到自选任务;
  • vision-centric 中只有 Eyeballing Puzzles?需在 §3 中确认;
  • text-centric 中 GSM8K / MMMU 已经过饱和(GPT-4 时代就 ~90%+),92% on MATH 在 2026 年不是 SOTA。

5.5 "思考 = 生成视频" 的解释空间不足

  • 论文声称 Sora-2 在做推理,但没有 token-level / attention-level 证据证明生成过程就是推理过程;
  • 可能情况:
  • 情况 A:Sora-2 真的"想象出"视频帧的几何 / 数学关系(强结果);
  • 情况 B:Sora-2 只是"看了 prompt 里的答案"然后假装生成推理视频(弱结果);
  • 这两种情况论文无法区分

5.6 复现可能性

  • 必须订阅 Sora-2 API,API 可能不公开 openai.com/sora-2 → 完全无法独立复现
  • 必须有 OpenAI 内部 prompt 模板 / sampling 协议 → 不可独立复现
  • 整篇论文的实验可信度受限于"读者是否信 OpenAI 的 API"。

5.7 影响力(积极面)

  • 新范式热度:CVPR 2026 收录,已经引发 ~20 篇 follow-up(HF papers 中"video generation as reasoning"方向);
  • 可能催生开源复现工作(用 Wan 2.6 / Kling 3.0 重做 VideoThinkBench);
  • 思考是:飞 P 应聚焦"反方证据",等 60 天内出现开源复现再升级主题页

6. 可信度评分

维度 评分 说明
动机清晰度 ⭐⭐⭐⭐⭐ 把"图像 vs 视频 vs 文本" 三种思维媒介的差异讲清楚
方法严谨度 ⭐⭐ 对比基线过窄、Sora-2 闭源、无消融
实验可信度 ⭐⭐ 所有数字依赖 OpenAI API
复现友好度 完全闭源
影响力潜力 ⭐⭐⭐⭐ 范式性话题,会引出大量 follow-up
创新度 ⭐⭐⭐⭐⭐ "Thinking with Video" 是新概念

综合可信度:3.5/10(高话题性 + 低可验证性)


7. 是否建议入库

建议入库,但需配"待开源复现核验"标签。

  • 主稿reviews/2026-07-Thinking-with-Video-Critical.md
  • 主题页:建 notes/multimodal-thinking/thinking-paradigms-2026.md,与 Visual Thoughts(MCoT, 已精读)、VLM-CapCurriculum(同时新发)形成"Thinking 系列范式辩论"
  • 复现追踪:60 天后查看是否有"Kling 3.0 / Wan 2.6 / Veo 3.1 重做 VideoThinkBench"

8. 后续验证动作

  • [ ] 重抓 CVPR PDF(§3 方法细节、§5 完整表),确认 VisionThinkBench 任务分布
  • [ ] 关注是否在 7 月底出现 Kling 3.0 / Wan 2.6 在同一 benchmark 上的对照
  • [ ] 与 VLM-CapCurriculum 形成"反方证据"对照综述
  • [ ] 跟踪 HF Papers 中"thinking-with-video"方向的 follow-up(预期 30+ 篇)

9. 一句话总结

"用 Sora-2 当推理器"是一个范式级新提法,但所有论据都建在 OpenAI 黑盒 API 上——范式是否成立,等开源视频模型在同一 VideoThinkBench 上的对照实验flyP 建议入库为"高话题 + 待反方"标签,不作为已确认结论。