精读与批判 · Thinking with Video · 视频生成作为统一多模态推理范式
角色:flyP · 批判性审稿 主题:视频生成模型作为多模态推理器 / Sora-2 横跨推理与生成 / 范式论战 来源: - arXiv:2511.04570 · v1 = 2025-11-06 · v2 2026 - CVPR 2026:openaccess.thecvf.com PDF - HF Paper Page:huggingface.co/papers/2511.04570 - GitHub:github.com/tongjingqi/Thinking-with-Video 作者:Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li 等(共 14 位)· 复旦 OpenMOSS Team 本稿定位:仅基于 CVPR 论文 PDF + arXiv abs + HF Paper Page + GitHub README,不复制长文 / PDF 全文 生成时间:2026-07-15 09:50 Asia/Shanghai
1. 论文卡片(仅摘要事实,不补猜)
| 字段 | 内容 | 信源 |
|---|---|---|
| 标题 | Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm | CVPR 2026 / arXiv 2511.04570 |
| 会议 | CVPR 2026 | CVF Open Access PDF |
| 作者单位 | Fudan OpenMOSS Team + 复旦 Trustworthy Embodied AI + 上海创新院 + CUHK + Central South | abstract byline |
| 一作 | Jingqi Tong (jqtong25@m.fudan.edu.cn) | abstract byline |
| 通讯 | Xinchi Chen, Jun Zhao, Xipeng Qiu | abstract footnote |
| 篇幅 | 34 pages, 17 figures | arXiv abs metadata |
| 旧版历史 | v1 (2025-11-06) → v2 (2026) | arXiv version history |
| 代码 | github.com/tongjingqi/Thinking-with-Video | GitHub repo |
不补猜:训练数据 / Sora-2 prompt template / 评测 prompt / Benchmark 完整分布 等细节待 §3-§5 PDF 核验。
2. 核心贡献(仅 abstract 自报,不补猜)
- 范式定义:提出 "Thinking with Video"——把视频生成模型(如 Sora-2)当作"统一媒介",用作多模态推理
- VideoThinkBench:自建评测,覆盖视觉中心任务(Eyeballing Puzzles)和文本中心任务(GSM8K、MMMU)
- 核心声明: - Sora-2 在 vision-centric 任务上接近 SOTA VLM,在 Eyeballing Puzzles 上超过 GPT-5 整整 10% - Sora-2 在 text-centric 任务:MATH 92% · MMMU 69.2%
- 机制分析:self-consistency + in-context learning 可改善 Sora-2
- 愿景:视频生成模型可能是"统一多模态理解与生成"的最终载体
3. 方法拆解(按摘要揭示 + 命名推断)
| 模块 | 摘要披露 | 命名观察 | 需补查 |
|---|---|---|---|
| 推理媒介 | 视频帧(来自 Sora-2 生成) | 极简但 key insight:用视频生成当 "external scratchpad" | 是否每步都生视频、是否让 VLM 看生成的视频 |
| 基准构建 | VideoThinkBench(vision-centric + text-centric) | vision 类如 Eyeballing 是空间/几何,text-centric 是 GSM8K / MMMU | Benchmark 规模?prompt 模板?评测条件? |
| 评测对象 | Sora-2(闭源)vs SOTA VLM(GPT-5 等) | 未并排 Kling 3.0 / Wan 2.6 / Veo 3.1——这是关键盲点 | 等 PDF §5 表 |
| 失败模式 | self-consistency、in-context learning | 是简单的 prompt engineering 改进 | 是否做 RL / 其他训练机制 |
| 唯一一处对比 | vs GPT-5 in Eyeballing(+10%) + MATH 92% + MMMU 69.2% | 这些数字强调"超出 SOTA text LLM" | 是否做了 t-test / 多次实验 |
最大可疑点:用 Sora-2 当视频生成器,外加 GPT-5 闭源对比——两套基线都不是开源可复现的。
4. 关键数字 vs 反方证据
| 数字 | 来源 | 飞 P 反方解读 |
|---|---|---|
| Eyeballing Puzzles: Sora-2 > GPT-5 +10% | abstract | 没有跑 Kling 3.0 / Wan 2.6 / Veo 3.1——这些对手在 Eyeballing 上可能比 GPT-5 更强 |
| MATH 92% | abstract | 数学题用视频帧表达——生成器其实是在做 CoT chain of video frames,本质和 Toolformer 同构 |
| MMMU 69.2% | abstract | MMMU 是 VQA bench,"用视频答视觉问答"看似新颖但生成成本远高于直接 VQA——ROI 不明 |
| self-consistency 帮助 | abstract | 这是 LLM 经典技巧,搬过来用几乎免费 |
5. 主要问题与批判(flyP 视角)
5.1 范式论战的真正战场
- 支持方立场(本文):视频生成同时是"理解 + 推理"的统一媒介;
- 反方(已有同期文献):
- VLM-CapCurriculum (ICML 2026):视觉感知是 VLM 瓶颈,不是推理链长度;
- Visual Thoughts (MCoT)(上一周精读过):思考 in visual token space 是 CoT 的替代;
- 真正开放问题:Video Generation = Unified Reasoning 的论断,是否经得起"非 Sora-2 基线 + 多 backbone + 完整消融"的考验?本文没做这个事。
5.2 Sora-2 闭源 → 不可独立验证
- 所有数字都是 OpenAI 黑盒输出;
- 没有 prompt template / seed / sampling config 披露;
- 因此 "Eyeballing +10% on GPT-5" 这类声明近似 press release。
5.3 基线不充分(最严重的方法缺陷)
- 摘要只对比 GPT-5 一个 LLM 和 未必列出 的 "SOTA VLM"
- 缺:
- 视频生成 vs 同类视频生成(Kling 3.0、Wan 2.6、Veo 3.1 在同一 Eyeballing / MATH / MMMU 上的表现)
- VLM vs 同类 VLM(Qwen3-VL-Max、InternVL3、Gemini 3 Pro 等)
- 没有这层对比,"视频生成是统一范式"这个论点无法成立。
5.4 VideoThinkBench 自建的评价风险
- 自提 benchmark 容易"过拟合"到自选任务;
- vision-centric 中只有 Eyeballing Puzzles?需在 §3 中确认;
- text-centric 中 GSM8K / MMMU 已经过饱和(GPT-4 时代就 ~90%+),92% on MATH 在 2026 年不是 SOTA。
5.5 "思考 = 生成视频" 的解释空间不足
- 论文声称 Sora-2 在做推理,但没有 token-level / attention-level 证据证明生成过程就是推理过程;
- 可能情况:
- 情况 A:Sora-2 真的"想象出"视频帧的几何 / 数学关系(强结果);
- 情况 B:Sora-2 只是"看了 prompt 里的答案"然后假装生成推理视频(弱结果);
- 这两种情况论文无法区分。
5.6 复现可能性
- 必须订阅 Sora-2 API,API 可能不公开 openai.com/sora-2 → 完全无法独立复现;
- 必须有 OpenAI 内部 prompt 模板 / sampling 协议 → 不可独立复现;
- 整篇论文的实验可信度受限于"读者是否信 OpenAI 的 API"。
5.7 影响力(积极面)
- 新范式热度:CVPR 2026 收录,已经引发 ~20 篇 follow-up(HF papers 中"video generation as reasoning"方向);
- 可能催生开源复现工作(用 Wan 2.6 / Kling 3.0 重做 VideoThinkBench);
- 思考是:飞 P 应聚焦"反方证据",等 60 天内出现开源复现再升级主题页。
6. 可信度评分
| 维度 | 评分 | 说明 |
|---|---|---|
| 动机清晰度 | ⭐⭐⭐⭐⭐ | 把"图像 vs 视频 vs 文本" 三种思维媒介的差异讲清楚 |
| 方法严谨度 | ⭐⭐ | 对比基线过窄、Sora-2 闭源、无消融 |
| 实验可信度 | ⭐⭐ | 所有数字依赖 OpenAI API |
| 复现友好度 | ⭐ | 完全闭源 |
| 影响力潜力 | ⭐⭐⭐⭐ | 范式性话题,会引出大量 follow-up |
| 创新度 | ⭐⭐⭐⭐⭐ | "Thinking with Video" 是新概念 |
综合可信度:3.5/10(高话题性 + 低可验证性)
7. 是否建议入库
✅ 建议入库,但需配"待开源复现核验"标签。
- 主稿:
reviews/2026-07-Thinking-with-Video-Critical.md - 主题页:建
notes/multimodal-thinking/thinking-paradigms-2026.md,与 Visual Thoughts(MCoT, 已精读)、VLM-CapCurriculum(同时新发)形成"Thinking 系列范式辩论" - 复现追踪:60 天后查看是否有"Kling 3.0 / Wan 2.6 / Veo 3.1 重做 VideoThinkBench"
8. 后续验证动作
- [ ] 重抓 CVPR PDF(§3 方法细节、§5 完整表),确认 VisionThinkBench 任务分布
- [ ] 关注是否在 7 月底出现 Kling 3.0 / Wan 2.6 在同一 benchmark 上的对照
- [ ] 与 VLM-CapCurriculum 形成"反方证据"对照综述
- [ ] 跟踪 HF Papers 中"thinking-with-video"方向的 follow-up(预期 30+ 篇)
9. 一句话总结
"用 Sora-2 当推理器"是一个范式级新提法,但所有论据都建在 OpenAI 黑盒 API 上——范式是否成立,等开源视频模型在同一 VideoThinkBench 上的对照实验。flyP 建议入库为"高话题 + 待反方"标签,不作为已确认结论。