CoT-Edit · Let CoT Guide Instruction Video Editing · 批判性精读

角色:flyP · 批判性审稿 主题:指令驱动视频编辑 / MLLM-as-planner / 计划-引导-编辑框架 来源:CVPR 2026 Open Access · https://openaccess.thecvf.com/content/CVPR2026/papers/Liang_CoT-Edit_Let_CoT_Guide_Instruction_Video_Editing_CVPR_2026_paper.pdf 作者:Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen(USTC + 中关村院 + 清华) 本稿定位:仅基于论文摘要 + CVPR 页元数据 + web 搜索结果,不抓全文 PDF(PDF 流为 pikeppdf 编码,文本提取乱码;不强行重抓) 生成时间:2026-07-14 09:50 Asia/Shanghai


1. 论文卡片(仅摘要事实,不补猜)

字段 内容 信源
标题 CoT-Edit: Let CoT Guide Instruction Video Editing CVPR 2026 Open Access
会议 CVPR 2026(IEEE Conference on Computer Vision and Pattern Recognition) PDF metadata(pikepdf 10.5.1 转码,提交日 2026-05-16)
作者单位 USTC(陈志波组)/ 中关村院 / 清华(张友亮) abstract byline
一作 Sen Liang(USTC, liangsen@mail.ustc.edu.cn) abstract byline
通讯 Xin Li, Zhibo Chen abstract footnote
仓库 / 权重 截至 2026-07-14 论文 PDF 内未发现 GitHub/HF 链接 仅在 abstract & 引言中扫到 cvf.com PDF URL,无 github.com 出现
arXiv 镜像 未在 web 搜索中找到 arXiv 链接 search 命中的均为 CVF PDF;无 arXiv abs 出现
标签 #video-editing #MLLM-planner #CoT #diffusion #CVPR2026 自定

不补猜:未在摘要中确认具体 MLLM 型号 / diffusion editor backbone(猜测 CogVideoX / SVD / AnimateDiff 都不补)/ 训练数据规模 / 评估基准具体数字。等待 PDF §3-§5 核验。


2. 核心贡献(仅 abstract 自报,不补猜)

  1. plan–guide–edit 框架:把"语义意图"和"空间执行"显式解耦 —— abstract 自报
  2. MLLM-as-planner:用 CoT 增强的 MLLM 对视频和指令做结构化推理,输出"精确序列的 bounding boxes + 属性增强的编辑指令" —— abstract 自报
  3. diffusion-based editor:把 masks、enriched instructions、frame features 融合做高保真编辑,并要求"temporally coherent + spatially well aligned" —— abstract 自报
  4. 解决痛点:纯文本 prompt 在复杂场景下"无法捕捉精确空间关系和物理约束,导致目标歧义与物理上不可能的结果" —— abstract 自报

3. 方法拆解(仅基于摘要 + 命名推断,不补猜 backbone)

模块 摘要披露 命名观察 可疑/需补查
Planner "CoT-enhanced multimodal large language model" CoT-Edit 命名直接对应 MLLM 是哪个?Qwen2.5-VL / LLaVA-OneVision / 自训?——等待补查 PDF §3
Plan 输出 "sequence of bounding boxes + attribute-enriched editing directives" 类似 Set-of-Mark / G-DINO / Grounded-SAM 的范式 是否做第一帧 spatial grounding?是否多帧一致?——等待补查 §3
Editor "diffusion-based editor" 大概率是 image-to-video diffusion 改造(CogVideoX / SVD / AnimateDiff) 是否复用 Vidu / Sora 风格的长期一致性?——等待补查 §4
数据 未在 abstract 中点名 —— 数据集是自构还是基于 Instruct-V2V / EditVerse?——等待补查 §5
评估 "temporally coherent + spatially well aligned" 评估指标未点名 是否跑 VBench-Edit / EditVerse-Bench / DAVIS / User Study?——等待补查 §6

不补出 vLLM / SGLang 类推断;不补"是否用 IP-Adapter / ControlNet / ReferenceNet"等具体机制;不补"具体 prompt 模板"。


4. 复现风险 / 反方审稿(六条可证伪,每条挂"待核验")

4.1 计划-编辑解耦本身并不新

  • 计划-编辑解耦的范式早在 LangChain / ReAct / Visual ChatGPT 时代就存在;视频领域有 InsV2V、Ground-A-Video、Video-P2P 等都做过"先 plan 再 edit"
  • 可证伪判定:若 §3 的"plan 结构"是简单的"指令→bbox 列表",则贡献点退化为"工程集成 + 调参"; 若 plan 内部是 multi-step CoT 推理链(track→segment→attribute modify→temporal align),则属于实质性贡献
  • 判定依赖:PDF §3 图示 + plan 输出的 JSON schema

4.2 MLLM planner 与 editor 之间的"信号瓶颈"

  • 摘要声称 MLLM 输出"bbox + attribute-enriched directives"。但 bbox 是 2D 静态框 → 编辑器需要 mask + 时间维度属性(如"在第 3-5 秒淡入")
  • 可证伪判定:若 MLLM 输出不含时间戳 / 关键帧编号 / segment-id,则 editor 端要么手工规则后处理(弱)、要么学不到时序编辑(弱)
  • 判定依赖:PDF §3.2 计划格式定义 + §4.1 editor 输入

4.3 "物理上不可能"这个靶子 vs 实测

  • abstract 把"physically implausible outcomes"列为要解决的核心问题,但没说用什么方法去约束物理
  • 可能性 A:靠 MLLM plan 阶段判断(语言层物理常识,弱)
  • 可能性 B:editor 阶段用 physics-aware loss / constraint(强,但 diffusion 中加入物理约束工程难度高)
  • 可证伪判定:若仅靠 A,则"物理合理性"实际靠数据集分布 + MLLM 常识,论文贡献与 SOTA Instruct-V2V / EditVerse 拉不开差距

4.4 评估的"硬"与"软"

  • "temporally coherent + spatially well aligned" 是定性说法。需要核对:
  • 是否跑 VBench-Edit(Subject Consistency / Background Consistency / Motion Smoothness)?
  • 是否给 pixel-level mask IoU + 编辑区域 FID?
  • 是否有人类 user study(人数 / 视频数 / pairwise)?
  • 可证伪判定:若只有"user study 偏好 N=20" + 几张定性图,则证据等级 C;若有 VBench 完整表 + 消融 + 多模型对位,则 A

4.5 与同期工作的对位(同期 SOTA)

CVPR 2026 同期(已公开的 paper/project page 检索):

  • GIVE: Generic Instructional Video Editing(CVPR VGBE 2026 workshop,xiangbogaobarry):VBench-based 自动化评估
  • InstructX(arXiv 2510.08485,2025-10):MLLM 引导的图像+视频统一编辑,强调"image-only training emerges video editing"
  • Omni-Video 2(arXiv 2602.08820v2):MLLM 条件扩散的编辑 prompt reasoner
  • Vidu S1(2026-07,flyP 已 7-13 精读过):实时交互编辑
  • 可证伪判定:若 CoT-Edit 表格里只对位 InsV2V / Ground-A-Video 这类 2024 老 baseline 而不与 GIVE / InstructX / Omni-Video 2 / Vidu S1 比,则实验覆盖度不足

4.6 开源与权重不透明

  • 截至 2026-07-14,CVF PDF 内无 GitHub 链接web 搜索未命中 arXiv 镜像
  • Chen Zhibo 组此前有 VCD-Net / All-in-One 等工作均开源,但本篇是否跟随传统不可知
  • 可证伪判定:若 7 月底前(≤ 2026-07-31)放 GitHub,则风险降;否则科研复现门槛偏高

5. 与本知识库已有产出的对位

已精读条目 时间 关联点 差异
LingBot-Video 2026-07-13 同为视频生成+编辑方向 LingBot 是 MoE 视频生成,CoT-Edit 是编辑专用
Vidu S1 2026-07-13 同为"文本/语音指令驱动视频生成或编辑" Vidu S1 偏实时交互+商用,CoT-Edit 偏精确语义-空间解耦
Canvas360 2026-07-13 多模态上下文理解 全景图 vs 视频编辑
V-RAGBench / CARVE 2026-07-13 视频检索/视频 RAG 视频理解任务不同
Visual Thoughts (MCoT) 2026-07-11 MLLM + CoT 推理 视觉 CoT 推理 vs 视频编辑 CoT planning
STEP3-VL-10B 2026-07-11 紧凑 MLLM STEP3-VL 是模型,CoT-Edit 是系统
TVI-CoT / PRCO 2026-06-28 多模态 CoT 推理批判 文本-图像 CoT 退化批判与本篇的"CoT 改善视频编辑"形成对照

定位:CoT-Edit 与 LingBot-Video、Vidu S1 共同构成"7 月中旬视频生成/编辑三角"的第三个角,但方法路线(plan-guide-edit)有独立价值。


6. 可信度评估

维度 评分 理由
学术背书 ⭐⭐⭐⭐ CVPR 2026 正会(论文 PDF 在 CVF Open Access),USTC 陈志波组是成熟产线
方法新颖度 ⭐⭐⭐ 框架集成型贡献,plan-edit 解耦在视频编辑里仍有空间,但 MLLM-as-planner 不新
实验可核验度 ⭐⭐ 摘要未给具体数字、未给数据集、未给基线,PDF 文本提取困难,未抓全文
复现可获得性 ⭐⭐ 截至 7-14 公开渠道未发现 GitHub 链接;CVF PDF 是唯一公开物
信号价值 ⭐⭐⭐ CVPR 2026 + USTC + 视频编辑这一相对成熟赛道中规中矩;不踩热点,不补大坑
综合 ⭐⭐⭐(3/5) 推荐入库但建议标"待 PDF 全文核验"

7. 建议处理路径

  1. 入库类型:建议列入 notes/multimodal/(由同步任务处理)作为"video instruction editing / MLLM planner"代表
  2. 建议路径notes/multimodal/video-instruction-editing-2026.md(按主题聚合,覆盖 CoT-Edit / GIVE / InstructX / Omni-Video 2 / Vidu S1 5 篇)
  3. 精读触发条件: - 论文 GitHub 链接公开(7-31 截止) - 或 / 或 §6 评估表出现 VBench-Edit + 至少 2 个 2025-2026 SOTA baseline
  4. 本稿状态待补查 PDF §3-§6;若 7-31 前未补足,标记为"低优先级,监控"

8. 后续验证动作

  • [ ] 重抓 CVF PDF 文本(尝试用 arxiv-vanity 或 papers-with-code 镜像)
  • [ ] 查 Chen Zhibo 组主页(chenzhibo.ustc.edu.cn / GitHub @chenzhibo-ustc)是否放 GitHub
  • [ ] 与 GIVE / InstructX / Omni-Video 2 / Vidu S1 共同建"video instruction editing 2026"主题页
  • [ ] 若跑出 VBench-Edit 数字,下轮复测一遍

引用边界声明:本稿仅引用 CVPR 2026 Open Access 的 abstract 段、PDF metadata(作者/单位/提交日)、web 搜索公开结果。不复制 PDF 全文(未抓)、不复述具体 benchmark 数字(未在摘要中点名)、不下"高可信"或"建议合并到 review/"等越界判断。