CoT-Edit · Let CoT Guide Instruction Video Editing · 批判性精读
角色:flyP · 批判性审稿 主题:指令驱动视频编辑 / MLLM-as-planner / 计划-引导-编辑框架 来源:CVPR 2026 Open Access · https://openaccess.thecvf.com/content/CVPR2026/papers/Liang_CoT-Edit_Let_CoT_Guide_Instruction_Video_Editing_CVPR_2026_paper.pdf 作者:Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen(USTC + 中关村院 + 清华) 本稿定位:仅基于论文摘要 + CVPR 页元数据 + web 搜索结果,不抓全文 PDF(PDF 流为 pikeppdf 编码,文本提取乱码;不强行重抓) 生成时间:2026-07-14 09:50 Asia/Shanghai
1. 论文卡片(仅摘要事实,不补猜)
| 字段 | 内容 | 信源 |
|---|---|---|
| 标题 | CoT-Edit: Let CoT Guide Instruction Video Editing | CVPR 2026 Open Access |
| 会议 | CVPR 2026(IEEE Conference on Computer Vision and Pattern Recognition) | PDF metadata(pikepdf 10.5.1 转码,提交日 2026-05-16) |
| 作者单位 | USTC(陈志波组)/ 中关村院 / 清华(张友亮) | abstract byline |
| 一作 | Sen Liang(USTC, liangsen@mail.ustc.edu.cn) | abstract byline |
| 通讯 | Xin Li, Zhibo Chen | abstract footnote |
| 仓库 / 权重 | 截至 2026-07-14 论文 PDF 内未发现 GitHub/HF 链接 | 仅在 abstract & 引言中扫到 cvf.com PDF URL,无 github.com 出现 |
| arXiv 镜像 | 未在 web 搜索中找到 arXiv 链接 | search 命中的均为 CVF PDF;无 arXiv abs 出现 |
| 标签 | #video-editing #MLLM-planner #CoT #diffusion #CVPR2026 | 自定 |
不补猜:未在摘要中确认具体 MLLM 型号 / diffusion editor backbone(猜测 CogVideoX / SVD / AnimateDiff 都不补)/ 训练数据规模 / 评估基准具体数字。等待 PDF §3-§5 核验。
2. 核心贡献(仅 abstract 自报,不补猜)
- plan–guide–edit 框架:把"语义意图"和"空间执行"显式解耦 —— abstract 自报
- MLLM-as-planner:用 CoT 增强的 MLLM 对视频和指令做结构化推理,输出"精确序列的 bounding boxes + 属性增强的编辑指令" —— abstract 自报
- diffusion-based editor:把 masks、enriched instructions、frame features 融合做高保真编辑,并要求"temporally coherent + spatially well aligned" —— abstract 自报
- 解决痛点:纯文本 prompt 在复杂场景下"无法捕捉精确空间关系和物理约束,导致目标歧义与物理上不可能的结果" —— abstract 自报
3. 方法拆解(仅基于摘要 + 命名推断,不补猜 backbone)
| 模块 | 摘要披露 | 命名观察 | 可疑/需补查 |
|---|---|---|---|
| Planner | "CoT-enhanced multimodal large language model" | CoT-Edit 命名直接对应 | MLLM 是哪个?Qwen2.5-VL / LLaVA-OneVision / 自训?——等待补查 PDF §3 |
| Plan 输出 | "sequence of bounding boxes + attribute-enriched editing directives" | 类似 Set-of-Mark / G-DINO / Grounded-SAM 的范式 | 是否做第一帧 spatial grounding?是否多帧一致?——等待补查 §3 |
| Editor | "diffusion-based editor" | 大概率是 image-to-video diffusion 改造(CogVideoX / SVD / AnimateDiff) | 是否复用 Vidu / Sora 风格的长期一致性?——等待补查 §4 |
| 数据 | 未在 abstract 中点名 | —— | 数据集是自构还是基于 Instruct-V2V / EditVerse?——等待补查 §5 |
| 评估 | "temporally coherent + spatially well aligned" | 评估指标未点名 | 是否跑 VBench-Edit / EditVerse-Bench / DAVIS / User Study?——等待补查 §6 |
不补出 vLLM / SGLang 类推断;不补"是否用 IP-Adapter / ControlNet / ReferenceNet"等具体机制;不补"具体 prompt 模板"。
4. 复现风险 / 反方审稿(六条可证伪,每条挂"待核验")
4.1 计划-编辑解耦本身并不新
- 计划-编辑解耦的范式早在 LangChain / ReAct / Visual ChatGPT 时代就存在;视频领域有 InsV2V、Ground-A-Video、Video-P2P 等都做过"先 plan 再 edit"
- 可证伪判定:若 §3 的"plan 结构"是简单的"指令→bbox 列表",则贡献点退化为"工程集成 + 调参"; 若 plan 内部是 multi-step CoT 推理链(track→segment→attribute modify→temporal align),则属于实质性贡献
- 判定依赖:PDF §3 图示 + plan 输出的 JSON schema
4.2 MLLM planner 与 editor 之间的"信号瓶颈"
- 摘要声称 MLLM 输出"bbox + attribute-enriched directives"。但 bbox 是 2D 静态框 → 编辑器需要 mask + 时间维度属性(如"在第 3-5 秒淡入")
- 可证伪判定:若 MLLM 输出不含时间戳 / 关键帧编号 / segment-id,则 editor 端要么手工规则后处理(弱)、要么学不到时序编辑(弱)
- 判定依赖:PDF §3.2 计划格式定义 + §4.1 editor 输入
4.3 "物理上不可能"这个靶子 vs 实测
- abstract 把"physically implausible outcomes"列为要解决的核心问题,但没说用什么方法去约束物理
- 可能性 A:靠 MLLM plan 阶段判断(语言层物理常识,弱)
- 可能性 B:editor 阶段用 physics-aware loss / constraint(强,但 diffusion 中加入物理约束工程难度高)
- 可证伪判定:若仅靠 A,则"物理合理性"实际靠数据集分布 + MLLM 常识,论文贡献与 SOTA Instruct-V2V / EditVerse 拉不开差距
4.4 评估的"硬"与"软"
- "temporally coherent + spatially well aligned" 是定性说法。需要核对:
- 是否跑 VBench-Edit(Subject Consistency / Background Consistency / Motion Smoothness)?
- 是否给 pixel-level mask IoU + 编辑区域 FID?
- 是否有人类 user study(人数 / 视频数 / pairwise)?
- 可证伪判定:若只有"user study 偏好 N=20" + 几张定性图,则证据等级 C;若有 VBench 完整表 + 消融 + 多模型对位,则 A
4.5 与同期工作的对位(同期 SOTA)
CVPR 2026 同期(已公开的 paper/project page 检索):
- GIVE: Generic Instructional Video Editing(CVPR VGBE 2026 workshop,xiangbogaobarry):VBench-based 自动化评估
- InstructX(arXiv 2510.08485,2025-10):MLLM 引导的图像+视频统一编辑,强调"image-only training emerges video editing"
- Omni-Video 2(arXiv 2602.08820v2):MLLM 条件扩散的编辑 prompt reasoner
- Vidu S1(2026-07,flyP 已 7-13 精读过):实时交互编辑
- 可证伪判定:若 CoT-Edit 表格里只对位 InsV2V / Ground-A-Video 这类 2024 老 baseline 而不与 GIVE / InstructX / Omni-Video 2 / Vidu S1 比,则实验覆盖度不足
4.6 开源与权重不透明
- 截至 2026-07-14,CVF PDF 内无 GitHub 链接,web 搜索未命中 arXiv 镜像
- Chen Zhibo 组此前有 VCD-Net / All-in-One 等工作均开源,但本篇是否跟随传统不可知
- 可证伪判定:若 7 月底前(≤ 2026-07-31)放 GitHub,则风险降;否则科研复现门槛偏高
5. 与本知识库已有产出的对位
| 已精读条目 | 时间 | 关联点 | 差异 |
|---|---|---|---|
| LingBot-Video | 2026-07-13 | 同为视频生成+编辑方向 | LingBot 是 MoE 视频生成,CoT-Edit 是编辑专用 |
| Vidu S1 | 2026-07-13 | 同为"文本/语音指令驱动视频生成或编辑" | Vidu S1 偏实时交互+商用,CoT-Edit 偏精确语义-空间解耦 |
| Canvas360 | 2026-07-13 | 多模态上下文理解 | 全景图 vs 视频编辑 |
| V-RAGBench / CARVE | 2026-07-13 | 视频检索/视频 RAG | 视频理解任务不同 |
| Visual Thoughts (MCoT) | 2026-07-11 | MLLM + CoT 推理 | 视觉 CoT 推理 vs 视频编辑 CoT planning |
| STEP3-VL-10B | 2026-07-11 | 紧凑 MLLM | STEP3-VL 是模型,CoT-Edit 是系统 |
| TVI-CoT / PRCO | 2026-06-28 | 多模态 CoT 推理批判 | 文本-图像 CoT 退化批判与本篇的"CoT 改善视频编辑"形成对照 |
定位:CoT-Edit 与 LingBot-Video、Vidu S1 共同构成"7 月中旬视频生成/编辑三角"的第三个角,但方法路线(plan-guide-edit)有独立价值。
6. 可信度评估
| 维度 | 评分 | 理由 |
|---|---|---|
| 学术背书 | ⭐⭐⭐⭐ | CVPR 2026 正会(论文 PDF 在 CVF Open Access),USTC 陈志波组是成熟产线 |
| 方法新颖度 | ⭐⭐⭐ | 框架集成型贡献,plan-edit 解耦在视频编辑里仍有空间,但 MLLM-as-planner 不新 |
| 实验可核验度 | ⭐⭐ | 摘要未给具体数字、未给数据集、未给基线,PDF 文本提取困难,未抓全文 |
| 复现可获得性 | ⭐⭐ | 截至 7-14 公开渠道未发现 GitHub 链接;CVF PDF 是唯一公开物 |
| 信号价值 | ⭐⭐⭐ | CVPR 2026 + USTC + 视频编辑这一相对成熟赛道中规中矩;不踩热点,不补大坑 |
| 综合 | ⭐⭐⭐(3/5) | 推荐入库但建议标"待 PDF 全文核验" |
7. 建议处理路径
- 入库类型:建议列入
notes/multimodal/(由同步任务处理)作为"video instruction editing / MLLM planner"代表 - 建议路径:
notes/multimodal/video-instruction-editing-2026.md(按主题聚合,覆盖 CoT-Edit / GIVE / InstructX / Omni-Video 2 / Vidu S1 5 篇) - 精读触发条件: - 论文 GitHub 链接公开(7-31 截止) - 或 / 或 §6 评估表出现 VBench-Edit + 至少 2 个 2025-2026 SOTA baseline
- 本稿状态:待补查 PDF §3-§6;若 7-31 前未补足,标记为"低优先级,监控"
8. 后续验证动作
- [ ] 重抓 CVF PDF 文本(尝试用 arxiv-vanity 或 papers-with-code 镜像)
- [ ] 查 Chen Zhibo 组主页(chenzhibo.ustc.edu.cn / GitHub @chenzhibo-ustc)是否放 GitHub
- [ ] 与 GIVE / InstructX / Omni-Video 2 / Vidu S1 共同建"video instruction editing 2026"主题页
- [ ] 若跑出 VBench-Edit 数字,下轮复测一遍
引用边界声明:本稿仅引用 CVPR 2026 Open Access 的 abstract 段、PDF metadata(作者/单位/提交日)、web 搜索公开结果。不复制 PDF 全文(未抓)、不复述具体 benchmark 数字(未在摘要中点名)、不下"高可信"或"建议合并到 review/"等越界判断。