精读与批判 · VLM-CapCurriculum · VLM 后训练中感知 vs 推理解耦

角色:flyP · 批判性审稿 主题:VLM 后训练 · 能力课程新轴 · 视觉感知是 MLLM 真瓶颈 来源: - UCSC Project Page:ucsc-vlaa.github.io/VLM-CapCurriculum - ICML 2026 会议级 作者:Juncheng Wu (UCSC + Amazon) · Hardy Chen · Haoqin Tu · Xianfeng Tang · Freda Shi (Waterloo / Vector) · Hui Liu · Hanqing Lu (SJTU) · Cihang Xie · Yuyin Zhou (UCSC) 本稿定位:基于项目页 + ICML 摘要,不抓 PDF 全文 生成时间:2026-07-15 09:51 Asia/Shanghai


1. 论文卡片(项目页元数据)

字段 内容 信源
标题 Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models UCSC project page
会议 ICML 2026 项目页 banner
一作 Juncheng Wu (UCSC + Amazon) 项目页
通讯 jwu418@ucsc.edu 项目页 contact
代码 项目页未直接列 GitHub 链接 待查

不补猜:训练数据来源 · 感知样本的具体构造方式 · ablation 完整表 · baseline 选择 —— 待 PDF §4-§5 核验。


2. 核心论点(项目页自报)

  1. 关键发现:当前 VLM 后训练的热点是"长 CoT 推理",但经验上视觉任务的主要瓶颈是"视觉感知",不是推理链长度
  2. 能力阶段拆解:将 VLM 后训练系统分为三阶段: - 视觉感知(visual perception) - 文本推理(textual reasoning) - 视觉推理(visual reasoning)
  3. 三个改变 VLM 后训练方式的发现: - (a) 感知需要专属数据——纯推理数据引入"感知税";加入专用感知样本RealWorldQA +3.7%稳定 MMStar - (b) 能力是新课程轴——除"难度"外,可按目标能力排序;与难度轴正交可加;Qwen3-VL-8B 从 58.56 → 62.99 - (c) 阶段顺序很重要——感知 → 文本推理 → 视觉推理 才对;反过来掉 4.6 pts(视觉 → 文本 → 感知)
  4. 跨 4 个 backbone 实验:所有 backbone 都见效;+20.8% 更短推理("看清楚 → 思考变少")

3. 方法拆解(按项目页披露 + 命名推断)

模块 项目页披露 命名观察 待 PDF 验证
数据源 "perception samples" + "reasoning data" + "visual reasoning data" 三类样本分别对应三阶段能力 具体数据集是什么?(RealWorldQA、MMStar 是评测,不是训练源)
训练顺序 SFT 三阶段连训 类似 curriculum learning 是否带 RL?SFT only?
评估 4 backbone × 多个基准 4 个 backbone 都见效 全开源 MLLM:Qwen2.5-VL-7B / Qwen3-VL-8B / LLaVA-OneVision-7B / ???
关键数字 Qwen3-VL-8B 58.56 → 62.99 +4.43 总增益 增益是 SFT 增量还是 baseline 增量?

可疑的关键细节: - 项目页头条"86.9% VLM errors are perception, not reasoning"—— 86.9% 是怎么算的?(错误分类?人工标注?) - "+1.46% Math accuracy over merged baseline"—— 比单纯合并数据集的基线 +1.46%,说明 staged 比 merged 强


4. 主要问题与批判(flyP 视角)

4.1 主要贡献的"质量等级"

  • 新发现质量:⭐⭐⭐⭐⭐ "Perception is the dominant bottleneck" 在 MLLM 圈子里是反共识(vs 当前"长 CoT 风潮"),经验性证伪了"推理链增长 = 性能提升"的误判。
  • 方法贡献:⭐⭐⭐⭐ 提出"能力课程"是 curriculum learning 的正交扩展,可与难度轴叠加——这一点在教程论文里常见,但落地到 MLLM 是新一步。
  • 经验证据:⭐⭐⭐⭐ 4 个 backbone 都见效,且量化给出 +4.6 / +1.46 等数字——可证伪性强。

4.2 实验可信度(最大担心)

  • 基线选择偏见:4 个 backbone 全是开源 MLLM(Qwen + LLaVA 系列),没有任何闭源基线(GPT-5、Claude 4.x、Gemini 3 Pro)。
  • 含义:结论只对开源 MLLM 适用
  • 不能直接推断 "GPT-5 也需要先训感知"
  • 基准选择:RealWorldQA + MMStar 偏感知类;Math 偏推理类——但这两个轴是否真正正交,论文没给理论保证。
  • 样本量未披露:RealWorldQA +3.7%、MMStar stabilized——置信区间 / 标准差未在项目页体现。

4.3 概念定义不清

  • 什么算"感知样本"?是合成 crop / zoom-in?还是额外的图像+问题对?
  • 什么算"文本推理样本"?是带 reasoning trace 的文本 QA?
  • 什么算"视觉推理样本"?是带 visual chain 的多跳 QA?
  • 这些是 closed-set 还是构造的? 没在项目页说清楚。

4.4 "Perception → Text → Visual" 顺序的鲁棒性

  • 项目页给出"反过来掉 4.6 pts",但只在一个 backbone 上(Qwen2.5-VL-7B);
  • 是否在 4 个 backbone 上都成立?需要 PDF 表 5 / 表 6 验证。

4.5 "+20.8% 更短推理"现象的归因模糊

  • "看清楚 → 思考变少"是 motto,但因果机制有多种可能:
  • 情况 A:感知正确 → 推理直接,不需要 re-check → 短
  • 情况 B:感知数据训练时缩短了 max-output limit → 表面变短
  • 情况 C:感知数据其实学到了"skip thinking"特征
  • 项目页只给了"Re-checking the image during reasoning leads to the same perception error (Case A)"——这个 case study 是好证据,但只是一例

4.6 与上一周"Thinking with Video" / Visual Thoughts 的对照

  • Visual Thoughts(2026-07-11 flyP 已精读):视觉 chain of thought 在 visual token 空间推理
  • TVI-CoT / PRCO(2026-06-28 flyP 已精读):CoT 反而退化视觉空间推理
  • VLM-CapCurriculum(本条):感知是 bottleneck,CoT 不是越长越好
  • 三方形成一致:长 CoT 风潮被多源质疑——这是 2026 夏季 MLLM 训练论战的核心信号

4.7 复现门槛

  • 项目页未列 GitHub 链接(ICML 会议惯例是 paper + code 同步放);
  • 建议关注 arXiv 版本,可能有官方代码;
  • 即使有代码,训练 MLLM 成本极高——4 个 backbone × 3 个消融 × 多基准,普通实验室无法复现全表。

5. 可信度评分

维度 评分 说明
问题新颖度 ⭐⭐⭐⭐ "能力课程"是 curriculum learning 的新轴,不是新话题但反共识程度高
实验设计 ⭐⭐⭐⭐⭐ 4 backbone × 多基准 × 顺序消融 + 案例分析,比同期多数 MLLM 论文扎实
数字可信度 ⭐⭐⭐ 4.43 / 3.7 等增量合情合理,但置信区间缺失
推广风险 ⚠️ 中 仅开源 MLLM 验证,未触闭源
影响力潜力 ⭐⭐⭐⭐⭐ 一旦开源代码 + 数据集,会改写 MLLM 后训练流水线默认
反方证据 待补 闭源 MLLM 是否需要同样顺序?未知

综合可信度:7.5/10(高影响力 + 中等可复现难度)


6. 是否建议入库

必入库——这是本周最值得精读的 MLLM 后训练经验论文

  • 主稿reviews/2026-07-VLM-CapCurriculum.md
  • 主题页:建 notes/vlm-training/curriculum-2026.md,与 TVI-CoT/PRCO / Visual Thoughts / Thinking with Video 形成"MMLM 后训练经验证据集群"
  • 跨页引用:作为"长 CoT 风潮证伪"的代表性条目

7. 后续验证动作

  • [ ] 重抓 ICML 2026 PDF §4-§5,确认实验完整表
  • [ ] 关注是否放出 GitHub 代码
  • [ ] 关注闭源厂商(GPT-5 / Claude 4.x / Gemini 3 Pro)是否回应"感知 vs 推理"瓶颈论
  • [ ] 与 TVI-CoT / Visual Thoughts / Thinking with Video 建"MMLM 后训练证据集群"页

8. 一句话总结

"感知是 MLLM 真瓶颈" —— 4 backbone 实证,Perception → Text → Visual 三阶段顺序比"难度课程"更优。这是 2026 夏季长 CoT 风潮的第一个反共识实证。 飞 P 建议必入库,并把它与上周 Visual Thoughts、TVI-CoT、Thinking with Video 串成"MMLM 后训练论战"主题页。