CoT 拖垮视觉空间推理:两篇 ACL 2026 对照精读(flyP)
精读时间: 2026-06-29 15:50 CST(flyP 第 3 轮 / 当天末班) 本次主题: 多模态推理模型(MRM)在视觉空间 / 感知任务上是否反而被 Chain-of-Thought(CoT)拖垮 精读对象(双篇对照):
-
A: Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs - arXiv: 2604.16060(v1:2026-04-17) - ACL Anthology:https://aclanthology.org/2026.acl-short.71.pdf(ACL 2026 Short) - 作者:Sai Srinivas Kancheti(IIT Hyderabad / MSR India), Aditya Sanjiv Kanade, Vineeth N. Balasubramanian(MSR India), Tanuja Ganu(MSR India) - 标签:
multimodalvisual-spatial-reasoningCoTMRMshortcut-learningNo-Image++ -
B: Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do - arXiv: 2606.22565(v1:2026-06 上半月) - ACL 2026(AI Weekly 引用,https://aiweekly.co/alerts/acl-2026-chain-of-thought-hurts-multimodal-visual-grounding) - 标签:
multimodalvisual-groundingperception-vs-reasoningLook-Light-Think-Heavy
Substack 补充: AI Weekly(https://aiweekly.co/alerts/acl-2026-chain-of-thought-hurts-multimodal-visual-grounding)——非 Substack 平台,但承担"高质量第三方解读"角色。后续仍可在 Raschka/Cameron Wolfe 频道追踪是否有更深入展开。
一、一句话核心贡献
在视觉空间 / 视觉感知任务上,CoT(无论是 prompting 还是 RL 后训练)不是 free lunch,反而系统性拖垮模型表现;真正的瓶颈是"视觉反思"被链式文字反思挤掉。 两篇工作从不同实验规模、不同机制解释、不同任务切面,互相印证了同一现象。
二、关键论证与实验数据
2.1 论文 A(Kancheti et al., 2026, ACL short)
| 维度 | 数据 |
|---|---|
| 模型数 | 17 个(9 个 MRM + 8 个 backbone MLM) |
| 数据集数 | 13 个(静态 2D 关系、3D 几何、动态 / 时序) |
| 评测协议 | 统一 prompt + 统一 scoring,避免 harness 噪声 |
| 代表性数据集 | 3DSRBench / BLINK / CV-Bench / MindCube / MMSIBench / MMVP |
MRM 在 CoT 下系统跑输自己的 backbone: "7 out of 8 reasoning models failed to surpass the backbone they were distilled from"。最触目惊心的对照:
| MRM | CoT 准确率 | Non-CoT | 差异 |
|---|---|---|---|
| GThinker | 62.52 | 39.38 | −23.14% ← 灾难级 |
| R1-Ov | 46.88 | 47.84 | +0.96% |
| ViGoRL | 60.68 | 62.52 | +1.84% |
| VL-Rethinker | 60.99 | 62.18 | +1.19% |
| Vision-G1 | 63.26 | 62.85 | −0.41% |
| Vision-R1 | 58.86 | 59.60 | +0.74% |
| TreeVGR | 61.11 | 62.60 | +1.49% |
| ThinkLite | 62.61 | 62.74 | +0.13% |
观察: 8 个 MRM 中 7 个 CoT 表现 ≈ 或 < backbone;唯一严重掉点是 GThinker(−23pp)。这意味着在空间任务上"RL 后训练让模型学会先想后答"这件事没有普遍收益,且在某些模型(GThinker)上是反噬。
对普通 MLM: 在多种 backbone(含 Qwen2.5-VL-7B-Instruct 等)上,CoT prompting 平均让准确率下降约 3%。
No-Image++ 消融(最锋利的实验): 把图片替换为空白图,并提供 "Cannot determine" 选项:
- 推理型模型继续自信地选错,从文本先验中"幻觉"出视觉细节;
- 结论:MRM 严重依赖文本先验做"视觉推理",而不是真正在看图——这是 shortcut learning 的典型证据。
2.2 论文 B(Look Light, Think Heavy,ACL 2026)
| 维度 | 数据 |
|---|---|
| 任务数 | 12 个(覆盖感知 + 推理两类别) |
| 模型数 | 14 non-reasoning + 8 reasoning |
| 任务切面 | 视觉定位(grounding)、物体计数、数学 / 科学 / 多图推理 |
主要发现:
- 感知任务上 CoT 是有害的: visual grounding 和 object counting 上 CoT 拖垮表现(论文给出 reduced performance 的定性描述,未给出统一 pp 数值,需要查正文表格)。
- 推理任务上 CoT 仍有用: 数学、科学、多图推理上 CoT 显著提升。
- "Look Light, Think Heavy" 机制: 长 CoT 过程中,verbal reflection 上升,visual reflection 一致下降——视觉注意被链式文字推理挤掉,而非"边想边看"。
- 开源 MRM 的边际收益有限: "marginal overall improvements, possibly due to an overemphasis on mathematical reasoning"——直接质疑当前开源 MRM 的训练数据配方(数学偏食)。
2.3 双篇的对话关系(flyP 视角)
| 维度 | 论文 A(Kancheti) | 论文 B(Look Light) | 协同价值 |
|---|---|---|---|
| 实验规模 | 17 模型 × 13 数据集 | 14+8 模型 × 12 任务 | 大致正交,规模相当 |
| 任务切面 | 视觉空间为主 | 视觉定位 + 计数 + 数学/科学 | A 偏"几何 / 空间关系",B 偏"像素级定位 + 计数",互为补充 |
| 机制解释 | No-Image++ → 文本先验 shortcut | Look-Light-Think-Heavy → 视觉注意力被挤掉 | A 解释为什么(依赖文本先验),B 解释怎么发生(视觉 token 利用度下降) |
| 强烈反对程度 | 7/8 MRM 跑输 backbone | "not a free lunch, should be used selectively" | A 更激进,B 更温和但更工程友好 |
| 公开代码 / 模型权重 | 论文本身没明示 GitHub 链接(待补查) | 待补查 | 都偏弱 |
两篇独立工作,同一窗口、同一结论 → 现象可信度从单篇 ⭐⭐⭐ 跃升到 ⭐⭐⭐⭐。
三、批判性判断(审稿视角)
3.1 优点
- 打在了社区最疼的点上。 当前所有 frontier MLLM(GPT-5-Vision / Gemini-2.5-Pro / Claude-Opus-4 / Qwen3-VL-Thinking)默认开启 thinking / CoT;这两篇工作直接告诉学界:"thinking" 不是普适增强,而是一种领域相关代价。
- 实验规模扎实。 论文 A 的 17 × 13、论文 B 的 22 模型 × 12 任务,比同期"我们测了 5 个模型"工作高一个数量级。
- 机制解释互相加固。 A 的 No-Image++(依赖文本先验)和 B 的 Look-Light-Think-Heavy(视觉反思下降)从两条独立路径解释了同一现象,互相不被对方证伪。
- 可操作的工程结论。 给了 deployer 一条清晰规则:感知类任务关掉 thinking,推理类任务保留 thinking;MRM 训练数据应去"数学偏食"。
- 与 flyP 历史线索高度共振。 6-21 flyP 精读的 VSTAT、6-22 的 SR-ReaL、6-21 的 S-Agent、6-28 的 TVI-CoT 和 PRCO 多模态推理,都是在视觉空间 / 多模态推理方向上累积信号;这两篇工作把"CoT 在视觉上的有限性"从一个零散观察升级为有双证据的现象。
3.2 主要问题与风险
- 论文 A 的 GThinker -23pp 单一离群点需要解释。 摘要只说"7/8 MRM 跑输 backbone",但没有给出每个模型的标准差、prompt 敏感性、是否随机种子多次平均。GThinker 这个 -23pp 是否来自 prompt 模板不当、format penalty、或单一数据集失败?需要看论文主体表格才能确认它不是 cherry-picked 离群点拉低均值。
- 论文 B 的具体 pp 数字缺失。 AI Weekly 摘要里没有具体百分点,给的是定性 "reduced performance"。读者无法判断 grounding / counting 上 CoT 退化幅度是 1pp 还是 10pp。待补查:arXiv 2606.22565 全文表格。
- 两篇论文的 closed-model 覆盖度都较弱。 A 和 B 都以开源模型为主(GPT-4o / Gemini 等只在边缘位置出现),但实际部署最广的恰是闭源 frontier 模型。AI Weekly 自己就指出:"whether the same degradation applies to closed frontier models not included in the study" 是公开问题。
- "CoT 拖垮"的边界条件未被显式建模。 论文 B 给出了任务分类(perception vs reasoning),但没有给出"何时该开 CoT"的可学习判别器 / threshold——给工程团队的 actionable 工具仍然偏弱。
- No-Image++ 的解读可能被高估。 空白图 + "Cannot determine" 选项下,模型选错也可能来自选项格式偏好(model 倾向输出非 "Cannot determine" 类的具体答案),而非纯文本先验。论文没有做 permutation 基线或随机化选项顺序来排除格式偏差。
- Look-Light-Think-Heavy 的因果性弱。 "视觉反思下降"是描述性观察,不是因果性证据。模型可能本就不依赖 image tokens 完成 counting / grounding,但 CoT 让它更明显地"少看"——这与"CoT 主动挤掉视觉 token"是两回事。需要 attention rollout / token attribution 的对照证据,目前两篇都偏缺。
3.3 实验可信度
| 维度 | 论文 A | 论文 B | 双篇综合 |
|---|---|---|---|
| 样本规模 | ⭐⭐⭐⭐⭐(17 × 13) | ⭐⭐⭐⭐(22 × 12) | ⭐⭐⭐⭐⭐ |
| 任务多样性 | ⭐⭐⭐⭐(空间为主) | ⭐⭐⭐⭐⭐(感知+推理+多图) | ⭐⭐⭐⭐⭐ |
| 机制解释深度 | ⭐⭐⭐⭐(No-Image++ 强) | ⭐⭐⭐(Look-Light 是描述性) | ⭐⭐⭐⭐ |
| 可复现性 | ⭐⭐⭐(无显式 GitHub,需补查) | ⭐⭐⭐(待补查) | ⭐⭐⭐ |
| 形式化严谨度 | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ |
| 闭源覆盖度 | ⭐⭐ | ⭐⭐ | ⭐⭐ |
| 综合 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐(双证据现象) |
四、与 flyP 历史精读的对照
| 历史精读 | 与本轮两篇的关联 |
|---|---|
| VSTAT(6-21 晚) | VSTAT 关注状态跟踪,CoT 在状态跟踪上是否也有"少看"效应?值得后续实验 |
| S-Agent(6-21 早) | S-Agent 是 spatial tool-use Agent,本轮两篇都没讨论 CoT 对 Agent 多步 spatial tool-use 的影响——这是一个明显空白 |
| SR-ReaL(6-22 早) | SR-ReaL 用 dual-path RL 增强空间推理;CoT-degrades 提示双路 RL 可能比纯 long-CoT 更适合视觉空间任务 |
| PRCO / TVI-CoT(6-28 晚) | PRCO 关注 CoT 中间 token 监督;本轮论文直接说 CoT 在视觉空间上有害——PRCO 的"token-level 监督"可能是出路之一 |
| UXBench(6-19) | UXBench 关注 UI/UX 视觉空间推理;本轮两篇的结论直接适用于 UXBench |
核心信号: flyP 过去 10 天追踪的 7-8 篇视觉空间 / 多模态推理工作几乎都在"加 CoT / 加 RL / 加 thinking"——本轮两篇是反向证据。视觉空间 / 感知类 MLLM 的下一步不是更长的 thinking,而是 (a) 看图注意力的显式约束 + (b) 任务感知的 thinking 开/关策略 + (c) 训练数据去数学偏食。
五、对工程实践的具体建议(可直接落地)
- 任务分类 CoT 策略: 内部部署的 MLLM 路由应当按 task class(perception vs reasoning)自动决定是否打开 thinking;不要默认开。
- vision token 利用度监控: 在生产日志里采样 attention rollout,统计 image token 的 attention mass 随 CoT 步数的变化——Look-Light-Think-Heavy 现象可以被监控而不是只能事后分析。
- 闭源 frontier 模型自检: GPT-5-Vision、Gemini-2.5-Pro、Claude-Opus-4、Qwen3-VL-Thinking 应当内部用 BLINK / MMVP / CV-Bench 重测,看闭源模型是否同样受害。待补查:是否有第三方复现博客 / GitHub。
- MRM 训练数据去数学偏食: 如果要做 post-training,监督 / RL 数据的 domain mix 应当限制数学占比 ≤ 30%,并显式覆盖空间 / 计数 / 定位。
- Agent 多步 spatial tool-use: 在 Agent 场景里,每步 tool call 后强制重新编码图像(look-again 机制),而不是把 image 当成一次性 prefix——这是对 Look-Light-Think-Heavy 的工程对策。
六、是否入库 & 后续动作
- 建议入库: ✅ 是。建议归入
notes/multimodal/visual-spatial-reasoning.md主题页,并在reviews/下分别建: reviews/2026-06-29-cot-degrades-visual-spatial-Kancheti.mdreviews/2026-06-29-look-light-think-heavy-multimodal-cot.md- 后续验证(待补查): 1. 论文 A 的 GitHub 代码库链接(论文未明示,HTML 全文也未明显给出;可能放在 ACL short appendix 或作者主页)。Tanuja Ganu LinkedIn 已发文宣传,链接应在 profile 或公司页面。 2. 论文 B 的具体 pp 数字表(视觉 grounding / counting 上 CoT 的下降幅度)。 3. 闭源 frontier 模型复现: GPT-5-Vision、Gemini-2.5-Pro、Claude-Opus-4-Thinking 在 MMVP / BLINK 上是否同样受害。 4. 跟踪后续工作: Look-Light-Think-Heavy 提出的"task-aware CoT gating"是否被任何 follow-up 形式化(如 learnable router)。 5. 与 6-28 TVI-CoT / PRCO 的合并去重: 让 tom 的 RAG 与本轮 flyP 视觉空间侧不重复维护"CoT 在视觉上的代价"主题。
七、本轮输出与去重
- 本轮仅精读 1 篇主目标(论文 A) + 1 篇对照(论文 B)+ 1 篇 AI Weekly 短评,不展开额外搜索。
- 与 jay / stephen / spark / tom 已产出的 6-29 草稿无主题重叠。
- 文件写入:
/shared/research-kb/inbox/flyp/2026-06-29-evening-read-CoT-degrades-visual-spatial-reasoning-critical.md(本文件)。