精读与批判:CrossMath —— VLM 是真在「看」还是在「读」?
- 论文:Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
- 作者/团队:Yige Xu 等(GitHub: xuyige/CrossMath)
- 链接:https://arxiv.org/abs/2604.16256 | https://arxiv.org/html/2604.16256v1
- 发表:arXiv v1,2026-04-17
- 主题分类:多模态评测 / VLM 推理 / 基准构造 / 模态鸿沟
- 关键标签:
benchmarkmultimodal-reasoningmodality-gapcontrolled-comparisonfine-tuning
一、核心贡献(论文自述 + 我的浓缩)
- 基准:CrossMath —— 数学推理题,每题同时构造三种格式 - text-only(纯文字描述题目) - image-only(纯图,必要信息全在图中) - image+text(图文双通道,信息等价) - 关键约束:经人类标注员核验,三种格式任务相关信息完全对齐,消除信息不对等带来的混淆。
- 发现:在 SOTA VLM 上做受控评测,呈现稳定的模态鸿沟—— - text-only 通常得分最高 - 加入视觉信息(image+text)反而经常掉点,相对纯文本基线出现退化 - 推论:当前 VLM 主要在文本空间做推理,对视觉证据的依赖很有限。
- 缓解:作者额外放出一个 CrossMath 训练集,对 VLM 做 SFT 后,单模态与跨模态都有提升,并在两个通用视觉推理基准上获得稳健泛化。
- 开源:代码 https://github.com/xuyige/CrossMath
一句话:用三模态对齐的数据集把"VLM 是不是真的用眼睛"这件事量化出来,并附了一个能反向修这一问题的 SFT 配方。
二、方法拆解(精读要点)
- 对齐式构造:这是 CrossMath 的灵魂。它不是单纯"出题后转图",而是同一题人为构造三份等价载体,再用人类标注做等价性校验。这种"信息对齐"在以往基准里少见(MMMU、MathVista 等都因图文耦合过紧,无法拆开测)。
- 评测面:覆盖主流开源 + 闭源 VLM(按摘要描述,应包含 GPT-4o、Gemini、Qwen-VL、LLaVA 系列等;具体名单与版本待精读 PDF 表格后补全)。
- 指标:数学推理正确率(题目级)。image+text < text-only 的负向差是核心信号。
- 训练配方:SFT 即可提分,没有用 RLHF / RLVR。说明这是个纯数据 + 对齐格式的改良,而不是"换一种范式"。
三、主要问题与风险(批判视角)
- 题目域窄:数学推理本身对 VLM 不利 —— 文本里数字和符号本来就能完整表达"算式",视觉通道在多数题里只是冗余载体。所以"image-only 落后 text-only"某种程度上是题面设计使然,不必然推广到所有视觉任务(例如空间推理、视频理解、GUI 操作)。把结论外推到"VLM 都不看图"会过强。
- 粒度缺失:摘要只给"image+text 退步"的现象,没有拆解OCR 误差、视觉 token 化损失、模态融合层哪个是元凶。建议结合以往工作(V*、MM1、Idefics-2 的 vision-grounding 分析)做归因。
- 对照模型版本:VLM 更新极快,今天的"退步"可能下个版本就被修。要标注评测时点、模型快照与 prompting 模板的版本,否则跨论文对比不可靠。
- SFT 提升的可解释性:用 CrossMath 训练集 SFT 后在通用基准也涨点 —— 但提分可能来自"见过类似题型"或"指令格式对齐",不一定是"学会了用视觉"。需要 ablation:拆掉图像通道单独测训练后模型,确认它真的依赖图像。
- 构建成本:三模态人工对齐成本高,题目量级(待补查:约多少题、来源是否复用 GSM8K / Math)直接影响后续社区能否复用或扩展。
四、可信度评估
- 方法论:★★★★★ —— 对齐式构造是这篇最硬的部分,比同时期大多数"图文耦合"基准严谨。
- 结论强度:★★★☆☆ —— 数学题这一垂直域下"模态鸿沟"现象可信,但外推到"VLM 普遍不真用视觉"要谨慎。
- 可复现性:★★★★☆ —— 代码已开源、数据集公开;主要门槛是人工标注等价性的协议,需要复现团队理解 annotation guideline。
- 影响力预测:★★★★☆ —— "VLM 在 text-only 上更好"这类反直觉结论很容易被引用;只要后续工作把它当作 baseline(而非定论),就是正面贡献。
五、与近期工作的关系(待精读补充)
- 同期 SOTA 评测:MathVerse、MathVista、MMMU-Pro —— 多为图文耦合,无法拆出"模态鸿沟"。CrossMath 是这一波里少见的解耦式基准。
- 同方向工作:VLM 海马体假说、MM1.5 / Idefics3 关于视觉 token 注入位置的研究 —— 都可作为后续归因实验的参照。
- 临床多模态 agent 的呼应:AgentRx(arXiv:2605.10286,2026-05-11,AHLI 2026)也报告了多模态 agent 的"协作不如单 agent"的退步现象 —— 两条线索指向同一类问题:多通道信息未必带来增益,整合机制才是瓶颈。
六、入库建议与后续动作
- 入库建议:✅ 建议入库
notes/multimodal/benchmarks/或reviews/multimodal-reasoning/。 - 建议路径:
notes/multimodal/benchmarks/crossmath-modality-gap.md(综述/笔记形态) - 或:
reviews/2026-04-crossmath.md(独立审稿形态) - 后续验证动作: 1. 待补查:完整模型清单、题目数量、训练集规模、OCR/视觉 token 消融实验结果。 2. 待补查:CrossMath 训练集 SFT 后 ablation —— 去掉图像通道是否还能涨点?这是"真学会看图"的关键判据。 3. 与本周已读《Expense of Seeing》《CoT degrades visual-spatial reasoning》一起,整合成"模态鸿沟专题"小综述。
- 跨实例去重:与 jay/stephen/tom 目录尚未冲突,可正常入库。