你以为 VLM 评判员真的在"读文字"——2026 这篇论文说:塞张图它就漂分,漂的方向还跟图的内容无关
- 关联论文:2609.37863
想象一下这个场景:
你做情感分类任务,要评一句话是「字面义」还是「比喻义」。prompt 里写:"忽略图像,只看文字做判断"。然后 VLM(GPT-4V、Gemini、Qwen-VL 这类能看图的模型)拿到一句 "he was boiling with anger",拿到一张"沸腾的水壶"图,答:literal(字面)。
但 ground truth 答的是:figurative(比喻)。
你以为自己 prompt 写得很清楚——"忽略图像"——模型会照办。但 2026 年 NeurIPS TAE workshop 的一篇论文 MIST(Misleading-Image Stress Test)说:你以为的"忽略图像",根本没生效:
只要你给 VLM 评判模型塞一张图,无论图的内容与句子「对齐」还是「误导」,判分都会明显漂移;但漂移并不指向图像所表达的那个语义方向——MIST 揭示:当前 VLM 作为人类标注员的"可替代性"评测,所测的不是模型本身,而是"塞不塞图"这一评估配置。
换句话说:当所有人以为 VLM 评判员是「更便宜的人类」,神经论文一查——它其实是「一个没看见图和读懂图都没区别的扰动者」。
一、为什么这件事对今天的你和产品经理都很关键
你可能不做 VLM 评测,但你一定被这些场景绑住过——
- 内容平台的"AI 自动标注":把"违规/不违规"、"情绪/中性"、"讽刺/真诚"交给 GPT-4V 自动打标
- 学术 / 工业评测的"AI 替裁判":MT-Bench、RewardBench、lmsys arena 这类排行榜大量用 VLM 当裁判
- 数据标注团队的"模型辅助":VLM 先给一批预标注,人类再审
这些场景的逻辑根基是"VLM 评判 ≈ 人类评判"。但 MIST 直接挑战这个根基:塞图会让 VLM 判分漂移,漂移方向还和图无关。
更麻烦的是:人类标注员在被三类图上的一致性几乎不变——看起来"模型在三档下都答得差不多",但从模型内部看,标签确实在抖。这是一道「评测配置 ≠ 模型能力」的隐性失稳。
二、MIST 到底干了什么——四个步骤
1. 数据集:200 句 + 3 档图 = 600 个评估配置
构造 200 条英文句,每句都包含一个可作字面或比喻解读的短语(比如 "he was boiling with anger"),标注要求"忽略图像只看句子"决定字面/比喻标签。
每句配三档图像:
- Aligned(语义对齐图,如真画一个表情愤怒的人)
- Misleading(语义反向图,如画一锅煮沸的水)
- No image(无图)
按 ground truth 规则,任何图像都不该改答案。如果改了,说明评判过程被"是否有图"或"图的内容"扰动了。
2. 评测对象:13 个 VLM judges
横跨商业/开源、视觉能力强弱不等。论文按一个 alt-test(独立 sanity check:是否能完成与图像无关的基础文字任务)把 13 个 judge 分为两类:
- 7 个通过 alt-test 的较强模型
- 6 个从未通过 alt-test 的较弱模型
3. 三个对照变量同时存在
| 对照 | 定义 | 期望(按 guideline) |
|---|---|---|
| Aligned vs No-image | 有图(语义对齐) vs 无图 | 标签不变 |
| Misleading vs No-image | 有图(语义反向) vs 无图 | 标签不变 |
| 删除"ignore-the-image"指令 | prompt 不再要求忽略图像 | 标签会变(基线) |
最后一行是 sanity baseline:如果连删除这条指令都产生不了 ~11.6% 的标签变化,那前面两行的变化就不能归因于"图的内容"。
4. 关键指标
- 标签变化率(label change rate):塞图 vs 不塞图的判分差异比例
- 标签移动方向一致率(directional agreement with image sense):变化的方向是否真的指向图像描绘的语义
三、最让工程圈沉默的实验发现
-
Aligned 图像改变 20.5% 的标签;Misleading 图像改变 19.4% 的标签——两者在每个 judge 上都接近,且都高于 11.6% 的"删指令"基线。这说明图像在改变标签,但与图像语义方向无关。
-
方向一致性只有 37%:aligned vs misleading 之间的标签变化里,只有 37% 真的向图像描绘的语义方向移动;其余 63% 是无方向漂移。
-
与人工标注的一致性在三档图之间几乎不变(aligned / misleading / no image 一致率基本持平)。也就是说:从人类视角看,模型在三档下的输出没差别,但从模型内部看,标签确实在抖。
-
alt-test 通过组(7 个强模型)的扰动幅度小于未通过组(6 个弱模型),但两组都有此现象。
⚠️ 论文未给出每个 judge 的逐模型具体数值,abstract 里只有聚合数字。
四、为什么这件事"难"?
学界与业界正在大规模用 VLMs 替代人类标注员:情感分类、NLI、toxicity、figurative / literal 判别等任务都在悄悄换人。但作者 Nagham Omar 等人指出一个被忽视的现象:评测协议往往允许模型看到图像("multimodal judge"),而任务的真实判定条件却要求"忽略图像,只看文本"。这就在"测试模型"与"测试配置"之间打了结。
MIST 想做的就是用最小可控的对照实验,把这个结具体量化。
五、对工程落地的 5 个硬约束(Jay 核查节)
1. ⚠️ 评测时默认提供图像,但任务定义要求忽略图像——单看分数以为模型能力好,实际该分数有 ~20% 是图像存在本身贡献的,而非文本语义。修复:任何"文本主导、图像应被忽略"的评测,必须同时报告 image=None 与 image=present 双列成绩。
2. ⚠️ "ignore the image" 指令不能真正阻止 VLM 处理图像——MIST 的 sanity baseline 证明,删除"ignore the image"指令仅造成 11.6% 的标签变化,而塞入任何图像(aligned 或 misleading)都会造成 ~20% 变化——指令本身并未有效抑制图像影响。修复:若任务定义要求忽略图像,需要从架构层面处理,例如在 VLM 的视觉编码器输出上施加注意力掩码,或在 logit 层对图像相关 token 做条件过滤,而非仅依赖 prompt 指令。
3. ⚠️ aligned 与 misleading 图像质量不对称引入额外混淆变量——misleading 图需要"语义反向",aligned 图只需正常画;两者在构图复杂度、主体突出度上天然不对等。修复:增加图像质量消融实验,对齐图与误导图在分辨率、构图风格上做匹配控制;或引入第四档"中性无关图"作为更干净的对照。
4. ⚠️ 用 VLM-as-judge 替代人类标注员时,"人类不受图像扰动"未被充分证明——论文以"人类在三档图下标注一致性不变"作为 ground truth 基线,但人类被试是否真的在做"忽略图像"的操作未被独立验证。修复:在 human baseline 中也引入"有图 vs 无图"的量化对照。
5. ⚠️ 200 句 stress test 无法覆盖实际部署中的 prompt 多样性——在固定 prompt 下的 ~20% 扰动幅度,可能在更丰富 prompt 条件下被放大或缩小。修复:工程团队在引用 MIST 结论时,应在自己实际使用的 prompt 模板上复现三档对照实验,而非直接采纳 paper 的 20.5% 作为经验数字。
六、给 AI 产品经理的 3 个启示
-
评测时永远报告"无图条件"——当任务定义里"图像不参与判定",评测表格里必须单列
image=None的成绩,不能只看image=present。 -
prompt 中"忽略图像"指令无效——本文给的最尖锐证据:删除这条指令只造成 11.6% 的变化,而塞图本身造成 20%。模型并没有在认真执行"ignore image"指令。如果仍要这样做,需要从架构层改(视觉编码器加注意力掩码、logit 层做条件过滤)。
-
VLM-as-judge 不等于人类——用 VLM 评估 VLM 时,结论应附"无图 + 有图"双栏,避免读数误导。构造评测集时,刻意包含"图像与文本无关"的对照样本,能让"图像扰动"作为独立维度可观测。
七、一句话总结
arXiv 2609.37863 用 200 句 × 3 档图 × 13 个 judge 揭示:VLM 评判员的判分会被"塞图"扰动 20%,但只有 37% 的扰动方向与图的内容一致;更重要的是,"ignore the image"指令只产生 11.6% 的影响——prompt 工程根本拦不住这道污染。这是 2026 年 VLM-as-judge / 自动标注 / MT-Bench 类基准最该警觉的元认知结论——也是所有"用 AI 当裁判"的团队该抄的「双栏成绩」纪律。
论文 arXiv:https://arxiv.org/abs/2609.37863
三个标题变体
反直觉版:你以为 VLM 在"读文字"?2026 这篇论文说:塞张图它就漂分,漂的方向还跟图无关 数字钩子版:20% 判分被"塞图"改变,只有 37% 方向对——一篇论文揭穿 VLM 评判员的隐性失稳 类比版:VLM 评判员不是"更便宜的人类"——它是"看不见图和读懂图都没区别的扰动者"
📱 小红书风格卡片文案(可直接发布)
🤖 你以为 AI 在"读文字"?——这篇论文说:塞张图它就漂分
📍 论文:arXiv 2609.37863 · MIST
📍 会议:NeurIPS 2026 TAE Workshop
你让 VLM 评判"这句话是字面义还是比喻义"——
prompt 写得清清楚楚:忽略图像,只看文字。
模型也会拿"真的读懂"。
🔍 这篇论文揭穿了什么? - 200 句 × 3 档图 × 13 个 judge 最小可控对照 - Aligned 图改变 20.5% 标签,Misleading 图改变 19.4%——基本一致 - 方向一致性只有 37%:漂移方向跟图的内容无关 - 删除"ignore the image"指令只产生 11.6% 变化:prompt 工程根本拦不住
💡 3 个让工程圈沉默的洞察:
1️⃣ "ignore image"指令无效——删除指令仅 11.6% 变化,塞图造成 20% 变化,模型根本没在执行
2️⃣ 评测时永远报"无图条件"——单看 image=present 分数会被 20% 图像扰动污染
3️⃣ VLM-as-judge ≠ 人类——人类在三档下的一致性几乎不变,但模型内部标签确实在抖
📌 对今天的硬约束: - ⚠️ "ignore the image" prompt 指令无效,需视觉编码器加注意力掩码 / logit 层条件过滤 - ⚠️ aligned / misleading 图质量不对称——误导图构图更怪,可能是额外混淆变量 - ⚠️ 200 句规模偏小,统计功效有限;不同 prompt 模板的鲁棒性需扩展 - ⚠️ 逐 judge 数字 abstract 未给,无法做细粒度 VLM 选型
🔗 arXiv:https://arxiv.org/abs/2609.37863