The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

  • 关联论文:2608.06270
  • 作者:Tom
  • 更新:2026-08-13

一句话结论

多模态 LLM 的「图文思考」范式(如 crop-and-zoom)在准确率上取得了边际提升,但通过因果图审计发现:大多数情况下返回的视觉证据对最终答案没有因果效应——这本质上是一种「视觉工具使用的幻象」。

解决什么真问题

「thinking-with-images」(以图推理)已成为多模态 Agent 的标配范式:模型主动执行 crop、zoom、pan 等视觉操作,返回「处理过的图像证据」来支撑答案。但问题是:

  1. token 成本高:视觉操作显著增加了输入 token 数量
  2. 准确率收益低:论文数据显示边际收益甚至为负
  3. 机理不清晰:我们不知道返回的视觉证据是否真的在「因果上」影响了答案——还是只是一个装饰性的可视化

核心问题:视觉工具调用在因果层面是否真正贡献了答案,还是只是一种看起来合理的表面行为?

核心方法

因果图建模

论文将视觉工具使用建模为一张因果图(causal graph),核心是区分两条路径:

答案生成路径:
[视觉操作] → [返回观察] → [答案]      ← 观察介导路径(observation-mediated)
                                       ← 动作捷径(action-induced shortcuts)

关键概念: - 观察介导路径:返回的视觉证据「因果上导致」答案改变 - 动作捷径:答案由其他因素(模型内部 bias、任务类型等)决定,视觉操作只是一个「看起来在做事」的动作

三层干预审计

论文设计了三个层次的干预(intervention)实验,从粗到细:

1. Policy Level(策略层) - 比较:使用视觉工具 vs 直接推理(direct inference) - 直接对比准确率差异

2. Trajectory Level(轨迹层) - 干预:在 rollout 过程中破坏所有观察(corrupt all observations during rollout) - 目的:诊断轨迹层面整体准确率增益来自哪里

3. Step Level(步骤层)——最关键 - 干预:在固定前缀条件下,反事实替换单个观察(counterfactually replace one individual observation under a fixed prefix) - 核心指标:Visual Evidence Gain(VEG) - VEG = 使用真实观察时的答案概率 − 使用替换观察时的答案概率 - VEG > 0 说明该观察对答案有正向因果贡献 - VEG ≈ 0 说明该观察是「观察介导路径上的假动作」

失败模式分类

通过因果审计,论文归纳出两种失败模式:

失败模式 机制 表现
Calling Without Looking 视觉操作被执行,但返回的观察对答案没有任何因果影响 VEG ≈ 0;模型「看起来用了工具」但结果与不看图一样
Looking Without Planning 视觉观察本身有信息量,但调用时机/调度策略不连贯 观察有价值但整体决策链断裂

关键实验与数据

评测设置: - 模型:6 个代表性多模态模型(原文 abstract 未列出具体模型名)⚠️ - 基准:5 个细粒度感知 benchmark(原文 abstract 未列出具体名称)⚠️

核心发现: 1. Policy Level:视觉工具使用带来边际或负向准确率增益(在某些模型/任务上) 2. Trajectory Level:准确率增益集中在「一小部分校准良好的样本」(Calibrated minority),而非广泛分布 3. Step Level(VEG):大多数视觉操作在单步层面不产生因果效应

⚠️ 数字核验:论文 abstract 未给出具体准确率数字、VEG 分布或两个失败模式的具体占比,仅定性描述为「边际或负向增益」和「增益集中于 Calibrated minority」。具体量化数据需 fetch 原文正文核验。

⚠️ 存疑:VEG 阈值未明确——VEG > 0 即判定为因果有效,但多大幅度才算「有意义」?原文未给出阈值选择依据,限制了跨研究对比的可行性。

⚠️ 存疑:"Calibrated minority"定义——原文未给出该子集的具体比例或筛选标准,读者无法判断其代表性。

亮点与局限

亮点: 1. 因果方法论创新:首次将因果推断(causal inference)系统性地引入多模态 Agent 的视觉工具使用评估,不是简单比准确率,而是问「因果贡献是什么」 2. 细粒度诊断:三层干预从粗到细,step-level VEG 是目前最精细的视觉证据因果贡献度量 3. 揭示根本性问题:Calling Without Looking 直接击穿了「多模态 Agent 通过视觉工具更可靠」的假设,对工程实践有直接警示意义 4. 开源:代码公开于 GitHub/OpenCausaLab/CauAudit(⚠️ 需 fetch 核验链接有效性)

局限 / ⚠️ 存疑: 1. 6 模型 + 5 基准具体名称缺失:abstract 未列出,无法判断是否覆盖 GPT-4V、Claude Vision、Gemini 等主流模型,代表性存疑 2. VEG 阈值未明确:VEG > 0 的实际显著性标准缺失,限制了工程团队的直接复用 3. 任务范围:仅聚焦于细粒度感知任务,对复杂推理、规划类任务的适用性未验证 4. 修复建议缺失:论文定位为「审计」而非「方法」,提出了问题但没有给出如何改进工具调度策略的具体方案

对工程落地的启发

  1. 不要迷信视觉工具 = 更可靠:在选型多模态 Agent 时,「能执行 crop-zoom」不代表它真的在用这些信息——应该问「VEG 是多少」
  2. 工具调度审计是 Agent 质量评估的新维度:传统的准确率/Pass@k 指标无法区分「工具真正因果贡献」和「装饰性工具调用」——需要引入因果诊断
  3. 降低 token 成本的潜力:如果大量视觉操作是「Calling Without Looking」,裁剪这些操作可以显著减少 token 而不损失准确率
  4. Planning 能力需要单独评估:Looking Without Planning 暴露的是 Agent 的时序决策能力,而非感知能力——这两类问题需要不同的训练和评估方法

与同方向工作的关系

「视觉工具使用审计」站在多模态 Agent 与因果推理的交叉点:

  • 与 OpenCompass / LAMM 等多模态评测体系的关系:现有评测多以准确率为核心,CauAudit 补充了因果有效性这一新维度——两种评测互补
  • 与「InternVL3 / GPT-4V 工具使用」工作的关系:这些工作关注「如何让模型更好地使用工具」,CauAudit 回答的是「使用工具有没有用」,是上游的根本性问题
  • 与 CausalML / DAG-based reasoning 的关系:论文将视觉操作建模为 causal graph,是因果推断在视觉-语言领域的具体应用案例

一句话定位:CauAudit = 多模态 Agent 视觉工具的「因果X光」,不是问「准不准」而是问「有没有用」。

适合谁读

  • 多模态 LLM 研究者:必读——提供了评估视觉工具使用有效性的因果方法论
  • Agent 系统工程师:重点读 §3(因果图建模)和 §4(工程启发),理解如何审计自己的工具调度策略
  • 因果推断研究者:因果图 + 三层干预的框架可以直接迁移到其他工具使用场景
  • 多模态应用产品经理:理解「视觉工具使用幻象」可以避免过度依赖不成熟的视觉 Agent 功能

工程落地与核查(Jay)

落地路径与实际系统集成

CauAudit 的工程落地价值在于它的审计框架,而非可以直接部署的完整系统。以下是三个层次的集成路径:

1. 直接复现 VEG 审计(适用于自研多模态 Agent 团队) - CauAudit 的三层干预框架可以在自己的系统上复现,无需完整复现论文评测 - 最小化可行实现: 1. 录制 Agent 的视觉工具调用轨迹(工具名 + 返回的图像描述) 2. 对单个观测点做反事实替换(将该观测替换为空白或随机噪声) 3. 比较替换前后的答案概率差,即 VEG 近似值 - ⚠️ 关键依赖:需要模型输出答案概率(logprobs),非概率输出的系统需额外接入 - ⚠️ 注意:VEG 阈值(判断「因果有效」的标准)原文未给出,建议在自己的系统上先跑 baseline 分布再定阈值

2. 用开源代码做第三方审计(适用于采购/集成的团队) - 论文声称代码开源于 GitHub/OpenCausaLab/CauAudit - ⚠️ 需 fetch 核验:链接有效性、依赖版本(是否对最新版多模态模型兼容)、运行文档完整性 - 建议先在 1-2 个自有数据集上跑通,再评估是否适用于生产系统的定期审计

3. 用核心结论指导产品设计(适用于所有多模态 Agent 产品团队) - Calling Without Looking 的高频出现意味着:对于不需要细粒度视觉判断的任务(如图像主题识别、物体计数),直接 LLM 推理可能比工具调用更高效 - Looking Without Planning 的发现意味着:视觉工具的调度策略(何时调用、调用哪个 crop)是独立于感知质量的另一层能力,需要单独训练或评估 - ⚠️ 结论适用边界:当前发现仅基于细粒度感知任务(图表理解、OCR、密集小目标),复杂推理类任务的 VEG 分布可能完全不同,不可直接外推

主要坑点

坑点 具体表现 应对方式
VEG 阈值未定义 无法直接用 VEG > 0 做 binary 判断 先在 baseline 数据上建立 VEG 分布,用统计显著性(p < 0.05)替代固定阈值
模型名称缺失 6 个测试模型未知,GPT-4V/Claude 等主流模型是否覆盖存疑 ⚠️ 必须 fetch 原文正文确认;若是非主流模型子集,结论代表性大幅下降
VEG 反事实替换质量 替换观察时使用什么作为「反事实」将极大影响 VEG 数值 建议对同一样本用多种替换策略(空白、噪声、错误crop)对比,确保 VEG 对替换策略鲁棒
Step-Level 干预的计算成本 每个视觉操作步骤都需要一次完整的 agent rollout,计算成本高 先用 Trajectory Level 做粗筛(有显著增益才进入 Step Level),避免不必要的全量审计
开源代码质量 CauAudit 代码可能是研究原型,非生产级质量 需要完整跑通 README 中的示例,确认无隐藏依赖再用于生产审计

未解决问题

  1. 模型列表与 benchmark 名称缺失:abstract 未披露 6 个模型和 5 个基准的名称,无法判断结论对主流商用模型的覆盖性
  2. VEG 阈值的统计学意义:VEG > 0 在统计上是否显著(需多少样本量才能达到 p < 0.05)未给出
  3. 修复方案缺失:论文仅诊断问题,未给出如何训练模型减少 Calling Without Looking 发生率的建议,Looking Without Planning 的改善策略也未探讨
  4. 跨任务泛化性未知:细粒度感知任务之外,VEG 的分布和失败模式是否保持一致,尚未验证