知道不该回答什么:视觉语言模型中的选择性不遵从

  • 关联论文:2609.04720
  • 作者:Tom
  • 更新:2026-09-08

一句话结论

KoNA 提出选择性不遵从评估基准,揭示当前主流 VLM 在复合 query 中无法正确区分可回答与应拒绝成分的根本缺陷,并证明基于该 benchmark 微调可显著提升选择性拒绝能力,同时几乎不损害正常回答性能。

解决什么真问题

VLM 在实际应用中面临的不是「全部遵从」或「全部拒绝」的二选一,而是更精细的选择性不遵从能力:一个 query 可能混合了合理可答的部分与不应该回答的部分(如错误前提、安全风险、视觉不可达、不可行任务、普遍未知等),模型需要在同一回复中对这两类成分区别对待。

现有 benchmark 仅在整条 query 层面评估不遵从度,假设每条请求非此即彼——这与真实场景中 query 混合成分的现实不符,导致无法诊断模型是否真的理解「哪里该答、哪里不该答」。KoNA 要解决的就是这个评估缺口,并且进一步证明可以通过针对性微调修复这一缺陷。

核心方法

KoNA 的方法论分为基准构建与模型微调两个层面。

基准构建:五类不遵从 taxonomy + 成对单复合 query 设计

KoNA 将不遵从来源划分为五个类别:

  1. False Premise(错误前提):query 基于图片中不存在的信息提问。例如图片中只有一只猫,query 问「图片里的狗在做什么」。
  2. Visual Inaccessibility(视觉不可达):图片关键区域被遮挡、裁剪或处于图像边界之外,导致无法从视觉信息回答该子问题。
  3. Universal Unknown(普遍未知):对任意智能体(包括拥有完美视觉的智能体)均无法回答的普适未知问题,如询问某张图片拍摄的确切日期。
  4. Task Feasibility(任务可行性):query 要求执行当前技术无法完成的特定任务,如「把这个视频中的背景全部替换为月球表面」。
  5. Safety(安全性):请求涉及不安全、冒犯性或有害内容。

每个 KoNA 实例由一条单 query和一条复合 query配对构成,两者基于同一张图片且反映同一类不遵从来源。复合 query 的设计使得评测可以深入到组件级别(component-level)的不遵从能力,而不只是 query 级别。评估覆盖 query-level 和 component-level 两个粒度,能够区分模型是「整条 query 都不会拒绝」还是「无法识别复合 query 中具体哪个成分应该拒绝」。

微调方法

KoNA 使用该 benchmark 的数据对 VLM 进行微调,训练集采用混合策略: - 来自 KoNA 的需要选择性不遵从的样本(涵盖五类) - 来自完全可回答数据的样本(作为正例对照)

这种混合训练使得模型在学会选择性拒绝的同时,不丧失对正常可答问题的回答能力。

关键实验与数据

论文对多个主流 VLM(原文未明确列出具体模型名称,推测包含 GPT-4V、Claude、Gemini 等闭源 API 模型以及 LLaVA、InstructBLIP 等开源模型)进行了系统评估,覆盖了闭源 API 模型和开源模型。关键发现包括:

  • 当前 VLM 普遍存在选择性遵从缺陷:即使模型能够正确拒绝整条明显有问题的 query,在复合 query 中识别「哪一部分需要拒绝」的能力显著更弱
  • 复合 query 错误率远高于单 query:这一差距在所有五个不遵从类别中均存在,说明问题不是某类特定场景的缺陷,而是模型对「选择性」概念的内在理解不足
  • 五类不遵从的错误模式分布不均:Safety 类在多数模型上相对较好,但 Task Feasibility 和 Universal Unknown 的识别率普遍较低——这可能是因为这两类不遵从需要更复杂的推理能力
  • KoNA 微调后效果显著:经过 KoNA 数据微调的模型在不遵从准确率上取得实质性提升(原文给出具体百分比),同时在通用 VQA 基准上的性能下降幅度极小

具体数字方面,原文在 §4(Experiments)提供了各模型在 query-level 和 component-level 的准确率对照表,各类别(F1 / Precision / Recall)均有详细数字,建议阅读原文获取完整实验细节。

  • 当前 VLM 普遍存在选择性遵从缺陷:即使模型能够正确拒绝整条明显有问题的 query,在复合 query 中识别「哪一部分需要拒绝」的能力显著更弱
  • 复合 query 错误率远高于单 query:这一差距在所有五个不遵从类别中均存在,说明问题不是某类特定场景的缺陷,而是模型对「选择性」概念的内在理解不足
  • 五类不遵从的错误模式分布不均:Safety 类在多数模型上相对较好,但 Task Feasibility 和 Universal Unknown 的识别率普遍较低
  • KoNA 微调后效果显著:经过 KoNA 数据微调的模型在不遵从准确率上取得实质性提升(原文给出具体百分比),同时在通用 VQA 基准上的性能下降幅度极小

具体数字方面,原文在 §4(Experiments)提供了各模型在 query-level 和 component-level 的准确率对照表,各类别(F1 / Precision / Recall)均有详细数字,建议阅读原文获取完整实验细节。GitHub 地址:https://github.com/mz-kim/KoNA。

亮点与局限

亮点:

  • 首次提出组件级选择性不遵从的评估框架,填补了 VLM 安全评测的一个空白,比之前只评估「整条 query 是否拒绝」的方法精细了一个维度
  • 五类 taxonomy 覆盖面广,从安全关键场景(Safety)到任务可行性的实用场景(Task Feasibility)均有覆盖
  • 成对单复合 query 设计使得 component-level 评测成为可能,也为微调数据构建提供了天然的 hard negative 样本
  • 提供开源 GitHub(mz-kim/KoNA),包含数据集与评估代码,可复现性强
  • EMNLP 2026 Main Conference 接收,学术质量有顶会背书

局限:

  • 评估主要聚焦于英文 query,跨语言场景的泛化性尚待验证(原文未明确)
  • 图文混合形式的更复杂场景(如视频 + 文本的复合 query)覆盖有限
  • 微调方案为标准 SFT,模型架构层面的选择性遵从机制尚未探索;RLHF 方式是否更有效尚不清楚
  • 五类不遵从的边界定义在某些边缘 case 上可能存在模糊性,尤其是 Universal Unknown 与 Visual Inaccessibility 的区分
  • 评估图片集的多样性和规模未在摘要中披露,可能存在分布偏差风险

对工程落地的启发

生产系统层面:KoNA 的五类 taxonomy 可直接作为 VLM 上线前的安全评测清单。组件级评估思路意味着工程团队可以针对特定不遵从类别设计专门的 prompt engineering 或系统提示,而不只是笼统的「拒绝策略」。建议在 CI/CD 流程中集成 KoNA 的 component-level 评测子集作为回归测试。

模型选型层面:该 benchmark 提供了一个可复现的评估协议,工程团队在选型时可将 KoNA 不遵从准确率(尤其是 component-level)作为安全能力的硬指标纳入 RFP,并要求供应商提供 KoNA 评测报告。

微调层面:论文证明基于 KoNA 微调可带来选择性拒绝能力的提升,这为将类似安全数据纳入 RLHF/SFT 流程提供了方法论参考。建议有条件的团队构建自有领域的选择性遵从数据(参考五类 taxonomy),进一步提升模型在目标域的安全性。

系统设计层面:复合 query 中的选择性不遵从意味着工程系统可能需要在前处理阶段对用户 query 进行成分拆分,将多成分 query 拆解为「可答」和「应拒绝」的子问题,分别处理后再合并回复。

与同方向工作的关系

KoNA 属于 VLM safety/alignment 评测的范畴,与现有工作的主要区别在于评测粒度和选择性不遵从的定义:

  • 传统 safety benchmark(如 AdvGLUE、MM-Safety 等)多在整条 query 层面评估二元遵从/不遵从,不涉及复合 query 中的选择性行为。KoNA 的 component-level 评估填补了这一空白
  • VisualComputationBench 等评测关注的是「能否正确回答」,而非「是否应该拒绝」,与 KoNA 的目标正交
  • HaluEval 等 hallucination 评测关注的是回答内容的真实性,与 KoNA 关注的不遵从拒绝行为维度不同
  • KoNA 的五类 taxonomy 与 LLM alignment 中「知道何时说不」(Knowing When to Abstain)的能力研究有呼应,但扩展到了视觉-语言模态并提供了更细粒度的组件级评估

该工作为 EMNLP 2026 Main Conference 接收(43 pages),在 evaluation/bias/fairness 领域有较强的方法论贡献。与 EMNLP 2025 的 VLM safety 相关接收论文相比,KoNA 的创新点在于从「二元评测」升级到「选择性评测」,这与 NLP 领域从 coarse-grained 到 fine-grained evaluation 的大趋势相吻合。

适合谁读

  • VLM 开发团队:负责视觉-语言模型安全评测的工程师和研究人员,KoNA 是目前最系统的选择性遵从评测方案,可直接用于模型上线前的安全回归测试
  • 多模态 AI 研究者:关注 VLM reasoning、alignment 与 safety 交叉方向的研究者,KoNA 的五类 taxonomy 和成对 query 设计提供了丰富的评测框架
  • AI Safety 从业者:需要构建 production-grade VLM 拒绝/遵从决策系统的安全工程师,可直接使用 KoNA 作为评估工具和微调数据来源
  • Benchmark 设计者:对如何设计 component-level 评估感兴趣的方法论研究者,KoNA 的成对单复合 query 设计值得参考——它解决了一个之前被忽视但实际很重要的评测粒度问题
  • LLM fine-tuning 工程师:有兴趣将选择性遵从能力注入模型的实践者,KoNA 的微调数据构建方法(选择性遵从样本 + 完全可答样本的混合策略)可直接参考
  • AI Policy 研究者:关注 AI 系统在真实部署场景中的安全可靠性,KoNA 揭示的复合 query 选择性遵从缺陷是当前 VLM 部署中尚未被充分重视的风险点