arXiv:2609.06011 · 多模态
Tri-PvP: Exposing Modality Bias in Omni-Modal Large Language Models through Perceptual-Propositional Evidence Conflicts
Tri-PvP:通过感知-命题证据冲突揭示 Omni-Modal LLM 的模态偏差
Tri-PvP: Exposing Modality Bias in Omni-Modal Large Language Models through Perceptual-Propositional Evidence Conflicts
- 类型:arxiv
- 标识:2609.06011
- 链接:https://arxiv.org/abs/2609.06011
- 主分类:multimodal
- 形态:benchmark
- TLDR:Omni-modal large language models (OLLMs) jointly process vision, audio, and text, yet their modality bias under cross-modal conflict remains underexplored. Existing benchmarks conflate two distinct forms of evidence within a single modality: perceptual signals (e.g., a photograph or recording of a dog) and propositional signals (e.g., the declarative claim "this is a dog"), such that any measured modality bias is inherently confounded with evidence-form bias, precluding clean attribution to either source. To address this, we introduce Tri-PvP, an 8,000-sample tri-modal conflict benchmark cross
- 副分类:evaluation
- 待LLM分类:否
- 标题中文:Tri-PvP:通过感知-命题证据冲突揭示 Omni-Modal LLM 的模态偏差
- TLDR中文:Omni-modal LLM(OLLMs)联合处理视觉、音频与文本,但其在跨模态冲突下的模态偏差尚未得到充分探索。现有基准将单模态内两类不同的证据形式合并:感知信号(如狗的照片或录音)与命题信号(如"这是一只狗"的陈述),导致任何被测量的模态偏差本质上都与证据形式偏差相混淆,无法干净地归因于任一来源。为此,我们提出 Tri-PvP——一个包含 8000 个样本的三模态冲突基准,跨
- 来源文件:
- /inbox/tom/_candidates/2026-09-24-agent-rag-longcontext-candidates.json