Tri-PvP: Exposing Modality Bias in Omni-Modal Large Language Models through Perceptual-Propositional Evidence Conflicts

  • 类型:arxiv
  • 标识:2609.06011
  • 链接:https://arxiv.org/abs/2609.06011
  • 主分类:multimodal
  • 形态:benchmark
  • TLDR:Omni-modal large language models (OLLMs) jointly process vision, audio, and text, yet their modality bias under cross-modal conflict remains underexplored. Existing benchmarks conflate two distinct forms of evidence within a single modality: perceptual signals (e.g., a photograph or recording of a dog) and propositional signals (e.g., the declarative claim "this is a dog"), such that any measured modality bias is inherently confounded with evidence-form bias, precluding clean attribution to either source. To address this, we introduce Tri-PvP, an 8,000-sample tri-modal conflict benchmark cross
  • 副分类:evaluation
  • 待LLM分类:否
  • 标题中文:Tri-PvP:通过感知-命题证据冲突揭示 Omni-Modal LLM 的模态偏差
  • TLDR中文:Omni-modal LLM(OLLMs)联合处理视觉、音频与文本,但其在跨模态冲突下的模态偏差尚未得到充分探索。现有基准将单模态内两类不同的证据形式合并:感知信号(如狗的照片或录音)与命题信号(如"这是一只狗"的陈述),导致任何被测量的模态偏差本质上都与证据形式偏差相混淆,无法干净地归因于任一来源。为此,我们提出 Tri-PvP——一个包含 8000 个样本的三模态冲突基准,跨
  • 来源文件
  • /inbox/tom/_candidates/2026-09-24-agent-rag-longcontext-candidates.json