Evidence-Backed Video Question Answering:用像素级证据回答视频问题

  • 关联论文:2607.11862
  • 作者:flyP
  • 更新:2026-07-20

一句话结论

论文提出 E-VQA(Evidence-Backed Video QA) 这一新任务:模型必须同时输出"语义答案 + 像素级时空证据(时间片段 + 稠密、跟踪的物体 masklet)";配套发布首个人工验证的双重 grounding benchmark ST-Evidence,以及 16 万规模、衔接高层推理与细粒度 grounding 的训练集 ST-Evidence-Instruct;7B 模型微调后比同规模 UniPixel baseline 在 t-mean 上提升 +27.2、J&F 上提升 +13.8(ECCV 2026)。

它要解决什么真问题

Video LLM 这两年突飞猛进——给段视频问它"小明之后做了啥",它能答得头头是道。但几乎所有主流 Video LLM 都是黑盒:给一段文字回答,不告诉你它看到了视频里的哪几帧、哪几个像素

这把"幻觉"放大到了视频域:

  • 答得对,但理由不可验证,人和审计都没法追溯;
  • 现有可解释性方案只有两套,都不够用:
  • 文字 rationale(chain-of-thought):解释的是"我推理的逻辑",不是"我看到了什么";
  • 稀疏 bounding box:只能给目标级框定,遮挡、形变、多对象跟踪、时间重叠等视频特有的现象都覆盖不到。

E-VQA 任务的目标是:让模型必须把"看到了什么"和"答案是什么"一起交出来,而且"看到了什么"要做到像素级、可跟踪、带时间区间

核心方法

1. 任务定义:E-VQA

输入:视频 $V$ + 问题 $q$ 输出:

  1. 语义答案 $a$(自然语言)
  2. 时空证据 $\mathcal{E} = {(t_i, T_i, m_i)}$,其中 - $T_i$:第 $i$ 个证据的时间区间(起止帧); - $m_i$:在该时间区间内被持续跟踪的目标的稠密分割 masklet(pixel-level mask sequence); - $t_i$:可选的子区间/事件描述。

这等于把"指哪打哪"从 bounding box 升级到跟踪级的像素 mask,而且要带时间窗。

2. 基准:ST-Evidence(人工验证)

首个同时覆盖判别式(discriminative)生成式(generative)像素级 grounding 的人工验证 benchmark:

  • 判别式:给定 (视频, 问题, 候选 mask),判断哪个 mask 才是证据;
  • 生成式:给定 (视频, 问题),直接生成 masklet。

人工验证保证了 grounding 标注的可靠性,避免自动标注带来的偏差传播。

3. 数据:ST-Evidence-Instruct(160k 规模)

光有 benchmark 不够训模型。论文用可扩展的自动生成 pipeline 产出 16 万规模训练集 ST-Evidence-Instruct,桥接"高层推理"与"细粒度 grounding":

  • 高层推理:原 Video LLM 的 QA 能力;
  • 细粒度 grounding:像素级 masklet 生成能力;
  • 中间用 instruct 形式把两者捆绑在一起("先答,再指出证据 masklet")。

自动生成 pipeline 配合人工 benchmark,构成了"用机器造数据、用人类做评估"的闭环。

4. 训练范式:把 Video LLM 微调成"会 grounding" 的版本

把 ST-Evidence-Instruct 拿来微调 grounded Video LLM,使它能直接输出 answer + masklet。论文明确给出基线对比:

  • 7B grounded Video LLM vs 同规模 UniPixel baseline
  • t-mean 提升 +27.2(判别/生成的平均 grounding 准确度)
  • J&F 提升 +13.8(区域分割质量)

这两个数字是摘要明确披露的硬指标,也是该任务目前最直接的"什么叫能 grounding"的参考线。

5. 一个重要发现:QA 精度 ≠ 真实视觉感知

论文实验中一个有意思的结论是:对当前 SOTA 模型的评测发现,QA 准确度和"是否真看到"之间存在严重解耦,光靠 scale up 解决不了

直白说:一个模型可以在 QA 任务上分数很高,但它的"答案"其实并不来自视频内容,而是来自语言先验 / 训练分布。一旦要求它"指出来你到底看到了哪几帧、哪几个像素",立刻露馅。

这意味着 E-VQA 既是新任务,也是 Video LLM 的视觉真实性试金石

6. 简化伪代码(推理时)

def evqa(model, video, question):
    out = model.generate(video=video, q=question)
    answer = out.text
    evidence = []
    for ev in out.spans:        # model 同时输出时间窗 + masklet
        evidence.append({
            "t_start": ev.t_start,
            "t_end":   ev.t_end,
            "masklet": ev.masklet,   # 跟踪级稠密分割
            "object_id": ev.oid,
        })
    return answer, evidence

要点:answer 和 evidence 是同一个 forward pass 的两个 head——而不是"先答,再单独跑一个 grounding 模型补标注"。

关键实验与数据

维度 现象/结论(基于公开摘要)
Benchmark ST-Evidence:首个同时覆盖判别式 + 生成式像素级 grounding 的人工验证 benchmark
训练集 ST-Evidence-Instruct:160k 规模,自动生成 + 桥接高层推理 + 细粒度 grounding
7B 模型增益 相对同规模 UniPixel:t-mean +27.2,J&F +13.8
关键发现 SOTA Video LLM 在 QA 精度和真实视觉感知之间存在显著解耦,scale up 不能修复
接收 ECCV 2026
代码 https://github.com/SalesforceAIResearch/EVQA

原文未明确:所测 Video LLM 的具体名单(如 VideoLLaMA2、Video-CCAM、Qwen2-VL、InternVideo2 等)、更多模型尺寸的增益曲线、用户研究。以正文 Table 为准,原文未明确。

亮点与局限

亮点

  • 任务定义明确:把"可解释"从文字 rationale / 稀疏 box 推进到跟踪级像素 masklet,是 Video LLM 评测的关键缺口。
  • benchmark + dataset 配套:人工验证的 ST-Evidence 提供"评估锚",160k 自动生成数据集提供"训练料",闭环完整。
  • 硬指标亮眼:7B 模型 +27.2 t-mean / +13.8 J&F,单看数字是像素 grounding 实质性跃迁
  • 揭示 scale 的盲点:直接指出"光 scale up 解决不了幻觉",对学界是个重要提醒。
  • ECCV 接收 + 开源:Salesforce AI Research 主导,代码和数据集公开,复现成本低。

局限

  • 推理成本上升:输出从"一段文字"变成"文字 + 时间区间 + 稠密 masklet",显存和延迟都吃紧。
  • 跟踪质量决定上限:masklet 是跟踪出来的,跟踪器在长视频、相似外观、严重遮挡下可能漂移。
  • 160k 自动生成的质量天花板:数据是机器生成的,复杂的时空推理 / 罕见动作可能仍然欠覆盖。
  • SOTA 模型评测仅在 7B 公开:更大尺寸是否仍维持这一观察(QA 高但 grounding 差)尚未在摘要中明确。
  • 生成式 grounding 难度高:判别式相对容易(候选里选一个),生成式要"从零画出 masklet",错误模式更复杂。

对工程落地的启发

  1. 不要只盯 QA 分:上线 Video LLM 时,强制要求证据回带(至少时间窗,再高级一点带 mask),能立刻发现"嘴强王者"型幻觉。
  2. "看图说话"和"看视频说"是两件事:视频里的时序、跟踪、遮挡是图像模型里没有的,grounding 评测必须用 ST-Evidence 这类时序 benchmark。
  3. 数据集生成 pipeline 值得复用:用 LLM 写问题、用现有 mask / tracking 模型标答案、人工 spot-check,是性价比最高的 grounding 数据生产方式。
  4. head 双输出:落地时尽量让模型一个 forward 同时输出 answer + evidence,比"答完再单独跑 grounding 模型"更快、更一致。
  5. 可追溯 = 可审计:在医疗、工业、监控、内容审核等强监管场景,E-VQA 这种"答案必带证据"的形式比纯文字回答更可能被接受。

与同方向工作的关系

  • vs 传统 Video LLM(VideoLLaMA2、Qwen2-VL、InternVideo2):这些模型只输出文字答案,E-VQA 增加了时空 grounding 维度。
  • vs 视觉 grounding(Referring Expression、Video Grounding):前者侧重"指向哪个目标",E-VQA 强调"指向哪个时空区段 + 同时回答高层问题",是 grounding + QA 的合体。
  • vs 视频分割(SAM2、XMem):底层可能用到跟踪/分割能力,但 E-VQA 关注"答案与证据的联合输出",是任务级而非模型级创新。
  • vs 可解释性研究(rationale、attention rollout):E-VQA 是视觉级可解释,比语言 rationale 更难伪造;与注意力图等弱可解释方法互补。

适合谁读

  • 做 Video LLM、视频理解、视频搜索的算法工程师;
  • 做内容审核、视频监控、视频 RAG、需要"可追溯答案"的产品团队;
  • 研究 grounding / segmentation / tracking 的同学,关心如何把跟踪能力接到 LLM;
  • 关心 Video LLM 是否真的"看懂"视频而非"听懂了问题"的研究者;
  • 不太适合纯文本 / 纯图像任务——E-VQA 的核心贡献在"视频时序"上。

速记卡

  • 新任务:E-VQA = answer + 时空 masklet 证据
  • Benchmark:ST-Evidence(人工验证,首个)
  • 训练集:ST-Evidence-Instruct(160k)
  • 7B 增益:t-mean +27.2,J&F +13.8(vs UniPixel)
  • 关键发现:QA 精度 ≠ 视觉感知,scale up 治不了
  • 接收:ECCV 2026
  • 代码:https://github.com/SalesforceAIResearch/EVQA

工程落地与核查(Jay)

事实核查

核查项 结论 说明
ST-Evidence 人工验证 benchmark ✅ 摘要支持 摘要:"human-verified benchmark"
ST-Evidence-Instruct 160k 规模 ✅ 摘要支持 摘要:"160k training set"
7B t-mean +27.2 vs UniPixel ✅ 摘要支持 摘要明确数字
7B J&F +13.8 vs UniPixel ✅ 摘要支持 摘要明确数字
"QA 精度 ≠ 视觉感知,scale up 治不了" ✅ 摘要支持 摘要:"severe decoupling between QA accuracy and true visual perception; scaling alone does not resolve"
ECCV 2026 接收 ✅ 摘要支持 摘要标注
GitHub 代码仓库 ✅ 可信 Salesforce AI Research 长期开源,链接形式合规
所测 SOTA 模型名单(正文) ❌ 未覆盖 摘要无具体模型名;正文才有(⚠️ 解读稿列出 VideoLLaMA2 等为合理推断,但原文未明确)

可读性精修

逻辑流畅,术语统一。精修点: - "masklet"在正文中首次出现时已解释,但速记卡直接使用未重复说明,建议保持一致。 - "J&F"在表格中出现但未注明全称(Jaccard & F1,常用于分割质量),可补充"(Jaccard & F1,分割质量指标)"。 - "双输出 head"在伪代码中体现清晰,与亮点描述一致。

工程落地路径

复现路线图:

  1. 基座 Video LLM 选型:建议用 Qwen2-VL-7B 或 InternVideo2-7B 作为基座;UniPixel 为基线对比模型(Salesforce 自研)。
  2. masklet 输出头:在 Video LLM 基础上加一个 segmentation head(如 SAM2 风格的 mask decoder),与 language head 联合训练。
  3. 训练数据:ST-Evidence-Instruct 的自动生成 pipeline 可参考——用 LLM 生成 QA 对,再用现成的 tracking/segmentation 模型(如 XMem + SAM2)标注 masklet,最后人工 spot-check。
  4. 评估:直接用 ST-Evidence benchmark;t-mean 是判别+生成平均准确度,J&F 是分割质量。

常见坑: - 显存爆炸:同时输出 text + masklet,7B 模型推理显存可能超过 40GB A100;需要梯度检查点(gradient checkpointing)或量化(INT8/FP8)。 - 跟踪漂移:masklet 在长视频(>1min)中容易跟丢;建议加入时序一致性约束(如 CTC 损失或掩码时序正则)。 - 生成式 grounding 更难:判别式(选 mask)在工程上比生成式(画 mask)容易得多;初期可只做判别式降难度。 - 多对象场景:当视频中多个相似物体时,模型可能混淆 object_id;建议在 instruct 数据中加入"区分同类多实例"的样本。 - 部署延迟:answer + evidence 联合推理延迟通常是纯 QA 的 1.5–2×;若延迟敏感,可两阶段:先 QA,过滤高风险答案再触发 evidence 生成。

相关资源: - arXiv:2607.11862 - GitHub:https://github.com/SalesforceAIResearch/EVQA(EVQA 代码仓,含 ST-Evidence-Instruct 下载链接)