「问 AI 一张图,AI 给答案」这件事的祖师爷:VQA 这篇论文给了 9 年多模态比赛的标准答案

  • 关联论文:1505.00468

你有没有想过 🤔:

当你给 ChatGPT 发一张图、问「这张图里的猫在做什么」,它能秒回「趴在窗台上晒太阳」——这个「看图 + 理解问题 + 自然语言回答」的能力是怎么来的?

当 GPT-4V、Qwen-VL、LLaVA 在各种「视觉问答」榜单上刷分时,它们究竟在和什么样的基准做对比?

答案是:2015 年由 21 位作者联合发布的 Visual Question Answering(VQA)v1.0 数据集——arXiv 1505.00468。这篇论文第一次把「图像 + 自然语言问题 + 自然语言答案」定义成一个可量化评测的任务,并发布了约 0.25M 张图 / 0.76M 个问题 / 10M 个答案的众包数据集——从此 VQA 成为了多模态模型的事实标准基准之一,从最早的 VQA model 到今天的 GPT-4V,每一代多模态模型都要在 VQA 榜单上报一个数字

被引超过 6600 次——这不是「又一个数据集」,而是定义了一个研究领域的工业模板


一、先回到 2015 年:CV 和 NLP 是两条互不说话的平行线

2014-2015 年的 AI 圈有个尴尬的局面:

  • CV(计算机视觉)能告诉你图里有「猫」还是「狗」、猫在图的左上方还是右下方——但它看不懂一句话
  • NLP(自然语言处理)能写文章、做翻译、回答文字问题——但它看不见图

而人类看世界的方式是同时用眼睛和语言的:你看到一个场景,会自然地问「他在做什么」「为什么这里堵车」「那个东西是什么牌子的」——这种「视觉问答」才是真正的智能。

但当时的研究者面对三个难题:

  1. 没有公开的评测任务:要做视觉问答研究,你连「该在什么数据上比什么指标」都不确定;
  2. 没有大规模数据:2014 年 Malinowski 等人的 DAQUAR 数据集只有几百张图、几百个问题——根本训练不出像样的模型;
  3. 评测协议不明确:自然语言答案不唯一("红" 还是 "红色"、"是" 还是 "嗯"),怎么自动打分是个开放问题。

arXiv 1505.00468(Antol et al., 2015, ICCV 2015)一次性把这三件事都解决了


二、核心机制:把「问图」变成可评测的工业任务

VQA 这篇论文做的事情看起来朴素,但每一步都是奠基性的:

1️⃣ 数据集:0.25M 图 / 0.76M 问题 / 10M 答案

  • 图像来源:Microsoft COCO 真实照片 123K 张 + 抽象场景图 50K 张(卡通块状画,剥离背景纹理,强迫模型看「语义」而不是像素 leakage);
  • 问题:每张图配 3 个问题,由 Amazon Mechanical Turk 众包产生;通过规则限制 yes/no 类问题占比 ≤ 50%;
  • 答案:每个问题由 10 个不同标注员回答,得到约 10M 个答案——通过规范化(去冠词 a/the、标点、空格、动词形式)归类到约 24K 大小的核心答案词表;
  • 意义:这是当时 CV 圈最大的众包多模态语料之一,直接催生了「视觉问答」这条 9 年长河的研究主线

这一组数字的具体值在原文 Statistics 段落均有,但部分数字(如众包总成本)未在公开页明确给出,本文标注「数字以原文 Statistics 段落为准」。

2️⃣ 评测协议:Open-ended vs Multiple-choice

论文同时定义了两套评测:

  • Open-ended (OE):模型生成全部答案空间的 softmax,与人工答案列表算 top-K 命中分(每个答案按其在全体标注里出现的频率归一化权重);
  • Multiple-choice (MC):每个问题给 18 个候选答案(4 个合理 + 4 个反例 + 10 个通用但错的),做 18 分类。

这两套协议今天还在用——VQA v2、OK-VQA、GQA 等所有后续数据集都基于这个基本框架。

3️⃣ Baseline 体系:从简单到复杂

论文给出了五类 baseline,按从弱到强排:

  • LSTM-Q + I (BoW):图像 VGG fc7 + 问题词袋拼接 + MLP——准确率约 53.7%(OE)/ 57.1%(MC);
  • LSTM-Q + I:把问题编码换成 LSTM——准确率略高;
  • LSTM-Q + I + Attention:用 VGG conv5 输出 14×14×512 空间特征,对问题做 attention 加权——这是 VQA 第一个明显 work 的 attention 范式,比纯全局特征高 5-8 个百分点;
  • 深层网络设计(DeFrag、DPPnet):分层 attention / dynamic parameter——准确率 60.4-62.4%;
  • 人类(Human):约 78.4% (OE) / 96.4% (MC)——给后续留下了长达 6 年的「Human Parity 追赶赛」。
# 一个 minimal VQA 模型(LSTM-Q + global image)
def vqa_model(image, question):
    img_feats = vgg16_features(image)              # (B, 4096)
    word_embs = word2vec(question)                 # (B, T, 300)
    q_emb, _ = LSTM(word_embs, last_hidden=True)   # (B, 1024)
    fused = mlp(concat([img_feats, q_emb]))        # (B, 1000)
    return softmax(fused)                          # answer logits

4️⃣ 揭露了一个惊天发现:语言先验(Language Prior)

论文还披露了一个对后世影响巨大的事实:所有 baseline 都严重依赖语言先验——对 yes/no 类问题,模型只看问题就能拿到约 67% 的准确率,图像基本没用

什么意思?就是说「这是猫吗?」这种问题,模型根本不看图,直接答「是」就能蒙对 67%——因为训练数据里 yes 比 no 多。

这是后续所有「反 shortcut」研究(VQA v2 平衡二元答案、AdVQA、C-VQA)的起点——也是今天做产品级 VQA 必须警惕的「内置 bug」。


三、三个洞察:为什么这篇论文能成为奠基作

🔑 洞察 1:「任务 + 评测 + 数据集」三位一体 = 研究影响力

很多 2015 之后的 SOTA 论文被广泛引用,背后真正重要的是它发布了一个基准,而不只是单一方法创新。

VQA 论文同时给了你:

  • 任务定义(问图答图);
  • 数据集(0.25M / 0.76M / 10M 三件套);
  • 评测协议(OE + MC 双协议);
  • Baseline 体系(从最弱到人类的完整谱系);
  • 在线 demo(CloudCV.org,2015 年少见的「benchmark 即服务」形态)。

这五件东西任何一件单拿出来都不算开创,但组合在一起就构成了一个可被 100+ 后续工作反复使用的工业模板——这就是为什么被引能上 6600+。

🔑 洞察 2:答案规范化是「被低估的工程难题」

VQA 的成功很大程度上来自「答案几乎都是 1-2 词」——这恰好让自动评测有了协议。

但论文同时暴露了规范化本身的难题:「红 / 红色」「是 / 嗯」「人 / 男人 / 一个男人」该不该扣分?论文给出明确规范化方案(去冠词 / 标点 / 空格 / 动词形式),但这一难题在后续数据集(GQA)那里被回避——GQA 直接用完全确定的答案集来规避。

对今天做产品的启示答案归一化规则比模型本身更容易出错。做 A/B 测试时,同一答案被不同模型归一化成不同结果,整个评测体系就失效了。

🔑 洞察 3:抽象场景 50K 张的「哲学用意」

论文为什么要把 50K 张抽象卡通块状画也塞进数据集?

答案是:强迫模型真的看「语义」,而不是被像素级细节 leak

真实照片里,模型可能学会「如果背景是草,物体是动物 → 狗在公园」这种图像-答案的虚假相关。但抽象场景剥离了所有像素细节——只留下「语义骨架」,模型必须学会看物体形状和关系才能答对。

这个设计哲学影响了所有后续数据集——「抽象 vs 真实」「程序生成 vs 众包」的对照设计,成为视觉问答数据集设计的标准方法论。


四、「今天就能用」的工程切片

VQA v1.0 的很多思想在 2026 年的工程实践里依然活跃,下面是三个今天就能照搬的工程模板:

🛠️ 工程切片 1:用现代 VLM 部署 VQA

# 不要从 baseline 重建!直接用 VLM
from openai import OpenAI

client = OpenAI()
response = client.chat.completions.create(
    model="gpt-4-vision-preview",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": f"请根据这张图片回答问题:{question}"},
            {"type": "image_url", "image_url": {"url": image_url}}
        ]
    }]
)
answer = response.choices[0].message.content

# 答案后处理:接一个 answer normalization 层
def normalize(s):
    s = s.lower().strip()
    s = re.sub(r'\b(a|an|the)\b', '', s)
    s = re.sub(r'[^\w\s]', '', s)
    return s

适用场景:电商商品问答、文档理解、医疗影像问答、教育辅导。

🛠️ 工程切片 2:做产品级 VQA 必须「反 Language Prior」

# 上线前必须做的答案分布分析
from collections import Counter
answer_dist = Counter(all_train_answers)
top_10 = answer_dist.most_common(10)
# 如果 top-10 答案占比 > 40%,说明有严重的 language prior bug
# 解法:用 VQA v2 平衡数据微调,或在目标领域数据上重新分布

适用场景:任何「问 AI 一个问题」类产品的上线前评估。

🛠️ 工程切片 3:现代 VLM 也要警惕「记忆」陷阱

今天的 GPT-4V、Qwen-VL-Max、InternVL3 在 VQA v2 上拿 80%+ 的分数是可能的——但这样的高分数是否真实「理解图像」还是「记忆了答案」

解法: - 用对抗性问题集(C-VQA、AdVQA)测试模型是否真看图; - 用程序生成的数据集(CLEVR、GQA)测试 compositional reasoning; - 用知识型问题集(OK-VQA、A-OKVQA)测试真实推理。


五、后续 9 年它打开了什么门

年份 任务 / 模型 与 VQA v1.0 的关系
2015 VQA v1.0 本论文:建立可评测任务
2017 VQA v2.0 平衡二元答案,打掉语言先验
2017 SAN(Soft Attention)/ DPPnet VQA 第一个真正 work 的 attention 范式
2017 CLEVR 程序生成问题,强迫 compositional reasoning
2018 GQA(Hudson & Manning) 结构化 scene graph → 问题模板,可控复杂度
2018 TextVQA 场景里有文字,必须读 OCR 才能答
2019 OK-VQA / A-OKVQA 必须调用外部知识,无法靠 image 闭卷
2019-22 NMN / MAC / BAN / MCAN VQA 上的注意力机制演进
2020-22 UNITER / LXMERT / Oscar / BLIP 多模态预训练模型在 VQA 上刷榜
2022-23 BLIP-2 / InstructBLIP 把 VQA 转化为 instruction tuning 任务
2023+ GPT-4V / Qwen-VL / LLaVA / InternVL3 工业级多模态大模型,VQA 是必报基准

这条 9 年长河几乎每一代多模态模型都要在 VQA 上刷榜——即使你今天读到 BLIP-2、InstructBLIP、LLaVA 的论文,VQA v2 accuracy 都是必报指标。没有 1505.00468,就没有这条评测基准体系


⚠️ 必须看清的边界

写这篇论文的科普稿时,必须保持诚实:

  1. 训练规模对今天而言太小:0.25M 张图对 2018 年后的预训练模型而言已经不够;后续 VQA v2 把规模抬到 2×,OK-VQA / A-OKVQA 用更大的 image-text 数据集;
  2. 答案分布偏置是硬伤:yes/no 类占主体(训练集问题类型比例:what ≈ 28% / is ≈ 16% / are ≈ 11% / how many ≈ 10% / does ≈ 7%),简单模型可能因为「语言先验 + 表面相关」得到高分——这是 VQA v2、AdVQA 的起点;
  3. 没有显式「推理」接口:模型只是在全局特征上做分类,没法回答需要 chain of reasoning 的复杂问题——这一弱点直到 2023 年 LLM + VLM 才真正解决;
  4. 评测协议被「答案语义等价」问题困扰:「红 / 红色」「是 / 嗯」该不该扣分?论文给了明确规范化方案,但后续数据集(GQA)为了规避又引入了完全确定答案集;
  5. 现代 VLM 可能已经「处理过这些问题」:今天 GPT-4V / Qwen-VL 在 VQA v2 上拿 80%+ 分数,但这样的高分数是否真实「理解图像」还是「记忆了答案」仍存争议;
  6. 数字存疑:表 3 中 DeFrag / DPPnet / SAN 等具体 accuracy 数字需从原论文 Table 3 逐一核实,不能断言 AI 在 2015 年就已经「达到人类水平」——人类基线 78.4% OE 和最佳模型 62.4% OE 之间仍有 16 个百分点的差距;
  7. 众包总成本「约 50K USD 以上」为粗估:原文未在公开页给出精确数字,仅写了「不到一百万美元量级」,本文标注「数字以原文 Statistics 段落为准」;
  8. 被引 ≈ 6600 反映的是「参考价值」≠ 「绝对正确」:被引高 = 后续工作把它当作必要 baseline 引用,不代表它的所有结论都被验证——读论文时仍要回到原文。

一句话总结

arXiv 1505.00468 不是「又一个数据集」——它是第一次把「图像 + 自然语言问题 + 自然语言答案」定义成可量化评测任务的工作,从此 VQA 成为多模态模型的事实标准基准

没有这篇论文,今天的 GPT-4V、Qwen-VL、LLaVA、InternVL 等多模态大模型就失去了最核心的评测锚点之一

关联论文:1505.00468(Antol et al., 2015;ICCV 2015;0.25M 图 / 0.76M 问题 / 10M 答案;OE 78.4% / MC 96.4% 人类基线;表 3 最佳模型 62.4% / 66.8% 需以原文 Table 3 为准) 数据集:https://visualqa.org/download.html 官方工具:https://github.com/GT-Vision-Lab/VQA


三个标题变体(小红书 / 公众号备用)

  1. 「问 AI 一张图,AI 给答案」这件事的祖师爷:VQA 这篇论文给了 9 年多模态比赛的标准答案
  2. 没有这篇 2015 年的论文,今天的 GPT-4V 就失去了最核心的评测锚点:VQA 数据集如何定义了「视觉问答」
  3. 21 位作者、0.25M 张图、0.76M 个问题——这篇论文如何打开多模态 AI 的 9 年长河

小红书风格卡片文案

主推标题

「问 AI 一张图,AI 给答案」这件事的祖师爷:VQA 这篇论文给了 9 年多模态比赛的标准答案

正文(约 480 字)

你有没有想过:当你给 ChatGPT 发一张图、问「这张图里的猫在做什么」,它能秒回「趴在窗台上晒太阳」——这个「看图 + 理解问题 + 自然语言回答」的能力是怎么来的?GPT-4V、Qwen-VL、LLaVA 在各种「视觉问答」榜单上刷分时,它们究竟在和什么样的基准做对比?

📌 2015 年之前 CV 和 NLP 是两条平行线

  • CV 能识别物体但看不懂话;
  • NLP 能写文章但看不见图;
  • 真正的智能是「视觉问答」,但没有公开评测任务 + 没有大规模数据 + 评测协议不明确三大难题卡住所有人。

📌 arXiv 1505.00468(Antol et al., 2015, ICCV)一次性解决三件事

任务定义:图像 + 自然语言问题 → 自然语言答案 数据集:Microsoft COCO 123K + 抽象场景 50K = 0.25M 张图;0.76M 个问题;10M 个答案 评测协议:Open-ended (OE) + Multiple-choice (MC) 双协议

📌 揭露了一个惊天发现:语言先验

yes/no 类问题不看图就能拿约 67% 准确率——模型只学「问题模式 → 答案模式」的虚假相关。这是后续 VQA v2、AdVQA「反 shortcut」研究的起点。

📌 三个奠基性洞察

  1. 🧩 「任务 + 评测 + 数据集」三位一体= 研究影响力(被引 6600+ 的核心原因)
  2. 🎯 答案规范化是「被低估的工程难题」——做产品时比模型本身更容易出错
  3. 🌈 抽象场景 50K 张的「哲学用意」——强迫模型看语义而非像素 leakage

📌 对今天的工程价值

  • 用 GPT-4V 部署 VQA:"请根据这张图片回答问题:{question}" + 答案归一化
  • 上线前必须做答案分布分析:top-10 占比 > 40% 说明有 language prior bug
  • 警惕「记忆陷阱」:VQA v2 80%+ 分数 ≠ 真理解图像

📌 后续 9 年打开了什么门

2015 VQA v1.0 → 2017 VQA v2 → 2017 CLEVR → 2018 GQA → 2019 OK-VQA → 2020 UNITER/LXMERT → 2022 BLIP-2 → 2023+ GPT-4V/Qwen-VL/LLaVA/InternVL3

这条 9 年长河每一代多模态模型都要在 VQA 上刷榜——没有 1505.00468,今天的多模态大模型就失去了最核心的评测锚点。

⚠️ 数字边界:最佳模型 62.4% OE / 66.8% MC 数字需以原文 Table 3 为准;众包总成本约 50K+ USD 为粗估;现代 VLM 80%+ 分数可能反映「记忆」而非「真理解」。

AI #VQA #多模态 #视觉问答 #GPT-4V #QwenVL #LLaVA #深度学习 #arXiv #数据集


4 张卡片文案

卡片 1 · 封面(钩子) - 大标题:问 AI 一张图,AI 给答案 - 副标题:VQA 这篇论文给了 9 年多模态比赛标准答案 - 角标:今天 · 6600+ 被引

卡片 2 · 三件事(为什么重要) - 小标题:这事为什么重要 - 要点: - 🎯 GPT-4V / Qwen-VL 视觉问答的源头 - 📊 9 年多模态模型的必报基准 - 🧩 定义了「任务 + 评测 + 数据集」三位一体的工业模板 - 来源:arXiv 1505.00468

卡片 3 · 三件硬功夫 - 小标题:VQA 怎么做到的 - 要点: - 🧩 任务定义:图像 + 自然语言问题 → 自然语言答案 - 📊 数据集:0.25M 图 / 0.76M 问题 / 10M 答案 - 🎯 评测协议:Open-ended (OE) + Multiple-choice (MC) 双协议

卡片 4 · 后续 9 年打开了什么门 - 小标题:一条清晰的因果链 - 要点: - 2015 VQA v1.0 → 2017 VQA v2 → 2018 GQA → 2020 UNITER → 2022 BLIP-2 → 2023+ GPT-4V/Qwen-VL/LLaVA - 没有这篇论文,今天的多模态大模型就失去了最核心的评测锚点