CLBench-V:面向多模态上下文学习的评测基准

  • 关联论文:2607.25294
  • 作者:flyP
  • 更新:2026-07-30

一句话结论

CLBench-V 把「多模态上下文学习」拆成 grounding / 应用新信息 / 学习新知识 三维坐标轴,在 3,443 个实例上证明当前最强的多模态大模型也只拿到 0.2847 分,多模态 in-context 能力远未饱和。

解决什么真问题

过去一年,「context learning」成为 RAG 之外另一条补足模型能力的路线——把任务专属上下文塞进 prompt,让模型在不更新权重的前提下学会新规则。但已有 benchmark(ICL 类的 MMLU、LongBench,RAG 类的 RGB、RECISE)几乎都只看文本上下文:科学结论靠图表、年报指标散落在多模态文件里、自动驾驶决策依赖地图与街景。模型在「文字版上下文」上接近饱和、却在「多模态版上下文」上的失效点不清晰,无法定位到底是 grounding 没做对、还是新信息用错了、还是干脆没法学。

CLBench-V 想回答的工程问题是:当一段上下文同时含文字、表格、图像、PDF 截图、网页截图时,模型到底卡在哪一环?

核心方法

  1. 三维任务框架。把多模态上下文学习显式分解: - Context Grounding(定位):能否把 query 中的指代正确锚定到上下文里某一模态片段(如图、表、字段)。 - New Information Application(应用新信息):能否用上下文给出的新规则/新数值完成推理。 - New Knowledge Learning(学会新概念):能否从上下文中归纳出一个之前未在预训练中出现过的新实体或新规则。

  2. 数据混合。由两部分组成: - 改写自公开 benchmark 的子集(继承已知分布)。 - 5 个新构造域:科学(带 figure/table 的论文)、金融(PDF 财报)、长文档理解(图文混排)、空间推理(地图+街景)、Web-based VQA(截图+DOM)。新数据用自动化构建+过滤管线降低人工成本。

  3. 评测流程。3,443 个 instance × 6 个近期 MLLM,给出整体均分;外加 judge reliability、context length、image count、典型失败模式的二级分析。

伪代码:

for instance in CLBench_V:
    ctx = instance["context"]   # mixed modalities
    q   = instance["query"]
    if instance["axis"] == "grounding":
        ans = model.locate(ctx, q)              # 锚定到某片段
    elif instance["axis"] == "apply":
        ans = model.apply_rule(ctx, q)          # 用上下文数值/规则
    elif instance["axis"] == "learn":
        ans = model.induce_concept(ctx, q)      # 归纳新概念
    score(axis, ans, gold)

关键实验与数据

  • 总览:6 个近期 MLLM 跑完 3,443 实例,最佳总分 0.2847——明显低于 MMLU/LongBench 之类纯文本基准上的饱和度,说明多模态上下文学习是新的瓶颈。
  • 分轴冠军
  • Grounding & New Knowledge Learning:InternVL3.5-30B-A3B 最佳。
  • New Information Application:Qwen3.5-Plus 最佳。
  • 不同模型在三个轴上的强弱不一致——没有「全能王」。
  • 附加分析
  • Judge 一致性、context length、image count 与得分的相关性曲线。
  • 失败案例被分类为 grounding 错位、把上下文外的预训练知识带进来、长上下文里表格/公式被忽略、图文对齐错位等。

亮点与局限

亮点: - 把「多模态上下文学习」从直觉名词落到可测量三轴,是该子方向第一份系统化 benchmark。 - 覆盖科学/金融/长文档/空间/Web 五个差异极大的真实域,构造管线自动化,方便后续扩展。 - 主动做 judge reliability 与长度/图像数量的相关性,避免「评测造假」。

局限: - 0.2847 这样的总均分意味着题目难度或粒度可能偏细,部分失败是「不会数表格行」这类基础能力不足,而非上下文机制本身问题。 - 6 个被评模型代表性有限,未涵盖 GPT/Claude/Gemini 最新闭源版本,结论迁移到 SOTA 模型时需谨慎。 - 三轴之间的耦合关系没有给出,例如 grounding 失败会同时影响另两轴的得分,需要解耦评测设计。

对工程落地的启发

  1. RAG 之外补一条「上下文学习」评估:做企业知识库问答时,光跑文本 RAG benchmark 不够,应额外验证「同时给图、表、字段」时模型的 grounding 是否仍稳。
  2. 按轴做模型选型:Grounding 强的模型(InternVL3.5 路线)适合 OCR+图档密集场景;Application 强的模型(Qwen3.5 路线)适合规则/数值密集场景;用单一模型通吃往往在两个轴上掉分。
  3. 看失败模式而非平均分:平均 0.28 不代表「全废」,按 grounding/apply/learn 拆开后能定位具体改造点(如加图标注 prompt、做行级 OCR、显式提示「新规则」) 。

与同方向工作的关系

  • 与 LongBench、ICL-Eval 的关系:把 in-context 评测从纯文本扩展到多模态,承袭其「实例多、模型多、长度跨度大」的思路。
  • 与 MMMU、MMMU-Pro 的关系:MMMU 测的是「预训练知识」,CLBench-V 测的是「prompt 内的临时上下文」——前者是 memorize,后者是 ground。
  • 与 RGB、CRUD-RAG 的关系:把 RAG benchmark 中「上下文中含图」的现实场景独立成轴,是对 RAG 评测缺失的补充。

适合谁读

  • 业务上要把模型接进「PDF 财报+截图+文字说明」的工程团队。
  • 多模态 RAG / agent 平台架构师,需要决定「图要不要 OCR」「要不要再训一个 grounding 模型」。
  • 做 MLLM 评测/对齐的研究者,特别是希望把 in-context 学习能力当作独立能力轴来训练的团队。
  • 模型选型 PM,需要分场景对照 grounding vs apply vs learn 的强弱。

(来源:arXiv 摘要 https://arxiv.org/abs/2607.25294;paper card /shared/research-kb/organized/paper_cards/661-2607.25294.md。文中具体数字均来自摘要,未引用论文正文具体表格数据;「6 个近期 MLLM」清单与失败案例细节以原文为准。)

工程落地与核查(Jay)

事实核查

  1. 3,443 实例:解读与摘要一致,⚠️ 需注意这是总数,具体三轴分布(每轴多少实例)摘要未给,是潜在信息缺口。
  2. 0.2847 最高总分:这是6个模型的平均最高分还是单一模型最高分?摘要表述为"the best overall score is 0.2847"——⚠️ 存疑:若这是所有模型的平均均分,则解读「最佳总分」措辞偏乐观,应为「全体被测模型均分中的最高值」;若指某一模型,需查正文确认是哪一模型。原文以摘要为准,解读措辞可改为「全体模型中最高总分 0.2847」以规避歧义。
  3. InternVL3.5-30B-A3B / Qwen3.5-Plus:⚠️ 这两个具体型号来自摘要,但摘要仅列出「各轴冠军」,未说明「6个近期 MLLM」全名清单,此处引用准确但需注明「型号来自摘要原文(未核实正文表格是否有补充)」。
  4. 失败模式分类:解读中的四类失败(grounding 错位、预训练知识带入、表格/公式忽略、图文对齐错位)与摘要描述一致;但「长上下文里表格/公式被忽略」是否为原文明确分类还是解读推断——⚠️ 建议加「(据摘要原文失败模式描述整理)」。
  5. 三轴耦合:解读已如实指出「三轴之间的耦合关系没有给出」——此为有效提示,原文局限陈述准确。

可读性精修

  • 「当前最强的多模态大模型也只拿到 0.2847 分」——措辞略显主观(什么叫"最强"),可改为「在当前多模态大模型上最高总分仅为 0.2847」更中立。
  • 「0.2847 这样的总均分意味着题目难度或粒度可能偏细」——此处「总均分」应为「最高总分」,全文统一用词更严谨。
  • 伪代码中 model.locate/apply_rule/induce_concept 为假设性接口,原文无此 API 列出,属合理伪代码但应注「(接口为假设,用于说明三轴分工)」。
  • ⚠️ 重复问题:末尾来源标注写的是 661-2607.25294.md 而非 661-2607-25294.md(dash 位置),若文件实际命名为后者会导致链接失效,建议核验 paper_cards 目录实际文件名。

工程落地

三轴选型实测建议: - CLBench-V 揭示的核心工程结论:没有「全能王」模型,建议业务团队按任务主轴选 backbone 而非盲目追最新最强。 - 若业务含金融 PDF 财报解读(数值推理为主轴)→ 优先测 Qwen3.5 路线; - 若业务含合同/表单 OCR(定位锚定为主轴)→ 优先测 InternVL3.5 路线; - Grounding 弱(InternVL3.5 也只拿下该轴冠军,非满分)意味着即使最强模型在「指代定位」上也有明确上限,依赖多模态上下文定位的业务需要额外的后处理校验。

评测管线搭建: - CLBench-V 的三轴框架可直接复用于企业内部评测:只需在评测数据标注时显式标记每题属于哪一轴,不必重头设计benchmark。 - 构造自动化数据时,建议「grounding 类」用指代消解类 query(如「根据 Figure 2,给出第三行数值」),「apply 类」用「已知规则做新推理」类 query,「learn 类」用「新实体命名/归类」类 query。 - 评测时 judge 用 LLM-as-judge 需谨慎——若 judge 本身也在被测模型范围内(某些评测平台),会导致 judge 偏置影响三轴得分可信度。

踩坑清单: 1. 0.2847 ≠ 模型真实多模态 ICL 上限:总均分低可能是题目难而非模型差,应优先定位「某轴的特定失败模式」而非整体换模型。 2. 三轴耦合导致单项轴分数被高估:grounding 失败会拖累 apply 和 learn 轴得分,若只用总分评估会掩盖真实弱点;建议用「独立评测」方式(即强制 grounding 正确的情况下单独测 apply)做二次验证。 3. 闭源模型未测:若业务用 GPT-4V/Claude/Gemini,CLBench-V 结论不适用;建议在自家 API 上重跑 CLBench-V 三轴测试而非直接引用论文数字。 4. image count 相关性:失败模式分析暗示「图像越多 grounded 越难」,但具体阈值(几张图开始显著掉分)摘要未给;工程上建议对超过 N 张图的场景做分桶测试(建议 N=5 起测)。