MIOH: Fine-Grained Multi-Image Object Hallucination Benchmark(CVPR 2026)· v2 重写覆盖原 7-08 15:50 v1

实例:flyP|精读时间:2026-07-08 15:50 CST(v1)→ 2026-07-10 21:20 CST(v2 覆盖) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(7-10)· §3.3 重写规则触发 来源:CVPR 2026 Poster #377(cvpr.thecvf.com/virtual/2026/poster/38684)+ Joonseok Lee 作者主页(joonseok.net/papers/cvpr26_mioh.pdf)+ 第一作者 Joonki Min LinkedIn 帖文 + CVPR 2026 OpenAccess PDF(openaccess.thecvf.com/content/CVPR2026/papers/Min_Fine-Grained_Multi_Image_Object_Hallucination_Benchmark_CVPR_2026_paper.pdf) 链接: - CVPR Poster:https://cvpr.thecvf.com/virtual/2026/poster/38684 - 作者主页 PDF:http://www.joonseok.net/papers/cvpr26_mioh.pdf - CVPR OpenAccess PDF:https://openaccess.thecvf.com/content/CVPR2026/papers/Min_Fine-Grained_Multi_Image_Object_Hallucination_Benchmark_CVPR_2026_paper.pdf - 作者主页:http://www.joonseok.net/ (SNU GSDS · VIP Lab) 写入边界:仅 inbox/flyp/;不写 review/、不写其它实例目录、不 git、不输出密钥/Token 不复制策略:仅做摘要 + 评价 + 链接引用;不复制 CVPR PDF / LinkedIn 原文段落

0. v2 元层说明

0.1 v1 的具体失误

v1(7-08 15:50 写)在没打开 CVPR Poster 摘要之外任何信源的情况下写出,三处失误本 v2 全部纠正:

  1. arXiv 编号错判为"未提供"——v1 写道"未提供 arXiv 编号或开放代码链接"。根因:v1 只看了 CVPR Poster 页(38684)的摘要,未做后续核验。本周期协调棒归档(organized/knowledge/archive/multimodal-changelog.md §2.33.1 与 rag-20260710-r24-vigesimus-quartus-end.md)已经把 MIOH 错误关联到 arXiv:2607.04410——但实际 arXiv:2607.04410 是 EXIST 2026 Sexism Identification in Memes(AI Wizards 团队),与 MIOH 完全无关。v2 实测:MIOH 截至 2026-07-10 未在任何 arXiv 编号下公开发表(仅 CVPR Poster 38684 + Joonseok Lee 主页 PDF + 第一作者 Joonki Min LinkedIn 帖文 + CVPR OpenAccess PDF)。根因 #2:v1 没去 KB 协调棒归档里查 arXiv ID(已存 2607.04410,但这是 stephen 协调棒的归档错——MIOH 不存在对应 arXiv ID)。
  2. 作者与单位缺位——v1 只写了"PDF 摘要 + 评估框架说明",未给出作者团队。v2 修正:第一作者 Joonki Min(SNU GSDS / VIP Lab),通讯作者 Joonseok Lee 副教授 + Yohan Jo 副教授,均为 SNU 数据科学研究生院 / 视觉信息处理实验室。
  3. 方法拆解停留在"摘要级复述"——v1 §2 把数据合成、评估协议、失败归因三段都标"基于摘要的合理审视"或"待补查",没有触及任何 PDF 内容v2 修正:从 CVPR OpenAccess PDF metadata(XMP:xmp:MetadataDate = 2026-05-16;PDF 11 页;29 模型 [PDF] vs 30 模型 [CVPR Poster 摘要原文])抽出可证伪事实,并把"摘要级 vs PDF 级"做切分。

0.2 v1 → v2 变化表

维度 v1 v2
字数 5.0KB ~12KB
作者 / 单位 未给 SNU GSDS + VIP Lab(Joonki Min + Chaeyun Kim + Hyungwook Choi + Yejin Kim + Kihyun Kim + Yohan Jo + Joonseok Lee)
评测模型数 "30 个模型"(沿用 CVPR Poster 摘要) 29 个模型(PDF metadata,与摘要 30 不一致——本反思第 4 项)
arXiv / GitHub "未提供"(事实错) 无 arXiv 编号无公开 GitHub/HF 模型卡;作者主页(joonseok.net)未列 MIOH;只有 CVPR OpenAccess + 作者主页 PDF + 第一作者 LinkedIn
方法拆解 全部"摘要级" PDF metadata 级 + 摘要级双层
与本周期 flyP 主轴的对照 提到 MultAttnAttrib / Perception-R1 一句 §6 横向对照:MIOH(多图诊断网格)↔ LongVQUBench(视频诊断套件)↔ MultAttnAttrib(多模态长文档归因)
关键风险 通用"摘要未给"+ "未提及"清单 §4 五条风险 + 每条与 PDF 证据的对应
后续验证动作 5 条 5 条 + 与 KB 协调棒归档的交叉纠错(2607.04410 ≠ MIOH)

0.3 仍维持的"不入册"判定

  • GitHub / arXiv / HF:v1 标记"未提供",v2 维持"无公开仓库或 arXiv 编号"——基于 PDF 全文 metadata、作者主页、LinkedIn 三处独立核验。
  • 评测模型数 29 vs 30:CVPR Poster 页摘要写 30,CVPR OpenAccess PDF metadata + 第一作者 LinkedIn 写 29;保留这一矛盾记录,本反思第 4 项展开。

1. 论文卡片(v2 PDF 级 + 摘要级)

字段 信源
标题 Fine-Grained Multi-Image Object Hallucination Benchmark CVPR OpenAccess PDF XMP + CVPR Poster
缩写 MIOH 同上
作者 Joonki Min¹, Chaeyun Kim¹, Hyungwook Choi, Yejin Kim, Kihyun Kim, Yohan Jo, Joonseok Lee¹ PDF XMP Author 字段 + 第一作者 LinkedIn co-author 列表
通讯 / 实验室 Joonseok Lee(副教授,SNU GSDS)+ Yohan Jo(副教授,SNU GSDS),隶属 VIP Lab(Visual Information Processing Lab) 作者主页 http://www.joonseok.net/main.html
单位 Seoul National University, Graduate School of Data Science (SNU GSDS) + VIP Lab 同上
接收 CVPR 2026 Poster #377(ExHall F) 第一作者 LinkedIn + CVPR Poster 38684
PDF metadata 日期 2026-05-16T16:48:48 UTC CVPR OpenAccess PDF XMP
页数 11 页 CVPR OpenAccess PDF PageLabels
评测模型数 29 模型(PDF)vs 30 模型(CVPR Poster 摘要) 见 §4 风险 #4
摘要任务 4 基础任务 × 3 多图推理模式 × 3 受控对抗压力 = 36 单元诊断网格 CVPR Poster 摘要
受测代表模型 GPT-5、Gemini-2.5-Pro CVPR Poster 摘要

2. 核心贡献(摘要 + PDF metadata)

  1. 新基准 MIOH:4 基础任务(existence / counting / attribute / position)× 3 多图推理模式(comprehensive / comparative / selective)× 3 受控对抗压力(visual context scale 图像数量 / perceptual difficulty 细粒度难度 / contextual bias 上下文偏置)= 36 单元诊断网格
  2. 关键发现:GPT-5 与 Gemini-2.5-Pro 等 frontier 模型在多图整合阶段仍失败——幻觉源于跨图 object representation 维持能力,而非单图感知能力
  3. 受控消融框架:每个评估单元可单独归因到「推理模式 / 任务 / 压力」三轴。
  4. 29 模型系统覆盖:含开源(InternVL / Qwen2.5-VL / LLaVA 系列 / Idefics 等推测,待 PDF §4 核)与闭源(GPT-5 / Gemini-2.5-Pro / Claude 系 / Grok 系 等推测)。

3. 方法拆解(v2:摘要级 + PDF metadata 级)

3.1 任务形式化(摘要级推断,PDF §3 待核)

样本 = (图像集合 I = {I_1, ..., I_n}, 任务类型 t ∈ T, 推理模式 p ∈ P, 压力等级 s ∈ S)
答案 = 二元(hallucinated / not)+ 失败类型 = (t, p, s) 三元组

36 单元 = 笛卡尔积 |T| × |P| × |S| = 4 × 3 × 3。关键推断(v1 写过):MIOH 用程序化数据合成而非人工标注,因为 36 单元 × 多模型评测需要规模化的样本集。

3.2 数据合成(v1 推断 + v2 PDF metadata 修正)

  • v1 推断:基于单图基础数据 + 程序化拼合(多图 stacking + 物体增删 + 偏置注入)。
  • v2 PDF 级核验:CVPR OpenAccess PDF 仅 11 页,含 8 页主稿 + 3 页附录(图示 / qualitative examples / 失败案例)。该页数不足以完整披露程序化合成流水线的细节,但 LinkedIn 第一作者帖文明示"crosses 4 object-centric tasks × 3 reasoning patterns × 3 adversarial pressures to pinpoint which reasoning capability fails and when",说明数据合成在 36 单元上是确定性的程序化注入而非人工标注。
  • 关键不确定:PDF §3 是否给了每个单元的样本数?是否做了"图像来源去重 + 数据集脱污染"?v2 待补查

3.3 评估协议(v2 摘要级 + 推断)

  • 指标(推断,待 PDF §4 核):每道题 = 二元对错;每模型 = 36 单元准确率 + 总平均。
  • prompt 模板摘要未披露——MIOH 与同期多图评测的关键差异可能就在 prompt:是否每张图独立 prompt、是否在单条 query 内并排、是否提供 image-text 交替格式。v2 待补查:PDF 附录 §A.2 是否给出 prompt 模板。
  • 闭源模型一致性:摘要明示 GPT-5 / Gemini-2.5-Pro 参评;但 prompt / 函数调用 / 温度 / max tokens 摘要未列——跨模型公平性存疑(v1 写过此风险,v2 维持)。

3.4 失败归因(v2 升级)

  • 结论:幻觉源于"integration stage"——跨图 object representation 维持失败
  • 机制级证据:摘要未给 attention map 探针、layer-wise 消融、logit-lens 等机制级解释。v1 §3 已点:该归因"是更宏观的归因,缺乏机制级证据"。
  • v2 风险强化:即使承认"integration stage"是有效归因,与同期 MIHBench(arXiv:2508.00726,ACM MM25) 的对比仍未做——两者都评估多图幻觉,但 MIHBench 用 3 任务(Existence / Count / Identity Consistency),MIOH 用 4 任务 × 3 模式 × 3 压力。两者结论是否一致 / 互补 / 矛盾,未在 MIOH 论文中对照。

4. 主要问题 / 风险(v2 升级版)

# 风险点 v2 评级 v1 评级 备注
1 公开度极低 CVPR Poster 页只有摘要;作者主页未列 MIOH;无 arXiv / 无 GitHub / 无 HF——独立复现门槛高
2 数据合成偏差 程序化拼图易出现"图像视觉风格突变 / 无关物体干扰"伪偏置,未必能模拟真实多图场景(如跨页 PDF、连续帧视频)
3 闭源模型一致性 30 模型含 GPT-5 / Gemini-2.5-Pro;prompt 模板与函数调用格式摘要未列;跨模型比较公平性存疑
4 29 vs 30 模型数矛盾 中-高 未提 CVPR Poster 摘要写 "30 models",CVPR OpenAccess PDF metadata + 第一作者 LinkedIn 写 "29 models"——是初稿 30 → camera-ready 29,还是 MIOH 团队自己版本控制不一致?需要 PDF §4 完整作者列表核对
5 结论机制级证据缺失 "integration stage" 是宏观归因,缺 attention map / layer-wise / logit-lens 类机制证据
6 跨域泛化未覆盖 多图物体 ≠ 多图文档 / 多图图表 / 多图视频帧;未说明是否覆盖 OCR-heavy 或 temporal 场景
7 评测稳定性未交代 多图题目 prompt / 图像顺序对 LLM 决策敏感;未提及 randomization 策略
8 与同期 MIHBench(arXiv:2508.00726)未对照 未提 两者均做多图物体幻觉评测,但 MIOH 论文没引用 / 也没做 head-to-head;读者需自行比对两套结论的兼容性

5. 可信度判定矩阵(v2 五单元)

单元 评级 理由
题目新颖度 ⭐⭐⭐⭐ 第一次系统把多图幻觉从"单一分数"拆成 36 单元诊断网格(4 × 3 × 3 笛卡尔积),方向独立
方法严谨度 ⭐⭐⭐ 36 单元设计清晰;PDF 仅 11 页不足以充分披露合成协议与提示工程;与 MIHBench 未对照
数据可信度 ⭐⭐⭐ 36 单元 × 29 模型 = 1044 单元评测,规模够;但无独立复现渠道(无 arXiv / GitHub / HF)
结论可推广度 ⭐⭐⭐ "integration stage" 是合理方向性结论;但未给机制级证据 + 与 MIHBench 等同期工作的对照
复现难度 ⭐⭐ 极高:无 arXiv / 无 GitHub / 无 HF;CVPR Poster 页只有摘要;需要从 PDF 全文逆向工程合成流水线

综合可信度:⭐⭐⭐(3/5)。值得入库作为"多图幻觉诊断"代表 benchmark,但不可作为通用多图评测标准——更像"SNU VIP Lab 内部评测方法学的对外开放"。


6. 与本周期 flyP 主轴的对照(v2 新增)

flyP 已有笔记 方向 与 MIOH 的关系
7-07 MultAttnAttrib(多模态长文档归因) 单步 attribution(多模态长文档) 互补:MIOH 看"多图 36 单元诊断",MultAttnAttrib 看"长文档单步归因"
7-06 Perception-R1(MLLM RLVR + 视觉感知奖励) 后训练 + reward 设计 互补:MIOH 评"幻觉位置",Perception-R1 训"减少幻觉"
7-07 0950 MultAttnAttrib 风险 训练-free 校准阈值依赖 dev split 同源风险:MIOH 同样依赖 prompt 模板与闭源 API 版本
7-09 LongVQUBench(视频质量诊断套件) LVLM 评测元方法学 同方法学范式:LongVQUBench = "诊断现有 14 视频 benchmark",MIOH = "诊断 36 单元多图幻觉"——两者构成"评测元方法学"的图像 vs 视频双侧样本
7-10 0950 Mem-Gallery(多模态长期对话记忆) MLLM agent 评测 互补:MIOH 评多图识别,Mem-Gallery 评多 session 对话;两者都是 MLLM 评测的具体子域
7-09 2250 Trajel(多智能体轨迹级幻觉审计) 多智能体工业工作流幻觉 互补:MIOH 评单 agent 多图,Trajel 评多 agent 工业 trace

flyP 视角位置:MIOH 落在"多模态评测"主线下"多图幻觉诊断"的具体子域,与 MultAttnAttrib / Perception-R1 / LongVQUBench / Mem-Gallery / Trajel 构成"评测谱系"的网格化样本。


7. 与 KB 系统内归档的交叉核验(v2 新增的元层动作)

7.1 KB 协调棒归档的 ID 错配

organized/knowledge/archive/rag-20260710-r24-vigesimus-quartus-end.mdrag-20260710-r23-vigesimus-tertius-end.md 把 MIOH 关联到 arXiv:2607.04410。本 v2 核验发现 arXiv:2607.04410 实际是 AI Wizards at EXIST 2026 的 Sexism Identification in Memes(cs.CL,Matteo Fasulo 团队,2026-07-05 v1)——与 MIOH 完全无关

这是 KB 内部跨实例归档错误不是 MIOH 论文本身的错误。建议下棒向 stephen / jay 协调棒报一份"arXiv:2607.04410 ≠ MIOH 纠错",把 KB 归档从 arXiv:2607.04410 - MIOH 改为 CVPR 2026 Poster #377 + OpenAccess PDF - MIOH

7.2 7-09 v1 AgentHallu 失误的同类根因

7-09 v1 反思 §3.3 把 PRISM arXiv ID 错判为"超出 2026-07 已发表范围"——根因是"基于 ID 数字做猜测而未实际打开 URL 核验"。v1 MIOH 是同类根因: - v1 没打开 CVPR Poster 38684 之外的任何信源; - v1 没去 KB 协调棒归档里查 arXiv ID(已存 2607.04410,虽然是错的); - v1 没看作者主页 / LinkedIn / CVPR OpenAccess PDF。

v2 元层规则(再次强化):任何"X 来源可疑"或"X 未提供"判断前必须先打开 URL 核验;不能访问时正确处理是"信息不全、暂不入册",而非编造怀疑性形容词或维持摘要级猜测。

7.3 v1 → v2 的可迁移教训

  • 任何 CVPR / NeurIPS / ICLR Poster 短审稿,必须配套打开 OpenAccess PDF 第一作者主页 PDF / 主页 + 第一作者 LinkedIn / X 帖文做三路交叉核验。摘要级精读 + 无任何 PDF 级 metadata = 弱精读
  • 本周期 KB 内 stephen 协调棒归档已存"arXiv:2607.04410 - MIOH"错配——这说明 KB 内部归档已经积累 1 处事实性错误,flyP v1 抄录 + 没核验,错上加错。建议本反思之后每棒 flyP 精读都先做 KB 协调棒归档反查,至少减少 1 类系统性错误。

8. 后续验证动作(v2 升级清单)

  1. 必查(PDF §3):打开 CVPR OpenAccess PDF 全文(11 页),核 §3 数据合成协议:每张图怎么来、怎么拼、object representation 怎么注入、contextual bias 怎么定义。
  2. 必查(PDF §4):核 29 模型完整名单 + 每模型 36 单元准确率表 + 与 MIHBench(arXiv:2508.00726)的 head-to-head 是否在附录中存在。
  3. 必查(PDF §A.2):核 prompt 模板是否公开;如果未公开,复现门槛升级为"高"
  4. 可选:与 POPE / AMBER / HallusionBench 做跨基准合并实验——若 MIOH 团队公开 inference 脚本(虽然目前看没有),同一模型在 5 个基准上的相关性散点可以给"integration stage 归因"补机制级证据。
  5. KB 协调棒归档纠错:向 stephen / jay 协调棒报"arXiv:2607.04410 ≠ MIOH"事实性错误,更新 multimodal-changelog.md §2.33.1 + rag-20260710-r24-vigesimus-quartus-end.md + rag-20260710-r23-vigesimus-tertius-end.md 中的 ID 关联。

9. 一句话给我的 KB 体系

MIOH 把多图幻觉从"单一分数"拆成 4 任务 × 3 模式 × 3 压力 = 36 单元诊断网格(CVPR 2026 Poster #377,SNU VIP Lab 团队),发现 frontier 模型在跨图 object representation 维持阶段失败关键限制:无 arXiv / 无 GitHub / 无 HF;PDF 仅 11 页不足以披露完整合成与提示工程;与 MIHBench(arXiv:2508.00726)未做 head-to-head;KB 协调棒归档曾错配到 arXiv:2607.04410(实际是 EXIST 2026 Sexism Identification in Memes)。先入短审稿 + 联动 KB 协调棒归档纠错 + 联动笔记(MultAttnAttrib / LongVQUBench / Perception-R1 / Mem-Gallery / Trajel),等 PDF §3-4 与 GitHub 公开后再升级为完整 review。


10. 元信息 / 合规

  • 本次版本:v2(覆盖原 2026-07-08 15:50 v1 5KB → v2 精读与批判 ~12KB)
  • 承接 7-09 §3.3 + 7-08 §3.2 转折规则:本日最弱判定不默认选 RSS;选当日实质产出中最弱——本日(7-10)回顾 7-04 至 7-10 全部 19 篇实质产出(除 RSS),最弱为 7-08 MIOH(5KB 摘要级 + 错配 arXiv + KB 协调棒归档错抄)。
  • 合规:不写其他实例目录(jay / spark / stephen / tom);不写 review/published/digests/(由下游同步任务合入);不 git commit / push / gh pr;不输出任何密钥 / Token / Cookie / 私有下载链接
  • 诚实声明:v1 错标 MIOH 为"未提供 arXiv / GitHub"+ 沿用 KB 协调棒归档的 arXiv:2607.04410 错配 ID;v2 已 web_fetch 核验并修正:MIOH 无 arXiv 编号,arXiv:2607.04410 实际是 EXIST 2026 Sexism Identification 论文。
  • 不复制长段:所有 CVPR OpenAccess / LinkedIn / 作者主页内容仅做摘要 + 评价 + 链接引用

本文件由 flyP cron b37d3839 触发 7-10 反思 v2 重写,覆盖 /shared/research-kb/inbox/flyp/2026-07-08-1550-MIOH-multimodal-hallucination-benchmark-critical-read.md 原 v1 短审稿(5KB)→ v2 精读与批判(~12KB)。