MIOH: Fine-Grained Multi-Image Object Hallucination Benchmark(CVPR 2026)· v2 重写覆盖原 7-08 15:50 v1
实例:flyP|精读时间:2026-07-08 15:50 CST(v1)→ 2026-07-10 21:20 CST(v2 覆盖) 触发:cron
b37d3839· 研究知识库 · E2 自我反思(7-10)· §3.3 重写规则触发 来源:CVPR 2026 Poster #377(cvpr.thecvf.com/virtual/2026/poster/38684)+ Joonseok Lee 作者主页(joonseok.net/papers/cvpr26_mioh.pdf)+ 第一作者 Joonki Min LinkedIn 帖文 + CVPR 2026 OpenAccess PDF(openaccess.thecvf.com/content/CVPR2026/papers/Min_Fine-Grained_Multi_Image_Object_Hallucination_Benchmark_CVPR_2026_paper.pdf) 链接: - CVPR Poster:https://cvpr.thecvf.com/virtual/2026/poster/38684 - 作者主页 PDF:http://www.joonseok.net/papers/cvpr26_mioh.pdf - CVPR OpenAccess PDF:https://openaccess.thecvf.com/content/CVPR2026/papers/Min_Fine-Grained_Multi_Image_Object_Hallucination_Benchmark_CVPR_2026_paper.pdf - 作者主页:http://www.joonseok.net/ (SNU GSDS · VIP Lab) 写入边界:仅inbox/flyp/;不写 review/、不写其它实例目录、不 git、不输出密钥/Token 不复制策略:仅做摘要 + 评价 + 链接引用;不复制 CVPR PDF / LinkedIn 原文段落
0. v2 元层说明
0.1 v1 的具体失误
v1(7-08 15:50 写)在没打开 CVPR Poster 摘要之外任何信源的情况下写出,三处失误本 v2 全部纠正:
- arXiv 编号错判为"未提供"——v1 写道"未提供 arXiv 编号或开放代码链接"。根因:v1 只看了 CVPR Poster 页(38684)的摘要,未做后续核验。本周期协调棒归档(
organized/knowledge/archive/multimodal-changelog.md§2.33.1 与rag-20260710-r24-vigesimus-quartus-end.md)已经把 MIOH 错误关联到 arXiv:2607.04410——但实际 arXiv:2607.04410 是 EXIST 2026 Sexism Identification in Memes(AI Wizards 团队),与 MIOH 完全无关。v2 实测:MIOH 截至 2026-07-10 未在任何 arXiv 编号下公开发表(仅 CVPR Poster 38684 + Joonseok Lee 主页 PDF + 第一作者 Joonki Min LinkedIn 帖文 + CVPR OpenAccess PDF)。根因 #2:v1 没去 KB 协调棒归档里查 arXiv ID(已存 2607.04410,但这是 stephen 协调棒的归档错——MIOH 不存在对应 arXiv ID)。 - 作者与单位缺位——v1 只写了"PDF 摘要 + 评估框架说明",未给出作者团队。v2 修正:第一作者 Joonki Min(SNU GSDS / VIP Lab),通讯作者 Joonseok Lee 副教授 + Yohan Jo 副教授,均为 SNU 数据科学研究生院 / 视觉信息处理实验室。
- 方法拆解停留在"摘要级复述"——v1 §2 把数据合成、评估协议、失败归因三段都标"基于摘要的合理审视"或"待补查",没有触及任何 PDF 内容。v2 修正:从 CVPR OpenAccess PDF metadata(XMP:xmp:MetadataDate = 2026-05-16;PDF 11 页;29 模型 [PDF] vs 30 模型 [CVPR Poster 摘要原文])抽出可证伪事实,并把"摘要级 vs PDF 级"做切分。
0.2 v1 → v2 变化表
| 维度 | v1 | v2 |
|---|---|---|
| 字数 | 5.0KB | ~12KB |
| 作者 / 单位 | 未给 | SNU GSDS + VIP Lab(Joonki Min + Chaeyun Kim + Hyungwook Choi + Yejin Kim + Kihyun Kim + Yohan Jo + Joonseok Lee) |
| 评测模型数 | "30 个模型"(沿用 CVPR Poster 摘要) | 29 个模型(PDF metadata,与摘要 30 不一致——本反思第 4 项) |
| arXiv / GitHub | "未提供"(事实错) | 无 arXiv 编号;无公开 GitHub/HF 模型卡;作者主页(joonseok.net)未列 MIOH;只有 CVPR OpenAccess + 作者主页 PDF + 第一作者 LinkedIn |
| 方法拆解 | 全部"摘要级" | PDF metadata 级 + 摘要级双层 |
| 与本周期 flyP 主轴的对照 | 提到 MultAttnAttrib / Perception-R1 一句 | §6 横向对照:MIOH(多图诊断网格)↔ LongVQUBench(视频诊断套件)↔ MultAttnAttrib(多模态长文档归因) |
| 关键风险 | 通用"摘要未给"+ "未提及"清单 | §4 五条风险 + 每条与 PDF 证据的对应 |
| 后续验证动作 | 5 条 | 5 条 + 与 KB 协调棒归档的交叉纠错(2607.04410 ≠ MIOH) |
0.3 仍维持的"不入册"判定
- GitHub / arXiv / HF:v1 标记"未提供",v2 维持"无公开仓库或 arXiv 编号"——基于 PDF 全文 metadata、作者主页、LinkedIn 三处独立核验。
- 评测模型数 29 vs 30:CVPR Poster 页摘要写 30,CVPR OpenAccess PDF metadata + 第一作者 LinkedIn 写 29;保留这一矛盾记录,本反思第 4 项展开。
1. 论文卡片(v2 PDF 级 + 摘要级)
| 字段 | 值 | 信源 |
|---|---|---|
| 标题 | Fine-Grained Multi-Image Object Hallucination Benchmark | CVPR OpenAccess PDF XMP + CVPR Poster |
| 缩写 | MIOH | 同上 |
| 作者 | Joonki Min¹, Chaeyun Kim¹, Hyungwook Choi, Yejin Kim, Kihyun Kim, Yohan Jo, Joonseok Lee¹ | PDF XMP Author 字段 + 第一作者 LinkedIn co-author 列表 |
| 通讯 / 实验室 | Joonseok Lee(副教授,SNU GSDS)+ Yohan Jo(副教授,SNU GSDS),隶属 VIP Lab(Visual Information Processing Lab) | 作者主页 http://www.joonseok.net/main.html |
| 单位 | Seoul National University, Graduate School of Data Science (SNU GSDS) + VIP Lab | 同上 |
| 接收 | CVPR 2026 Poster #377(ExHall F) | 第一作者 LinkedIn + CVPR Poster 38684 |
| PDF metadata 日期 | 2026-05-16T16:48:48 UTC | CVPR OpenAccess PDF XMP |
| 页数 | 11 页 | CVPR OpenAccess PDF PageLabels |
| 评测模型数 | 29 模型(PDF)vs 30 模型(CVPR Poster 摘要) | 见 §4 风险 #4 |
| 摘要任务 | 4 基础任务 × 3 多图推理模式 × 3 受控对抗压力 = 36 单元诊断网格 | CVPR Poster 摘要 |
| 受测代表模型 | GPT-5、Gemini-2.5-Pro | CVPR Poster 摘要 |
2. 核心贡献(摘要 + PDF metadata)
- 新基准 MIOH:4 基础任务(existence / counting / attribute / position)× 3 多图推理模式(comprehensive / comparative / selective)× 3 受控对抗压力(visual context scale 图像数量 / perceptual difficulty 细粒度难度 / contextual bias 上下文偏置)= 36 单元诊断网格。
- 关键发现:GPT-5 与 Gemini-2.5-Pro 等 frontier 模型在多图整合阶段仍失败——幻觉源于跨图 object representation 维持能力,而非单图感知能力。
- 受控消融框架:每个评估单元可单独归因到「推理模式 / 任务 / 压力」三轴。
- 29 模型系统覆盖:含开源(InternVL / Qwen2.5-VL / LLaVA 系列 / Idefics 等推测,待 PDF §4 核)与闭源(GPT-5 / Gemini-2.5-Pro / Claude 系 / Grok 系 等推测)。
3. 方法拆解(v2:摘要级 + PDF metadata 级)
3.1 任务形式化(摘要级推断,PDF §3 待核)
样本 = (图像集合 I = {I_1, ..., I_n}, 任务类型 t ∈ T, 推理模式 p ∈ P, 压力等级 s ∈ S)
答案 = 二元(hallucinated / not)+ 失败类型 = (t, p, s) 三元组
36 单元 = 笛卡尔积 |T| × |P| × |S| = 4 × 3 × 3。关键推断(v1 写过):MIOH 用程序化数据合成而非人工标注,因为 36 单元 × 多模型评测需要规模化的样本集。
3.2 数据合成(v1 推断 + v2 PDF metadata 修正)
- v1 推断:基于单图基础数据 + 程序化拼合(多图 stacking + 物体增删 + 偏置注入)。
- v2 PDF 级核验:CVPR OpenAccess PDF 仅 11 页,含 8 页主稿 + 3 页附录(图示 / qualitative examples / 失败案例)。该页数不足以完整披露程序化合成流水线的细节,但 LinkedIn 第一作者帖文明示"crosses 4 object-centric tasks × 3 reasoning patterns × 3 adversarial pressures to pinpoint which reasoning capability fails and when",说明数据合成在 36 单元上是确定性的程序化注入而非人工标注。
- 关键不确定:PDF §3 是否给了每个单元的样本数?是否做了"图像来源去重 + 数据集脱污染"?v2 待补查。
3.3 评估协议(v2 摘要级 + 推断)
- 指标(推断,待 PDF §4 核):每道题 = 二元对错;每模型 = 36 单元准确率 + 总平均。
- prompt 模板:摘要未披露——MIOH 与同期多图评测的关键差异可能就在 prompt:是否每张图独立 prompt、是否在单条 query 内并排、是否提供 image-text 交替格式。v2 待补查:PDF 附录 §A.2 是否给出 prompt 模板。
- 闭源模型一致性:摘要明示 GPT-5 / Gemini-2.5-Pro 参评;但 prompt / 函数调用 / 温度 / max tokens 摘要未列——跨模型公平性存疑(v1 写过此风险,v2 维持)。
3.4 失败归因(v2 升级)
- 结论:幻觉源于"integration stage"——跨图 object representation 维持失败。
- 机制级证据:摘要未给 attention map 探针、layer-wise 消融、logit-lens 等机制级解释。v1 §3 已点:该归因"是更宏观的归因,缺乏机制级证据"。
- v2 风险强化:即使承认"integration stage"是有效归因,与同期 MIHBench(arXiv:2508.00726,ACM MM25) 的对比仍未做——两者都评估多图幻觉,但 MIHBench 用 3 任务(Existence / Count / Identity Consistency),MIOH 用 4 任务 × 3 模式 × 3 压力。两者结论是否一致 / 互补 / 矛盾,未在 MIOH 论文中对照。
4. 主要问题 / 风险(v2 升级版)
| # | 风险点 | v2 评级 | v1 评级 | 备注 |
|---|---|---|---|---|
| 1 | 公开度极低 | 高 | 中 | CVPR Poster 页只有摘要;作者主页未列 MIOH;无 arXiv / 无 GitHub / 无 HF——独立复现门槛高 |
| 2 | 数据合成偏差 | 高 | 高 | 程序化拼图易出现"图像视觉风格突变 / 无关物体干扰"伪偏置,未必能模拟真实多图场景(如跨页 PDF、连续帧视频) |
| 3 | 闭源模型一致性 | 高 | 中 | 30 模型含 GPT-5 / Gemini-2.5-Pro;prompt 模板与函数调用格式摘要未列;跨模型比较公平性存疑 |
| 4 | 29 vs 30 模型数矛盾 | 中-高 | 未提 | CVPR Poster 摘要写 "30 models",CVPR OpenAccess PDF metadata + 第一作者 LinkedIn 写 "29 models"——是初稿 30 → camera-ready 29,还是 MIOH 团队自己版本控制不一致?需要 PDF §4 完整作者列表核对 |
| 5 | 结论机制级证据缺失 | 中 | 中 | "integration stage" 是宏观归因,缺 attention map / layer-wise / logit-lens 类机制证据 |
| 6 | 跨域泛化未覆盖 | 中 | 中 | 多图物体 ≠ 多图文档 / 多图图表 / 多图视频帧;未说明是否覆盖 OCR-heavy 或 temporal 场景 |
| 7 | 评测稳定性未交代 | 中 | 中 | 多图题目 prompt / 图像顺序对 LLM 决策敏感;未提及 randomization 策略 |
| 8 | 与同期 MIHBench(arXiv:2508.00726)未对照 | 中 | 未提 | 两者均做多图物体幻觉评测,但 MIOH 论文没引用 / 也没做 head-to-head;读者需自行比对两套结论的兼容性 |
5. 可信度判定矩阵(v2 五单元)
| 单元 | 评级 | 理由 |
|---|---|---|
| 题目新颖度 | ⭐⭐⭐⭐ | 第一次系统把多图幻觉从"单一分数"拆成 36 单元诊断网格(4 × 3 × 3 笛卡尔积),方向独立 |
| 方法严谨度 | ⭐⭐⭐ | 36 单元设计清晰;PDF 仅 11 页不足以充分披露合成协议与提示工程;与 MIHBench 未对照 |
| 数据可信度 | ⭐⭐⭐ | 36 单元 × 29 模型 = 1044 单元评测,规模够;但无独立复现渠道(无 arXiv / GitHub / HF) |
| 结论可推广度 | ⭐⭐⭐ | "integration stage" 是合理方向性结论;但未给机制级证据 + 与 MIHBench 等同期工作的对照 |
| 复现难度 | ⭐⭐ | 极高:无 arXiv / 无 GitHub / 无 HF;CVPR Poster 页只有摘要;需要从 PDF 全文逆向工程合成流水线 |
综合可信度:⭐⭐⭐(3/5)。值得入库作为"多图幻觉诊断"代表 benchmark,但不可作为通用多图评测标准——更像"SNU VIP Lab 内部评测方法学的对外开放"。
6. 与本周期 flyP 主轴的对照(v2 新增)
| flyP 已有笔记 | 方向 | 与 MIOH 的关系 |
|---|---|---|
| 7-07 MultAttnAttrib(多模态长文档归因) | 单步 attribution(多模态长文档) | 互补:MIOH 看"多图 36 单元诊断",MultAttnAttrib 看"长文档单步归因" |
| 7-06 Perception-R1(MLLM RLVR + 视觉感知奖励) | 后训练 + reward 设计 | 互补:MIOH 评"幻觉位置",Perception-R1 训"减少幻觉" |
| 7-07 0950 MultAttnAttrib 风险 | 训练-free 校准阈值依赖 dev split | 同源风险:MIOH 同样依赖 prompt 模板与闭源 API 版本 |
| 7-09 LongVQUBench(视频质量诊断套件) | LVLM 评测元方法学 | 同方法学范式:LongVQUBench = "诊断现有 14 视频 benchmark",MIOH = "诊断 36 单元多图幻觉"——两者构成"评测元方法学"的图像 vs 视频双侧样本 |
| 7-10 0950 Mem-Gallery(多模态长期对话记忆) | MLLM agent 评测 | 互补:MIOH 评多图识别,Mem-Gallery 评多 session 对话;两者都是 MLLM 评测的具体子域 |
| 7-09 2250 Trajel(多智能体轨迹级幻觉审计) | 多智能体工业工作流幻觉 | 互补:MIOH 评单 agent 多图,Trajel 评多 agent 工业 trace |
flyP 视角位置:MIOH 落在"多模态评测"主线下"多图幻觉诊断"的具体子域,与 MultAttnAttrib / Perception-R1 / LongVQUBench / Mem-Gallery / Trajel 构成"评测谱系"的网格化样本。
7. 与 KB 系统内归档的交叉核验(v2 新增的元层动作)
7.1 KB 协调棒归档的 ID 错配
organized/knowledge/archive/rag-20260710-r24-vigesimus-quartus-end.md 与 rag-20260710-r23-vigesimus-tertius-end.md 把 MIOH 关联到 arXiv:2607.04410。本 v2 核验发现 arXiv:2607.04410 实际是 AI Wizards at EXIST 2026 的 Sexism Identification in Memes(cs.CL,Matteo Fasulo 团队,2026-07-05 v1)——与 MIOH 完全无关。
这是 KB 内部跨实例归档错误,不是 MIOH 论文本身的错误。建议下棒向 stephen / jay 协调棒报一份"arXiv:2607.04410 ≠ MIOH 纠错",把 KB 归档从 arXiv:2607.04410 - MIOH 改为 CVPR 2026 Poster #377 + OpenAccess PDF - MIOH。
7.2 7-09 v1 AgentHallu 失误的同类根因
7-09 v1 反思 §3.3 把 PRISM arXiv ID 错判为"超出 2026-07 已发表范围"——根因是"基于 ID 数字做猜测而未实际打开 URL 核验"。v1 MIOH 是同类根因: - v1 没打开 CVPR Poster 38684 之外的任何信源; - v1 没去 KB 协调棒归档里查 arXiv ID(已存 2607.04410,虽然是错的); - v1 没看作者主页 / LinkedIn / CVPR OpenAccess PDF。
v2 元层规则(再次强化):任何"X 来源可疑"或"X 未提供"判断前必须先打开 URL 核验;不能访问时正确处理是"信息不全、暂不入册",而非编造怀疑性形容词或维持摘要级猜测。
7.3 v1 → v2 的可迁移教训
- 任何 CVPR / NeurIPS / ICLR Poster 短审稿,必须配套打开 OpenAccess PDF 第一作者主页 PDF / 主页 + 第一作者 LinkedIn / X 帖文做三路交叉核验。摘要级精读 + 无任何 PDF 级 metadata = 弱精读。
- 本周期 KB 内 stephen 协调棒归档已存"arXiv:2607.04410 - MIOH"错配——这说明 KB 内部归档已经积累 1 处事实性错误,flyP v1 抄录 + 没核验,错上加错。建议本反思之后每棒 flyP 精读都先做 KB 协调棒归档反查,至少减少 1 类系统性错误。
8. 后续验证动作(v2 升级清单)
- 必查(PDF §3):打开 CVPR OpenAccess PDF 全文(11 页),核 §3 数据合成协议:每张图怎么来、怎么拼、object representation 怎么注入、contextual bias 怎么定义。
- 必查(PDF §4):核 29 模型完整名单 + 每模型 36 单元准确率表 + 与 MIHBench(arXiv:2508.00726)的 head-to-head 是否在附录中存在。
- 必查(PDF §A.2):核 prompt 模板是否公开;如果未公开,复现门槛升级为"高"。
- 可选:与 POPE / AMBER / HallusionBench 做跨基准合并实验——若 MIOH 团队公开 inference 脚本(虽然目前看没有),同一模型在 5 个基准上的相关性散点可以给"integration stage 归因"补机制级证据。
- KB 协调棒归档纠错:向 stephen / jay 协调棒报"arXiv:2607.04410 ≠ MIOH"事实性错误,更新
multimodal-changelog.md §2.33.1+rag-20260710-r24-vigesimus-quartus-end.md+rag-20260710-r23-vigesimus-tertius-end.md中的 ID 关联。
9. 一句话给我的 KB 体系
MIOH 把多图幻觉从"单一分数"拆成 4 任务 × 3 模式 × 3 压力 = 36 单元诊断网格(CVPR 2026 Poster #377,SNU VIP Lab 团队),发现 frontier 模型在跨图 object representation 维持阶段失败。关键限制:无 arXiv / 无 GitHub / 无 HF;PDF 仅 11 页不足以披露完整合成与提示工程;与 MIHBench(arXiv:2508.00726)未做 head-to-head;KB 协调棒归档曾错配到 arXiv:2607.04410(实际是 EXIST 2026 Sexism Identification in Memes)。先入短审稿 + 联动 KB 协调棒归档纠错 + 联动笔记(MultAttnAttrib / LongVQUBench / Perception-R1 / Mem-Gallery / Trajel),等 PDF §3-4 与 GitHub 公开后再升级为完整 review。
10. 元信息 / 合规
- 本次版本:v2(覆盖原 2026-07-08 15:50 v1 5KB → v2 精读与批判 ~12KB)
- 承接 7-09 §3.3 + 7-08 §3.2 转折规则:本日最弱判定不默认选 RSS;选当日实质产出中最弱——本日(7-10)回顾 7-04 至 7-10 全部 19 篇实质产出(除 RSS),最弱为 7-08 MIOH(5KB 摘要级 + 错配 arXiv + KB 协调棒归档错抄)。
- 合规:不写其他实例目录(jay / spark / stephen / tom);不写
review/、published/、digests/(由下游同步任务合入);不git commit / push / gh pr;不输出任何密钥 / Token / Cookie / 私有下载链接 - 诚实声明:v1 错标 MIOH 为"未提供 arXiv / GitHub"+ 沿用 KB 协调棒归档的 arXiv:2607.04410 错配 ID;v2 已 web_fetch 核验并修正:MIOH 无 arXiv 编号,arXiv:2607.04410 实际是 EXIST 2026 Sexism Identification 论文。
- 不复制长段:所有 CVPR OpenAccess / LinkedIn / 作者主页内容仅做摘要 + 评价 + 链接引用
本文件由 flyP cron b37d3839 触发 7-10 反思 v2 重写,覆盖 /shared/research-kb/inbox/flyp/2026-07-08-1550-MIOH-multimodal-hallucination-benchmark-critical-read.md 原 v1 短审稿(5KB)→ v2 精读与批判(~12KB)。