多模态大模型到底懂不懂 OCT?OCT-Bench 给出的系统答卷

  • 关联论文:2607.16609
  • 作者:flyP
  • 更新:2026-07-22

一句话结论

OCT-Bench 用 10,076 道多选题、4,137 张 OCT 图像、覆盖 20 个细粒度能力子任务(分 Perception / Cognition / Reasoning 三层),系统评估了 20 个代表性 MLLM,结论是当前所有模型离"可临床落地的 OCT 理解"都还有相当距离,而且"换更大的模型"或"做医学域微调"都不能保证稳定提升——这是一份给医学多模态研究者的"清醒剂"型 benchmark。

解决的真问题

OCT(Optical Coherence Tomography,光学相干断层扫描)是视网膜疾病诊疗的核心影像手段。MLLM 在通用医学影像上跑得越来越欢,但在 OCT 上一直缺一个足够细的尺子。原因有两条:

  1. 现有 benchmark 把 OCT 理解压扁成"粗粒度疾病分类"或"单题 VQA",中间过程完全不可见——模型是看清了结构、还是蒙对了疾病名?分不清。
  2. 临床读片是一个分层工作流:先做视觉感知(看见啥),再做认知(这是啥),最后做推理(该怎么处理、预后如何)。旧 benchmark 不分这三层,给不了"模型到底在哪一层断了"的诊断信号。

OCT-Bench 直接对标临床读片工作流建 benchmark,是这条线上第一个把"全认知链路"端到端覆盖的工作。

核心方法

1. 数据构造

  • 图像来源:7 个公开 OCT 数据集拼起来,共 4,137 张图像。强调高质量——意味着每张图都经过筛选,不是 raw dump。
  • 题目规模:10,076 道多选题(multiple-choice)。这么大的题量足以在 20 个子任务上分别给出稳定估计。
  • 题目形式:多选(不是开放式),便于自动评估,也避免开放式答案评测里 LLM-judge 自身的不稳定性。

2. 能力分层(核心创新)

按真实临床读片流程,构造 20 个细粒度任务,分三层:

┌─────────────────────────────────────────────────┐
│ Reasoning       (治疗决策、预后管理)           │  ← 高层临床判断
├─────────────────────────────────────────────────┤
│ Cognition       (疾病评估、病变特征)           │  ← 把看到的东西归类
├─────────────────────────────────────────────────┤
│ Perception      (影像属性、视网膜解剖、空间关系 │  ← 看没看清
│                 、病灶特征)                   │
└─────────────────────────────────────────────────┘
  • Perception:影像模态/质量判断、视网膜分层结构识别、病灶空间定位等;
  • Cognition:病变属于哪一类、严重程度分级等;
  • Reasoning:基于发现给出治疗建议、推断预后、决定随访策略。

这种分层让任何一道题都可以被打上"它考察哪一层"的标签,从而让评测结果可以下钻——比如"模型 X 在 Perception 上 80%,但 Reasoning 上 35%",比一个 60% 的总分有用得多。

3. 评测对象

20 个 MLLM 分三组对比: - 闭源通用模型(proprietary):GPT-4V 类、Gemini 类; - 开源通用模型:Qwen-VL、LLaVA、InternVL 等系列; - 医学域专门模型:Med-Flamingo、LLaVA-Med 等。

这种三足鼎立的设置正是为了回答一个问题:专用医学数据 + 微调,到底能不能换到 OCT 能力上的稳定收益?

关键实验与数据

论文的核心结论不是某一个数字,而是一组反直觉的模式

  1. 总分都低:所有模型在 OCT-Bench 上的表现都"明显不足以支持可靠临床理解"(原文未给精确百分比,abstract 用的是 "substantially short" 这种定性表述)。
  2. 规模 scaling 不稳定:更大的模型 ≠ 更好。在某些能力层上,更大的开源模型反而比小模型差。
  3. 医学域适配收益不稳定:LLaVA-Med 这类专用模型相比通用 LLaVA 没有稳定优势——某些任务上赢,某些任务上输。

具体数字因为 abstract 没列、PDF 未读无法精确引用,精确数字以原文 Table 为准(原文未明确)

评测设计上值得提的几点: - 多选题(避免开放式答案评测噪声); - 题量大(>10k)+ 分层细(20 任务 × 3 层),统计上有保障; - 涵盖 7 个数据集(避免单一数据集 bias)。

亮点与局限

亮点

  1. 临床工作流驱动的能力分层:把"Perception-Cognition-Reasoning"作为评测骨架,本身就是 benchmark 设计上的贡献,可被后续工作复用。
  2. 三组模型横向比较:把"是否值得做医学微调"这件事在 OCT 上重新审视,给出谨慎结论。
  3. 数据来源透明:7 个公开数据集拼装,避免私有数据集带来的不可复现问题。
  4. 任务数量大:20 个任务 × 千题以上,统计稳定性远高于"几十道题"的早期 benchmark。

局限

  1. 只考多选题:开放性诊断推理("为什么是 AMD 而不是 CSC?")这种临床真正关心的能力,MCQ 测不到。
  2. 只在 OCT 一个模态:OCT 是眼科影像,不能推广到 CT/MRI/病理——但题目越多、数据集越杂,建模工作越大,这是合理取舍。
  3. 评估时间切片:2026 年 7 月发表的 benchmark,对未来模型会迅速过时;后续需持续更新。
  4. 评测静态化:没有引入 agentic / 多轮交互场景,而临床读片常常需要反复放大、对比、追问。
  5. 数据集偏差未量化:7 个公开数据集来源、采集设备、人群分布不一,是否带来系统性偏差,原文未明确。

对工程落地的启发

  1. 医学 MLLM 的"刷榜点"找错了:在 OCT 这种细粒度影像上,通刷医学对话数据不一定有效。考虑针对特定模态做小规模高质量 SFT。
  2. 产品级医学影像助手必须分层设计:别指望一个端到端模型同时搞感知和推理;pipeline 式(先 perception 模型识别结构 → 再 cognition 模型分类 → reasoning 模型做决策)在 OCT 上更可靠。
  3. Reasoning 层是当前最大瓶颈:从过往 benchmark 的经验看(原文未明确此处具体数字),Reasoning 任务比 Perception 难得多。这意味着即使 Perception 做得不错,端到端临床建议的可靠性依然堪忧。
  4. 评测要分维度报告:总分没意义,Perception / Cognition / Reasoning 三层分别报告才有诊断价值——这是医学 AI 落地的常识级要求。
  5. 临床落地的前置门槛:在模型"substantially short of reliable" 之前,不要上临床流程。OCT-Bench 给出了一个客观门槛参考。

与同方向工作的关系

  • LLaVA-Med / Med-Flamingo:医学 MLLM 代表作,本文评测对象之一,结论对其推广性提出质疑。
  • PMC-VQA / MedVQA / OmniMedVQA:通用医学 VQA benchmark,OCT-Bench 是第一个专门下钻到 OCT 这种单一影像模态并按临床工作流分层的。
  • VQA-RAD / Path-VQA:早期放射 / 病理 VQA,形式上是 MCQ,但任务粒度粗,与本文不可直接比较。
  • GPT-4V / Gemini 医疗评测文献:2024–2025 一波"闭源 MLLM 医疗 benchmark"工作,OCT-Bench 是其中第一个明确把"分层能力"作为主轴的。
  • 放射学 / 眼科影像传统深度学习:如 RETFound、RETFound-OCT 等专用模型;OCT-Bench 没把它们纳入评测(这部分原文未明确),未来可补。

适合谁读

  • 做医学多模态 / MLLM 训练与评测的研究者和工程师;
  • 眼科 AI 影像产品的算法负责人,特别是正在评估"用 GPT-4V 还是自建" 的团队;
  • 关注 benchmark 设计的通用 MLLM 研究者——本文的"能力分层"方法论可迁移到其他医学模态(CT、MRI、病理);
  • 临床医生 / 医院信息科负责人:评估"现在上 MLLM 读片,到底能不能信"——答案本文给得很清楚:还不能信;
  • 不适合:只关心通用 chat 模型、跟医学无关的读者。

工程落地与核查(Jay)

1. 分层 pipeline 设计:当前比端到端更稳妥的工程路径

本文的核心工程洞察是:Perception / Cognition / Reasoning 三层的能力曲线完全不同——规模 scaling 在各层表现不一致,医学微调也不能稳定提升。这意味着:

当前推荐的分层架构(而非追求单一大一统模型):

OCT 图像
  ↓
[Perception 模型] → 视网膜分层结构、图像质量判断
  ↓ 结构化输出(分层边界、病变位置)
[Cognition 模型] → 病变分类(AMD/CSC/正常等)
  ↓ 分类标签 + 严重程度
[Reasoning 模型] → 治疗建议、随访策略

每层可独立选型、调优、替换,不需要三层同时用同一个大模型。

⚠️ 存疑:原文未给出分层 pipeline vs 端到端单模型的直接对比实验数据,该建议基于 benchmark 结论的推断,非原文实证。

2. 评测数字的解读方式

由于原文 abstract 未给出精确数字,工程团队使用 OCT-Bench 时需注意:

  • 不要用总分做产品决策:总分掩盖了"Perception 强但 Reasoning 弱"的结构性问题;
  • 关注 Reasoning 层得分:这才是临床落地的真正瓶颈所在,分数低说明即使感知做得好也不能直接上临床;
  • 按子任务下钻:20 个子任务里,具体哪几个 Perception 子任务得分高比总分更有参考价值——它们决定哪些临床场景可以先试点。

⚠️ 存疑:20 个子任务与三层之间的对应关系原文未明确(如 Perception 层包含哪几个子任务),精确实测数字需查阅原文 Table。

3. 评测局限性带来的工程约束

OCT-Bench 本身的局限需要在产品设计时纳入考量:

局限 工程约束
只考 MCQ,无开放式诊断 产品形态不要做成"开放式诊疗建议",MCQ 强不等于开放诊断强
单次静态评测,无多轮交互 临床场景的多轮放大/对比/追问场景不在评测范围内
2026 年 7 月时间切片 GPT-4o、Claude 4 等更新模型未覆盖,需定期重测
7 个数据集偏差未量化 若产品面向特定设备/人种,需在该子集上单独验证

4. 医学微调策略的实证参照

本文给"盲目做医学微调"泼了冷水,工程团队的决策参考:

  • LLaVA-Med vs 通用 LLaVA 无稳定优势 → 做微调前先在 OCT-Bench 上测一下目标层是否真的提升;
  • 规模 scaling 不稳定 → 不要认为"更大的模型 = 更好的 OCT 效果",实测是唯一验证方式;
  • 通刷医学对话数据不够 → 应该针对 OCT 影像模态本身的视觉特征做 SFT,而非只喂医学文本。

5. ⚠️ 事实核查与存疑汇总

  1. 20 个子任务与三层的对应关系未在摘要明确:Perception / Cognition / Reasoning 三层各包含哪些子任务,摘要未列出,表格需查阅原文;
  2. 所有模型"明显不足以支持可靠临床理解":原文为 "substantially short" 定性描述,无精确数字,⚠️ 勿将其误解为"所有模型 < 50%";
  3. 闭源通用模型(proprietary)组的构成:摘要写"GPT-4V 类、Gemini 类",但未列出具体版本号(如 GPT-4V-1106 vs GPT-4o),不同版本能力差异大;
  4. 规模 scaling 结论的表述:原文说"更大的模型 ≠ 更好",但具体哪个开源系列出现反 scaling,摘要未明确;
  5. LLaVA-Med 医学微调收益不稳定:原文未给出 vs 通用 LLaVA 的具体差值范围,⚠️ 勿将其解读为"医学微调完全无效"。

评分

  • 机制 ✅(三层架构 + 20 子任务设计合理)
  • 工程 ✅(分层 pipeline 建议具体可行)
  • 数字 ⚠️(全文 abstract 无精确数字)
  • 风险边界 ✅(MCQ 局限、多轮交互缺失、评测时间切片 均已标注)
  • 综合:3 分