多模态大模型到底懂不懂 OCT?OCT-Bench 给出的系统答卷
- 关联论文:2607.16609
- 作者:flyP
- 更新:2026-07-22
一句话结论
OCT-Bench 用 10,076 道多选题、4,137 张 OCT 图像、覆盖 20 个细粒度能力子任务(分 Perception / Cognition / Reasoning 三层),系统评估了 20 个代表性 MLLM,结论是当前所有模型离"可临床落地的 OCT 理解"都还有相当距离,而且"换更大的模型"或"做医学域微调"都不能保证稳定提升——这是一份给医学多模态研究者的"清醒剂"型 benchmark。
解决的真问题
OCT(Optical Coherence Tomography,光学相干断层扫描)是视网膜疾病诊疗的核心影像手段。MLLM 在通用医学影像上跑得越来越欢,但在 OCT 上一直缺一个足够细的尺子。原因有两条:
- 现有 benchmark 把 OCT 理解压扁成"粗粒度疾病分类"或"单题 VQA",中间过程完全不可见——模型是看清了结构、还是蒙对了疾病名?分不清。
- 临床读片是一个分层工作流:先做视觉感知(看见啥),再做认知(这是啥),最后做推理(该怎么处理、预后如何)。旧 benchmark 不分这三层,给不了"模型到底在哪一层断了"的诊断信号。
OCT-Bench 直接对标临床读片工作流建 benchmark,是这条线上第一个把"全认知链路"端到端覆盖的工作。
核心方法
1. 数据构造
- 图像来源:7 个公开 OCT 数据集拼起来,共 4,137 张图像。强调高质量——意味着每张图都经过筛选,不是 raw dump。
- 题目规模:10,076 道多选题(multiple-choice)。这么大的题量足以在 20 个子任务上分别给出稳定估计。
- 题目形式:多选(不是开放式),便于自动评估,也避免开放式答案评测里 LLM-judge 自身的不稳定性。
2. 能力分层(核心创新)
按真实临床读片流程,构造 20 个细粒度任务,分三层:
┌─────────────────────────────────────────────────┐
│ Reasoning (治疗决策、预后管理) │ ← 高层临床判断
├─────────────────────────────────────────────────┤
│ Cognition (疾病评估、病变特征) │ ← 把看到的东西归类
├─────────────────────────────────────────────────┤
│ Perception (影像属性、视网膜解剖、空间关系 │ ← 看没看清
│ 、病灶特征) │
└─────────────────────────────────────────────────┘
- Perception:影像模态/质量判断、视网膜分层结构识别、病灶空间定位等;
- Cognition:病变属于哪一类、严重程度分级等;
- Reasoning:基于发现给出治疗建议、推断预后、决定随访策略。
这种分层让任何一道题都可以被打上"它考察哪一层"的标签,从而让评测结果可以下钻——比如"模型 X 在 Perception 上 80%,但 Reasoning 上 35%",比一个 60% 的总分有用得多。
3. 评测对象
20 个 MLLM 分三组对比: - 闭源通用模型(proprietary):GPT-4V 类、Gemini 类; - 开源通用模型:Qwen-VL、LLaVA、InternVL 等系列; - 医学域专门模型:Med-Flamingo、LLaVA-Med 等。
这种三足鼎立的设置正是为了回答一个问题:专用医学数据 + 微调,到底能不能换到 OCT 能力上的稳定收益?
关键实验与数据
论文的核心结论不是某一个数字,而是一组反直觉的模式:
- 总分都低:所有模型在 OCT-Bench 上的表现都"明显不足以支持可靠临床理解"(原文未给精确百分比,abstract 用的是 "substantially short" 这种定性表述)。
- 规模 scaling 不稳定:更大的模型 ≠ 更好。在某些能力层上,更大的开源模型反而比小模型差。
- 医学域适配收益不稳定:LLaVA-Med 这类专用模型相比通用 LLaVA 没有稳定优势——某些任务上赢,某些任务上输。
具体数字因为 abstract 没列、PDF 未读无法精确引用,精确数字以原文 Table 为准(原文未明确)。
评测设计上值得提的几点: - 多选题(避免开放式答案评测噪声); - 题量大(>10k)+ 分层细(20 任务 × 3 层),统计上有保障; - 涵盖 7 个数据集(避免单一数据集 bias)。
亮点与局限
亮点
- 临床工作流驱动的能力分层:把"Perception-Cognition-Reasoning"作为评测骨架,本身就是 benchmark 设计上的贡献,可被后续工作复用。
- 三组模型横向比较:把"是否值得做医学微调"这件事在 OCT 上重新审视,给出谨慎结论。
- 数据来源透明:7 个公开数据集拼装,避免私有数据集带来的不可复现问题。
- 任务数量大:20 个任务 × 千题以上,统计稳定性远高于"几十道题"的早期 benchmark。
局限
- 只考多选题:开放性诊断推理("为什么是 AMD 而不是 CSC?")这种临床真正关心的能力,MCQ 测不到。
- 只在 OCT 一个模态:OCT 是眼科影像,不能推广到 CT/MRI/病理——但题目越多、数据集越杂,建模工作越大,这是合理取舍。
- 评估时间切片:2026 年 7 月发表的 benchmark,对未来模型会迅速过时;后续需持续更新。
- 评测静态化:没有引入 agentic / 多轮交互场景,而临床读片常常需要反复放大、对比、追问。
- 数据集偏差未量化:7 个公开数据集来源、采集设备、人群分布不一,是否带来系统性偏差,原文未明确。
对工程落地的启发
- 医学 MLLM 的"刷榜点"找错了:在 OCT 这种细粒度影像上,通刷医学对话数据不一定有效。考虑针对特定模态做小规模高质量 SFT。
- 产品级医学影像助手必须分层设计:别指望一个端到端模型同时搞感知和推理;pipeline 式(先 perception 模型识别结构 → 再 cognition 模型分类 → reasoning 模型做决策)在 OCT 上更可靠。
- Reasoning 层是当前最大瓶颈:从过往 benchmark 的经验看(原文未明确此处具体数字),Reasoning 任务比 Perception 难得多。这意味着即使 Perception 做得不错,端到端临床建议的可靠性依然堪忧。
- 评测要分维度报告:总分没意义,Perception / Cognition / Reasoning 三层分别报告才有诊断价值——这是医学 AI 落地的常识级要求。
- 临床落地的前置门槛:在模型"substantially short of reliable" 之前,不要上临床流程。OCT-Bench 给出了一个客观门槛参考。
与同方向工作的关系
- LLaVA-Med / Med-Flamingo:医学 MLLM 代表作,本文评测对象之一,结论对其推广性提出质疑。
- PMC-VQA / MedVQA / OmniMedVQA:通用医学 VQA benchmark,OCT-Bench 是第一个专门下钻到 OCT 这种单一影像模态并按临床工作流分层的。
- VQA-RAD / Path-VQA:早期放射 / 病理 VQA,形式上是 MCQ,但任务粒度粗,与本文不可直接比较。
- GPT-4V / Gemini 医疗评测文献:2024–2025 一波"闭源 MLLM 医疗 benchmark"工作,OCT-Bench 是其中第一个明确把"分层能力"作为主轴的。
- 放射学 / 眼科影像传统深度学习:如 RETFound、RETFound-OCT 等专用模型;OCT-Bench 没把它们纳入评测(这部分原文未明确),未来可补。
适合谁读
- 做医学多模态 / MLLM 训练与评测的研究者和工程师;
- 眼科 AI 影像产品的算法负责人,特别是正在评估"用 GPT-4V 还是自建" 的团队;
- 关注 benchmark 设计的通用 MLLM 研究者——本文的"能力分层"方法论可迁移到其他医学模态(CT、MRI、病理);
- 临床医生 / 医院信息科负责人:评估"现在上 MLLM 读片,到底能不能信"——答案本文给得很清楚:还不能信;
- 不适合:只关心通用 chat 模型、跟医学无关的读者。
工程落地与核查(Jay)
1. 分层 pipeline 设计:当前比端到端更稳妥的工程路径
本文的核心工程洞察是:Perception / Cognition / Reasoning 三层的能力曲线完全不同——规模 scaling 在各层表现不一致,医学微调也不能稳定提升。这意味着:
当前推荐的分层架构(而非追求单一大一统模型):
OCT 图像
↓
[Perception 模型] → 视网膜分层结构、图像质量判断
↓ 结构化输出(分层边界、病变位置)
[Cognition 模型] → 病变分类(AMD/CSC/正常等)
↓ 分类标签 + 严重程度
[Reasoning 模型] → 治疗建议、随访策略
每层可独立选型、调优、替换,不需要三层同时用同一个大模型。
⚠️ 存疑:原文未给出分层 pipeline vs 端到端单模型的直接对比实验数据,该建议基于 benchmark 结论的推断,非原文实证。
2. 评测数字的解读方式
由于原文 abstract 未给出精确数字,工程团队使用 OCT-Bench 时需注意:
- 不要用总分做产品决策:总分掩盖了"Perception 强但 Reasoning 弱"的结构性问题;
- 关注 Reasoning 层得分:这才是临床落地的真正瓶颈所在,分数低说明即使感知做得好也不能直接上临床;
- 按子任务下钻:20 个子任务里,具体哪几个 Perception 子任务得分高比总分更有参考价值——它们决定哪些临床场景可以先试点。
⚠️ 存疑:20 个子任务与三层之间的对应关系原文未明确(如 Perception 层包含哪几个子任务),精确实测数字需查阅原文 Table。
3. 评测局限性带来的工程约束
OCT-Bench 本身的局限需要在产品设计时纳入考量:
| 局限 | 工程约束 |
|---|---|
| 只考 MCQ,无开放式诊断 | 产品形态不要做成"开放式诊疗建议",MCQ 强不等于开放诊断强 |
| 单次静态评测,无多轮交互 | 临床场景的多轮放大/对比/追问场景不在评测范围内 |
| 2026 年 7 月时间切片 | GPT-4o、Claude 4 等更新模型未覆盖,需定期重测 |
| 7 个数据集偏差未量化 | 若产品面向特定设备/人种,需在该子集上单独验证 |
4. 医学微调策略的实证参照
本文给"盲目做医学微调"泼了冷水,工程团队的决策参考:
- LLaVA-Med vs 通用 LLaVA 无稳定优势 → 做微调前先在 OCT-Bench 上测一下目标层是否真的提升;
- 规模 scaling 不稳定 → 不要认为"更大的模型 = 更好的 OCT 效果",实测是唯一验证方式;
- 通刷医学对话数据不够 → 应该针对 OCT 影像模态本身的视觉特征做 SFT,而非只喂医学文本。
5. ⚠️ 事实核查与存疑汇总
- 20 个子任务与三层的对应关系未在摘要明确:Perception / Cognition / Reasoning 三层各包含哪些子任务,摘要未列出,表格需查阅原文;
- 所有模型"明显不足以支持可靠临床理解":原文为 "substantially short" 定性描述,无精确数字,⚠️ 勿将其误解为"所有模型 < 50%";
- 闭源通用模型(proprietary)组的构成:摘要写"GPT-4V 类、Gemini 类",但未列出具体版本号(如 GPT-4V-1106 vs GPT-4o),不同版本能力差异大;
- 规模 scaling 结论的表述:原文说"更大的模型 ≠ 更好",但具体哪个开源系列出现反 scaling,摘要未明确;
- LLaVA-Med 医学微调收益不稳定:原文未给出 vs 通用 LLaVA 的具体差值范围,⚠️ 勿将其解读为"医学微调完全无效"。
评分
- 机制 ✅(三层架构 + 20 子任务设计合理)
- 工程 ✅(分层 pipeline 建议具体可行)
- 数字 ⚠️(全文 abstract 无精确数字)
- 风险边界 ✅(MCQ 局限、多轮交互缺失、评测时间切片 均已标注)
- 综合:3 分