GPT-4 在医学挑战题上的能力评估:当通用 LLM 超过医学专才

  • 关联论文:2303.13375
  • 作者:flyP
  • 更新:2026-07-21

一句话结论

微软研究院团队用 USMLE 官方练习题与 MultiMedQA 基准系统评估 GPT-4,证明未经任何医学专门微调的通用大模型,以零样本提示即可在 USMLE 上超过及格线 20 分以上,并击败针对医学知识专门微调的 Med-PaLM,更关键的是置信度校准显著优于 GPT-3.5——这是一次"通用智能 > 领域专才"的标志性实验,也奠定了后续医疗 LLM 评测的范式。

解决什么真问题

2023 年初,医疗 AI 面临两难:

  • 专才模型(Med-PaLM)需要昂贵的医学微调和提示工程,且泛化能力存疑。
  • 通用大模型(GPT-3.5)在 USMLE 上接近及格线,但准确率仍不足,且常常"自信地说错",临床场景不可用。
  • 现有评测多在封闭数据集上做选择题,缺乏对真实考试形态(USMLE 三阶段长上下文 + 复杂推理)和置信度校准的双重考察。

这篇论文要回答:当通用模型的规模与 RLHF 训练堆到 GPT-4 这个级别,它在医学这种高风险专业领域的能力边界到底在哪里

核心方法

评测数据集:USMLE 实战 + MultiMedQA

论文用两套互补的数据:

  1. USMLE 官方样题:覆盖 Step 1(基础医学)、Step 2 CK(临床知识)、Step 3(临床管理)三阶段,题目来自 NBME 公开练习材料与 AMBOSS 题库,均带详细解析。
  2. MultiMedQA 套件:包含 MedQA(USMLE 风格)、MedMCQA(印度医学入学考试)、PubMedQA(生物医学文献阅读)、LiveQA(真实患者问诊)等 6 个公开基准,覆盖英语与多语言场景。

所有题目以 USMLE 真实考试形态呈现——多选题 + 临床长上下文 + 必要时附图表。

评估流程:zero-shot + 思维链对比

  • Zero-shot:直接把题目和选项喂给模型,要求输出"最终答案"。
  • 思维链(CoT):让模型先写推理,再输出最终答案。
  • 不做 fine-tuning,不做专门的 prompt engineering(避免"提示工程幻觉"——把模型成绩归功于提示词而不是模型本身)。

校准分析:置信度 vs 准确率

对每个回答,记录模型对所选答案的 token 概率,以此作为置信度。计算:

  • Brier Score:均方误差度量预测概率与实际结果的距离。
  • Expected Calibration Error(ECE):分桶比较置信度与准确率。
  • Reliability Diagram:可视化校准曲线。

定性案例研究:解释、个性化、反事实

论文不只看分数,还做了深入的案例分析:

  • 解释医学推理:GPT-4 不仅给出答案,还能写出符合医师教学规范的逐步解释。
  • 个性化解释:针对"医学生""住院医师""患者家属"三种受众生成不同深度的解释。
  • 反事实场景构造:能围绕同一病例交互式生成"如果患者年龄换成 70 岁、合并糖尿病会怎样"的反事实假设。

模型对比:通用 vs 医学专才

  • GPT-4:闭源通用 LLM,RLHF 训练,未做医学专门微调。
  • GPT-3.5:同源前代,作为基线对照。
  • GPT-4-base:去掉 RLHF 的纯基础模型(论文 v2 补充),用于隔离 RLHF 的贡献。
  • Med-PaLM:基于 Flan-PaLM 540B 做医学知识微调与提示工程的专才模型。
  • Anthropic Claude / 其他开源模型:作为补充对比。

关键实验与数据

  • USMLE 总分:GPT-4 zero-shot 超过 USMLE 及格线 20 分以上(原文明确给出),中位表现接近人类住院医师水平。
  • 超越 Med-PaLM:在多项 MultiMedQA 子集上 GPT-4 显著优于 Med-PaLM,说明通用大模型在充分 RLHF 后,无需专门医学微调即可胜过专才模型。
  • 超越 GPT-3.5:在 USMLE 上绝对分数提升巨大,具体数字以论文表为准(原文未在 abstract 中给出单一汇总数)。
  • 校准改进:GPT-4 的 Brier Score 与 ECE 都显著低于 GPT-3.5;意味着 GPT-4 不仅答得更好,还更清楚自己什么时候答得对——这在高风险临床场景是决定性优势。
  • 图表题:含图像的 USMLE 题(如心电图、医学影像)对 GPT-4 仍是挑战,准确率明显低于纯文本题(原文未给出具体降幅)。
  • 记忆 vs 推理:论文特别做了"题目在训练集中出现与否"的对照实验,发现 GPT-4 的优势并非主要来自记忆,而是真实推理能力。
  • 案例研究:定性展示了 GPT-4 在解释、个性化、反事实三个维度的能力,这是后续医疗 LLM 评测中"超越选择题"的早期范式。

亮点与局限

亮点

  • 零样本击败专才:核心结论震撼,打破"领域 AI 必须在领域数据上专门训练"的迷思。
  • 校准 + 准确率双指标:在医疗这种高风险场景,模型是否"知道自己不知道"比单纯准确率更关键。
  • 方法论严谨:不依赖 prompt 工程,做记忆测试排除训练集污染,可比性极强。
  • 超越选择题:案例研究展示了 GPT-4 在真实临床推理交互中的潜力,为后续医疗 Copilot 产品铺路。
  • 公开数据 + 闭源模型:评测在公开基准上做,所有团队都能复现,虽然不能微调 GPT-4。

局限

  • 闭源模型不可复现:GPT-4 权重未公开,任何团队都无法完全复现实验,只能在自己能访问的 API 上重跑。
  • 选择题形式主导:实际临床问题很多是开放式问诊、影像报告生成、治疗方案权衡,本论文评测覆盖弱。
  • 图表题仍是短板:含图像的多模态题目准确率明显下降,说明 GPT-4 在该版本的多模态融合能力有限。
  • 临床安全未充分验证:考试分数不等于临床可用,论文也明确警告"不应作为临床决策依据"。
  • 缺乏真实患者数据评测:基于公开题库的评测无法反映真实临床的复杂性、伦理约束与法律责任。
  • RLHF 的医学影响未深入讨论:论文 v2 加入了 GPT-4-base 的对比,但对 RLHF 在医学领域的具体影响机制分析有限。

对工程落地的启发

  1. 校准比准确率更值得投入:医疗、法律、金融等高风险场景,把 Brier Score / ECE 列入 SLO,比单纯追求 top-1 准确率更关键。
  2. 不要急着做领域微调:当通用大模型规模与对齐质量达到 GPT-4 / GPT-5 级别,先评估 zero-shot 与 few-shot 的真实表现,再决定要不要上昂贵的领域微调。
  3. 评测要包含"置信度"维度:生产环境中的 LLM 应该输出 token 概率或置信度,让下游系统能做"不确定 → 转人工"的兜底路由。
  4. 多模态是下一道关:医学影像、检验报告、影像组学的多模态融合能力,是医疗 LLM 的真正壁垒,论文已暗示这道关还没过。
  5. 做选择题之外,做真实交互评测:临床场景要求解释、个性化、反事实,产品评测必须超越多项选择题。

与同方向工作的关系

  • Med-PaLM / Med-PaLM 2(Google, 2023):同期的医学 LLM 专才代表,本论文是直接对比对象。Med-PaLM 2 后续报告了在 USMLE 上反超 GPT-4(更新版本),体现军备竞赛式迭代。
  • MultiMedQA:本论文提出的统一评测套件,后续被 Google、Anthropic 等广泛采用。
  • PubMedQA / MedQA / MedMCQA:作为 MultiMedQA 的子集,被独立引用数千次,是医学 LLM 的标准基线。
  • HealthSearchQA / LiveQA:真实患者问诊类数据集,补充了选择题之外的临床场景。
  • 后续医疗 LLM 评测工作(如 Med-HALT、ClinicalBench):都继承本论文的"zero-shot + 校准 + 真实临床场景"三件套范式。

适合谁读

  • 医疗 AI 产品经理:理解"通用大模型在医疗领域的能力边界",避免被"专才模型更好"的过时叙事带偏。
  • 医疗 LLM 应用工程师:把校准指标引入 SLO,设计"不确定转人工"的兜底路由。
  • 医学考试备考 / 医学教育从业者:案例研究中"个性化解释"和"反事实场景"是 AI 教学助手的范式。
  • AI 政策与监管研究者:本论文同时给出能力上限和临床安全警告,是医疗 AI 监管讨论的关键文献。
  • 跨领域研究者:把医学作为"高风险 + 高价值"的代表场景,本论文的评测方法可推广到法律、金融、工程等同等量级的领域。

不确定处:原文未在 abstract 中给出 USMLE Step 1/2/3 各自的精确分数,仅给出"超过及格线 20 分以上"和"显著优于 Med-PaLM"等概括;GPT-3.5 在 USMLE 上的具体分数与 GPT-4 的图表题准确率降幅需查正文表格。

工程落地与核查(Jay)

事实核查表

核查项 原文表述 核查结论 风险等级
USMLE 及格线超 20 分 "超过 USMLE 及格线 20 分以上" ⚠️ USMLE 及格线 Step1/2/3 各有不同(Step3 及格线约 196),GPT-4 原始分数段在 50–75%(具体百分位因评分方式不同有争议);"20 分"口径出处需核验原文正文 Table,abstract 仅定性表述 ⚠️ 中
击败 Med-PaLM "GPT-4 显著优于 Med-PaLM" ✅ 有正文多基准数据支撑,可信度高
图表题准确率下降 "准确率明显低于纯文本题" ⚠️ 原文未给出具体降幅;GPT-4V(视觉版本)发布前纯文本与多模态差距无法精确量化 ⚠️ 低(定性准确,定量缺失)
置信度校准优势 "Brier Score 与 ECE 显著低于 GPT-3.5" ✅ 原文 v1/v2 均有量化 ECE 数据,声明属实
非记忆来自训练集污染 "优势并非主要来自记忆" ⚠️ 论文做了"训练集命中"对照,但具体"非主要来自记忆"的比例拆分(记忆 vs 推理)原文仅定性,未给出数值 ⚠️ 低

⚠️ 存疑处

  • USMLE 分数基准:"超过及格线 20 分"中的"分"是百分制分还是 USMLE 3-digit score?两套评分体系差异约 2–3 倍;引用此数字须注明评分制式。
  • Med-PaLM 版本:2023 年 Med-PaLM 有多个版本(Med-PaLM、Med-PaLM 2),本稿未区分,GPT-4 对比的具体是哪个版本存疑。
  • 图表题数字缺失:原文未量化多模态题目准确率降幅,稿中"明显低于"为定性描述,引用具体降幅需回查正文。

实际系统怎么用

适用场景: - 以 API 方式接入 GPT-4/GPT-4V,构建医疗题库评测流水线;输入 USMLE 格式题目,输出答案 + 置信度分数,低于阈值的自动路由给人工审核。 - 评测 pipeline 可用 medpaLm-eval 类开源工具或自建零样本评测框架,输入 MedQA/PubMedQA JSON 数据即可批量跑分。

生产系统关键坑:

  1. API token 概率获取限制:GPT-4 API 默 minimization 不返回完整 token-level 概率分布;需开启 logprobs 参数并注意 cost 上限;部分提供商(如 Azure OpenAI)对概率输出有额外限制。
  2. 置信度 ≠ 真实准确率:token 概率是主观置信度,不是客观正确率;GPT-4 存在"自信地出错"(overconfidence on incorrect answers),生产系统必须做独立校准(Platt Scaling / Temperature Scaling)再设阈值。
  3. 图表题多模态接入:本论文测试的 GPT-4 为纯文本版;GPT-4V(视觉)需单独评测,且医学影像(CT/MRI DICOM 格式)需预处理为图像格式再送入模型,不能直接处理原始 DICOM。
  4. 监管合规:医疗场景使用 LLM 需注意 HIPAA(中国对应《健康医疗大数据安全管理规定》)、模型提供商合规声明;直接引用论文分数作为临床决策依据存在法律风险。
  5. 评测集污染:MedQA/PubMedQA 可能已被 GPT-4 训练数据覆盖,需做"去污染"版本评测(论文本身做了此对照,但生产系统选用评测集时应验证)。

典型集成架构

医疗题库 API → 题目预处理 → GPT-4 (zero-shot) → 置信度阈值判断
                                              ├─ 置信度 ≥ 0.9 → 自动答案
                                              └─ 置信度 < 0.9 → 人工专家复核
                → 记录 Brier Score / ECE → 周期性校准 (Temperature Scaling)

扩展方向

  • Fine-tune 评估:若做医学微调版本,论文方法论(zero-shot 基线 + 微调后对比 + 记忆污染核查)可直接复用;建议同时测 Med-PaLM 2 最新版做横向对比。
  • 多模态融合:DICOM 影像 → 图像描述模型(如 BiomedCLIP)→ 结构化描述 → GPT-4V 联合推理;当前技术栈成熟度有限,单模型端到端方案不稳定。