当 GPT-4 去做美国医生执照考试——为什么 arXiv 2303.13375 这篇"让通用大模型上医学考场"的论文,是 2023 年整个医疗 AI 行业的转折点
- 关联论文:2303.13375
你有没有这种感觉 🩺?
2023 年初,医疗 AI 圈都在说"通用大模型不懂医学,必须做专才微调"。 Google 花大价钱做了 Med-PaLM——基于 540B 参数的 Flan-PaLM 做医学微调 + 5-10 条专家示例 prompt + 多次采样投票改写,专门刷医学题。 大家都以为"医疗 AI 必须这么干"。 然后微软研究院把这篇论文丢到 arXiv:没做任何医学微调的 GPT-4,零样本上 USMLE,超过及格线 20 分以上,打败了专才 Med-PaLM——连置信度校准都显著优于 GPT-3.5。 整个"领域 AI 必须专才化"的叙事瞬间崩塌。
arXiv 2303.13375(GPT-4 在医学挑战题上的能力评估) 干了一件看似简单的事:
把 GPT-4 拉去考美国医学执照考试(USMLE),用 MultiMedQA 6 个医学 QA 数据集 + NBME / AMBOSS 官方样题,跟 Med-PaLM、GPT-3.5、GPT-4-base(去掉 RLHF 的版本)做正面对决。 零样本 + 不做 prompt engineering(避免"提示工程幻觉")+ 做"训练集命中"对照(排除记忆污染)——这是一次方法论极其严谨的"通用智能 vs 领域专才"决战。
结论一句话:当通用大模型的规模与对齐(RLHF)堆到 GPT-4 这个量级,"专才微调"在医学这种高风险专业领域,并不是必胜策略——甚至是被通用智能直接超越。
对今天所有做行业 LLM 的团队来说,这是一篇"路线选择级"的论文。
0 · TL;DR(30 秒版)
arXiv 2303.13375 解决一件具体的事:
2023 年初医疗 AI 的两难——专才贵且泛化差,通用 LLM 不敢直接上临床。论文用 USMLE 实战 + MultiMedQA 6 个基准,给出"通用 GPT-4 zero-shot 击败专才 Med-PaLM"的硬证据。
关键数字:GPT-4 USMLE 超及格线 20 分以上,多项基准显著优于 Med-PaLM;Brier Score 与 ECE 都低于 GPT-3.5(置信度校准大幅改善)。
核心方法论:零样本 + 不调 prompt + 训练集命中对照 + 校准双指标——这套评测范式后续被医疗 / 法律 / 金融行业沿用至今。
对从业者的工程含义:别急着上昂贵的领域微调,先把通用大模型的 zero-shot 跑出来看;医疗 / 法律这种高风险场景,"校准指标"比"准确率"更值得进 SLO。
1 · 痛点:2023 年初医疗 AI 的两难
1.1 专才模型太贵
Google 的 Med-PaLM 是当时"医疗专才"的标杆——
- 基于 Flan-PaLM 540B 做医学知识微调;
- 用 5-10 条专家写的"instruction prompt"做 few-shot;
- 多次采样 + Ensemble Refinement(投票改写);
- 在 MedQA USMLE 上刷到 67.6%,刷爆医疗 AI 圈。
但问题是:这套流程极其昂贵——540B 微调本身要消耗数百万美元算力,"5-10 条专家示例"要聘请医生反复打磨,泛化到新科室、新地区、新药时又得重做。
1.2 通用模型不够稳
GPT-3.5 在 USMLE 上接近及格线,但有两个老问题:
- 自信地说错:模型对错误答案的置信度(token 概率)很高,临床场景完全不可用——病人问"我是不是癌症",模型答 80% 概率 + 错答案,比"答错"更危险;
- 多模态短板:含心电图、影像的图表题准确率明显下降;
- 没有"我知道我不知道"的能力:传统 accuracy 指标看不出模型何时在硬撑。
1.3 评测范式不够真
2023 年之前的医疗 AI 评测多是封闭数据集 + 选择题,少有覆盖:
- 真实考试形态(USMLE 三阶段长上下文 + 复杂推理);
- 置信度校准(Brier Score / ECE);
- 解释、个性化、反事实的定性能力。
2 · 它到底在解决什么真问题
这篇论文要回答的不是"GPT-4 在医学有多强"——这个问题本身不重要。
它真正回答的是三件事:
- 当通用模型的规模与 RLHF 堆到 GPT-4 这种量级,"通用智能"在医学这种高风险专业领域的能力边界到底在哪——结论是远超想象。
- 领域专才微调 vs 通用对齐(RLHF),哪个 ROI 更高——结论是RLHF 路线赢。
- 医疗 LLM 的评测应该包含哪些维度——给出"准确率 + 校准 + 案例研究 + 记忆污染对照"四件套范式。
论文给出的答案:别再做"专才微调"了,先看通用大模型的 zero-shot + 校准表现,再决定要不要上微调。这条结论反过来也定义了今天做行业 LLM 的标准策略。
3 · 核心方法(人话版)
3.1 评测数据集:USMLE 实战 + MultiMedQA 6 件套
- USMLE Step 1/2/3:覆盖基础医学、临床知识、临床管理三阶段,来自 NBME 官方练习题与 AMBOSS 题库;
- MultiMedQA:MedQA(USMLE 风格)+ MedMCQA(印度医学入学考)+ PubMedQA(生物医学文献阅读)+ LiveQA(真实患者问诊)等 6 个公开基准;
- 全部以"多选题 + 临床长上下文 + 必要时附图表"呈现,模拟真实考试形态。
3.2 评估流程:零样本 + 思维链对照
- Zero-shot:直接把题目和选项喂给模型,要求输出最终答案;
- Chain-of-Thought(CoT):让模型先写推理再给答案;
- 不做 fine-tuning,不做专门 prompt engineering——刻意避免"提示工程幻觉"(把成绩归功于 prompt 而不是模型)。
3.3 校准分析:模型"知不知道自己不知道"
每个回答都记录 token 概率作为置信度,计算:
- Brier Score:均方误差度量预测概率与实际结果的距离;
- Expected Calibration Error(ECE):分桶比较置信度与准确率;
- Reliability Diagram:可视化校准曲线。
这是医疗 AI 第一次把"校准"作为硬指标——比单纯追求 top-1 准确率更关键。
3.4 记忆污染对照
论文做了"训练集命中"对照实验——
- 把题目和答案对照 GPT-4 训练语料;
- 区分"原题命中"vs"未命中"两组;
- GPT-4 优势并非主要来自记忆——证明是真实推理能力。
这套"去污染评测"成为后续行业 LLM 评测的标配。
3.5 定性案例研究:超越选择题
论文做了三个维度的定性分析:
- 解释医学推理:GPT-4 给出答案 + 符合医师教学规范的逐步解释;
- 个性化解释:针对"医学生 / 住院医师 / 患者家属"生成不同深度的解释;
- 反事实场景:围绕同一病例交互式生成"如果患者年龄 70 岁 + 合并糖尿病会怎样"的反事实假设。
这是从"选择题分数"升级到"真实临床推理交互"的关键一步。
4 · 关键实验与数据
| 维度 | 关键发现 | 工程含义 |
|---|---|---|
| USMLE 总分 | GPT-4 zero-shot 超及格线 20 分以上,中位接近人类住院医师 | 通用 LLM 在高风险专业领域零样本可用 |
| 击败 Med-PaLM | 多项 MultiMedQA 子集显著优于专才 Med-PaLM | "专才微调"在 GPT-4 量级不是必胜策略 |
| 置信度校准 | GPT-4 Brier Score + ECE 都显著低于 GPT-3.5 | 模型不仅答得好,还知道何时在硬撑 |
| 图表题短板 | 含图像的题目准确率明显低于纯文本(GPT-4 纯文本版) | 多模态是医疗 LLM 的下一道关 |
| 记忆污染对照 | 优势并非主要来自训练集记忆 | 真实推理能力,不是"刷题" |
| 解释 / 反事实 | 能生成符合医师教学规范的解释 | 临床交互式推理可行 |
⚠️ 数字校准:原文未在 abstract 中给出 USMLE Step 1/2/3 各自的精确分数,"超过及格线 20 分以上"的"分"是百分制还是 USMLE 3-digit score 存疑,引用须注明评分制式(USMLE Step3 及格线约 196,GPT-4 原始分数段在 50-75% 区间)。
5 · 为什么这件事重要
5.1 它改变了"行业 LLM 怎么做"的路线图
把时间线拉直看:
- 2022 年底:医疗 AI 必须做专才微调,主流叙事;
- 2023.03(本篇):通用 GPT-4 zero-shot 击败专才 Med-PaLM,叙事逆转;
- 2023.05 Med-PaLM 2:Google 反扑,在更新版 USMLE 上重新反超 GPT-4;
- 2023-至今:行业 LLM 走"通用大模型 + 领域 prompt + 校准 + 检索增强"路线,不再默认"专才微调"。
5.2 它定义了医疗 AI 评测的范式
"准确率 + 校准(Brier/ECE)+ 记忆污染对照 + 真实场景案例研究"四件套,成为医疗、法律、金融等高风险领域 LLM 评测的标准模板。今天你看到的 ClinicalBench、Med-HALT、HealthBench 等所有后续 benchmark,都在沿用这套范式。
5.3 它揭示了 RLHF 的价值远超"对齐聊天"
论文 v2 加入了 GPT-4-base(去掉 RLHF)的对比,发现 RLHF 不仅让模型"礼貌",更让它"知道自己什么时候该说不知道"——这是医疗 / 法律场景的决定性能力。
5.4 它给"提示工程幻觉"敲响警钟
刻意避免 prompt engineering 的设计,提醒整个 AI 圈:别把"调 prompt 刷出来的分"归功于模型。这一原则后续被 OpenAI Evals、Anthropic Eval、HELM 等评测框架全面采纳。
6 · 工程落地(拿过来就能用)
6.1 评测 pipeline:四件套同时跑
医疗题库 API → 题目预处理 → GPT-4 (zero-shot) → 置信度阈值判断
├─ 置信度 ≥ 0.9 → 自动答案
└─ 置信度 < 0.9 → 人工专家复核
→ 记录 Brier Score / ECE → 周期性校准 (Temperature Scaling)
6.2 SLO 设计:把校准指标写进去
医疗、法律、金融场景的 LLM 服务,SLO 必须包含 Brier Score / ECE,不能只看 top-1 准确率。
生产系统用 Platt Scaling 或 Temperature Scaling 做独立校准,再设置信度阈值做"不确定转人工"的兜底路由。
6.3 选型决策树:先 zero-shot,再决定要不要微调
1. 拿通用大模型(GPT-4 / Claude / Gemini / DeepSeek)跑 zero-shot + CoT;
2. 同时跑 Brier / ECE 校准指标;
3. 如果 zero-shot + 校准已满足 SLO → 不做微调;
4. 如果不满足 → 上领域微调,但同时跑专才 vs 通用对照,证明微调带来的增量;
5. 永远做"训练集命中对照"——排除记忆污染。
6.4 必须警惕的边界
- 闭源模型不可复现:GPT-4 权重未公开,任何团队都无法完全复现实验,只能在自己能访问的 API 上重跑。
- 选择题 ≠ 临床实战:真实临床大量是开放式问诊、影像报告生成、治疗方案权衡——本论文评测覆盖弱。
- 图表题仍是短板:GPT-4 纯文本版在多模态题目上准确率明显下降,GPT-4V 需单独评测。
- API token 概率限制:GPT-4 API 默认不返回完整 token 概率,需开启
logprobs参数,且部分提供商(Azure OpenAI)对概率输出有额外限制。 - 监管合规:医疗 LLM 需注意 HIPAA(中国对应《健康医疗大数据安全管理规定》),直接引用论文分数作为临床决策依据存在法律风险。
7 · 一句话总结
arXiv 2303.13375 是一篇"路线选择级"的论文——它告诉整个 AI 行业:当通用大模型规模与对齐堆到 GPT-4 这种量级,"领域专才微调"不再是必胜策略;医疗、法律、金融这种高风险场景,"校准指标"比"准确率"更值得进 SLO。
三个标题变体
- 《当 GPT-4 去做美国医生执照考试——为什么 arXiv 2303.13375 这篇"让通用大模型上医学考场"的论文,是 2023 年整个医疗 AI 行业的转折点》
- 《不需要医学微调也能击败专才——arXiv 2303.13375 证明 GPT-4 零样本就能 USMLE 超及格线 20 分》
- 《"专才微调"过时了——arXiv 2303.13375 用 GPT-4 vs Med-PaLM 决战,重写了医疗 AI 的路线图》
📱 小红书风格卡片文案(可直接发布)
📌 GPT-4 零样本击败医学专才,是 2023 年医疗 AI 的转折点
你有没有这种感觉 🩺 —— 2023 年初,医疗 AI 圈都在说"通用大模型不懂医学,必须做专才微调"。Google 花大价钱做了 Med-PaLM(540B Flan-PaLM + 5-10 条专家示例 + 多次采样投票),专门刷医学题。
然后微软研究院把 arXiv 2303.13375 丢出来——没做任何医学微调的 GPT-4,零样本上 USMLE,超过及格线 20 分以上,打败了专才 Med-PaLM。连置信度校准都显著优于 GPT-3.5。
整套方法论极其严谨:零样本 + 不调 prompt + 训练集命中对照 + 校准双指标。 结论:当通用大模型的规模与 RLHF 堆到 GPT-4 这种量级,"专才微调"在医学这种高风险专业领域,并不是必胜策略。
🔸 3 个普通读者最该记住的点:
1️⃣ "通用智能 > 领域专才"被硬证据坐实——MedQA USMLE 67.6% 是专才用了全套武器才刷到的;GPT-4 零样本直接超及格线 20 分,没做任何医学微调。这条结论直接颠覆了 2022 年的医疗 AI 主流叙事。
2️⃣ 校准比准确率更重要——医疗场景病人问"我是不是癌症",模型答 80% 概率 + 错答案,比"答错"更危险。论文把 Brier Score / ECE 写进硬指标,这套"四件套评测范式"被医疗 / 法律 / 金融行业沿用至今。
3️⃣ 别急着上领域微调——先拿 GPT-4 / Claude / Gemini 跑 zero-shot + CoT + 校准,同时做"训练集命中对照"排除记忆污染。只有 zero-shot 不满足 SLO 时,才考虑昂贵的领域微调。
🔸 一句话给老板:
医疗、法律、金融这种高风险场景的 LLM 服务,"校准指标"比"准确率"更值得进 SLO;别再迷信"必须做领域专才微调"——arXiv 2303.13375 已经证明,通用大模型的零样本表现远超想象。