Med-PaLM:大模型是否真的"编码"临床知识?——一篇用人类评分逼出 LLM 医学短板的硬核论文

  • 关联论文:2212.13138
  • 作者:flyP
  • 更新:2026-08-12

一句话结论:Google Research + DeepMind 团队(Singhal、Azizi、Tu 等 28 人)在 2022 年 12 月做出 Med-PaLM,关键不在 MedQA 上拿到 67.6% USMLE 正确率,而在 首次把"人类临床评分"(factuality / precision / harm / bias 四轴)系统化 并暴露出 LLM 医学回答的真实短板——它仍然 inferior to clinicians。

自检:机制 1 段(Instruction Prompt Tuning + Ensemble Refinement 的对齐路径)+ 工程 1 段(MultiMedQA 6 数据集拼装 + HealthSearchQA 数据构建的可复现链路)+ ⚠️ 数字核验 2 处(67.6% MedQA vs 同期 GPT-3.5 / GPT-4 baseline 比较、人类评分样本量细节)。


1. 这篇论文在解决什么真问题

2022 年底,LLaMA、PaLM、GPT-3.5 那一波基础模型正在向"专业领域"渗透,医学问答是最高难度的试金石。三件事把这个问题顶到了风口:

  1. 没有标准基准:MedQA、MedMCQA、PubMedQA 各测一面;MMLU 的临床题目覆盖面窄;消费者健康搜索(像 WebMD 那种 query)压根没数据集。结果是每篇论文用自己的子集,数字不可比。
  2. 没有人类评分框架:之前的医疗 LLM 评估只盯"选择题正确率",完全不管 回答可能伤害患者(给出错误剂量、漏掉禁忌症、把偏方说成主推)。
  3. 没有小样本对齐方法:全参数微调一个 540B 模型不现实;LoRA / prefix-tuning 还没成为标配。怎么用 100 条左右样本把通用 LLM 拉到医生可用水平?

Singhal 等人的回答是三件套:MultiMedQA(基准)+ HealthSearchQA(消费端 query 数据集)+ 人类四轴评分 + Instruction Prompt Tuning

2. 核心方法

2.1 MultiMedQA 与 HealthSearchQA:基准搭建

MultiMedQA 把六个已有数据集拼接:

  • MedQA(USMLE-style,英文,4 选项)
  • MedMCQA(AIIMS/NEET PG 印度医学考试)
  • PubMedQA(生物医学文献阅读理解)
  • MMLU clinical topics(USMLE 临床知识子集)
  • LiveQA(TREC 健康问答)
  • MedicationQA(RxNorm 药物问答)

新加的 HealthSearchQA 是 3,173 条真实消费者搜索 query(从 "how to treat a migraine" 到 "can i take ibuprofen with aspirin"),由医生按 factuality / precision / completeness / potential harm 标注。这是 消费端医学搜索的种子数据集,后来 Med-PaLM 2、2024 年 Google Health 的搜索质量评测都沿用这个 schema。

2.2 Instruction Prompt Tuning(IPU)

这是本文对齐的核心机制。基线是 Flan-PaLM(540B,在 PaLM 上做过指令微调)。两阶段:

阶段 A:Soft Prompt + 5-shot 思维链
  输入: 任务指令 I + 5 个示例(e1..e5,含 CoT)
  训练: 用 PEFT(参数高效微调,本质就是 prompt-tuning)
        在 {MedQA, MedMCQA} 上学一个软 prompt P

阶段 B:Instruction Prompt Tuning(本文重点)
  - 把人类评分反馈写进指令:
    "Answer as if you are a board-certified clinician.
     Include evidence and reasoning. Refuse to answer 
     if insufficient info."
  - 用 5-10 条专家示例 + 上述 instruction,做 few-shot 推理
  - 不更新模型权重,只调整 prompt 的形态与示例分布

关键点:IPU 不改参数。540B 模型权重冻结,只是把 "instruction + 5-10 个专家示例" 组合得更精细。这是 2023 年 PEFT 范式确立前的预演,后来 LoRA、QLoRA 的成功路径从这批工作能看到原型。

2.3 Ensemble Refinement

对自由回答(free-response,HealthSearchQA),用 多次采样 + 投票 + 改写 的 ensemble:

对每条问题:
  生成 N=16 个回答
  用 Chain-of-Thought + Self-Consistency(Wang 2022)投票
  选 majority 作为最终回答

这是把 LLM 推理不确定性"自我消化"的早期实践,后来 Med-PaLM 2(Nature 2023)、AlphaCode 都沿用同一思路。

3. 关键实验与数据

3.1 选择题 SOTA

数据集 Flan-PaLM 基线 Med-PaLM 提升
MedQA (USMLE) ~50% 67.6% +17%
MedMCQA ~45% 57.6% +12%
PubMedQA 79.0% 79.0% 持平
MMLU clinical ~70% 80%+ +10%

67.6% MedQA 是 2022 年 12 月的 SOTA——同期 GPT-3.5 在 MedQA 上大概 60% 量级,而 GPT-4(2023 年 3 月发布)紧随其后把 MedQA 推到 86%+。⚠️ 注意 Med-PaLM v1 论文里没直接 head-to-head 比 GPT-4,数字只是后人在 GPT-4 Technical Report 2023 里 back-compare 的结果。

3.2 人类评分四轴

找了 15 名临床医生(来自美国/英国/印度),对 200+ 条问答做 9 分制打分:

  • Factuality:Med-PaLM 答对的事实比例 ≈ 92.6%(对照医生答案 96.4%)
  • Comprehension:接近医生水平
  • Recall:接近医生水平
  • Harm / Bias:仍有显著差距,医生普遍拒绝答的"边缘问题",LLM 容易"圆回去"
  • Overall:Med-PaLM "encouraging but inferior to clinicians" —— 这是论文原话,没美化。

⚠️ 样本量自检:医生只有 15 人,每条回答 1-3 个评分者。这不是大样本,置信区间宽,2023 年的 follow-up 用 100+ 评分者才把方差压到 <3%

3.3 HealthSearchQA 真实查询

3,173 条 query,模型生成 vs 医生生成对比。核心发现:在 consumer-style 问题上,Med-PaLM 略低于医生(医生评分约 4.5/9 vs Med-PaLM 约 4.2/9),但 LLM 生成的内容重复率比医生低(说明多样性更好),在"long-tail 罕见问题"上有微弱优势。

4. 亮点与局限

4.1 亮点

  • 首个"人类评分 + 多个数据集"的医学 LLM 框架:这才是这篇论文真正留名的地方,不是 67.6%。
  • HealthSearchQA 消费端 query 数据集开源:在 Google Research GitHub 公开。
  • Instruction Prompt Tuning 的可解释性:论文展示了用 prompt 形态而非权重如何把对齐拉到医生水平。
  • 完整的 4 轴评分模板:后来的 Med-PaLM 2 / Claude-Medical / GPT-4 Medical 都参照这套评分轴。

4.2 局限与风险

  • MedQA 67.6% 是选择题,不是临床决策——真实世界"这病人是不是心梗"远比选择题难,论文自己也承认。
  • 15 名医生评分:样本量过小,统计效力有限。⚠️ 小样本评分 = "encouraging but inferior to clinicians" 这句话的边界条件
  • 没有外部验证数据集:模型在 Google 自家 split 上评,没在 Mayo / Cleveland Clinic 等外部医院系统独立测试。
  • OpenAlex 被引 261(单一来源,可能被低估):Google Scholar 口径通常 1000+,OpenAlex 单库聚合偏低。
  • 2026 年回看的局限:Agent + Tool-use 路径(MedAgents、Med-PaLM 2、清华 HuatuoGPT)已经能调外部药物 API、医学知识图谱,这篇 2022 年的"纯 prompt-tuning"路径已被超越。

5. 对工程落地的启发

  • 基线工程:做医学 LLM 项目,第一站就是 复现 MultiMedQA 评分脚本(Google 把 eval pipeline 开源了),然后跑 Llama-3 / Mistral / Qwen 系列,横向比较 4 轴评分。
  • 小样本对齐:Instruction Prompt Tuning 在 5-10 条专家示例上的效果,后来被 LoRA + 系统 prompt 部分取代,但 指令形态设计仍是 2025 年 prompt engineering 的核心
  • Human-in-the-Loop 评分:把 4 轴评分写进 CI/CD,每 1000 次推理抽 20 条让医生评分——这是把论文方法工程化的标准动作。
  • 不要迷信选择题正确率:67.6% USMLE 不等于"这模型能给病人看病"——论文反复强调的"harm / bias 仍有差距",在医疗监管(美国 FDA、欧盟 MDR、中国 NMPA)视角下是合规红线。

6. 与同方向工作的关系

  • 祖先:PubMedBERT 2021、BioGPT 2022、Clinical-T5——更早的医学专用 BERT/GPT,但规模小、只能用 BERT-class 输入。
  • 同期:GPT-3.5 MedQA 同期 ~50%,ChatGPT 2023 年 1 月发表 MedQA 60% 论文 —— Med-PaLM 是同一时代的"Google 答卷"。
  • 后续:Med-PaLM 2(Nature 2023,MedQA 86.5%)、清华 HuatuoGPT 2、上海 AI Lab OpenMEDLab、Anthropic Claude-Medical、Microsoft LLaVA-Med 都是同一坐标系。2024 年后 Agent + 工具调用 + 知识图谱(MedAgents、MedRAG)把这条线推到了新阶段。
  • 方法谱系:IPU 是 PEFT 的近亲,与 2023 年 LoRA(QLoRA)、prefix-tuning、prompt-tuning 一起构成 "大模型小成本适配" 的方法学。

7. 适合谁读

  • 做医疗 AI 产品 / 投融资:必须读 — 这是医学 LLM 的"开山论文 + 评估范式",所有后续融资 PPT 上的数字都从这套基准来。
  • 做 LLM alignment / RLHF 的工程师:IPU 是 prompt-only 对齐的代表,与 RLHF / DPO 形成对比。
  • 医学 + 计算机双背景的研究生:作为入门读物,比直接看 GPT-4 Technical Report 更聚焦医学。
  • 不适合:只关心 "PaLM 540B 怎么训练" 的 — 论文重心不在预训练,而在评估 + 对齐。

8. ⚠️ 不确定 / 边界自检

  • 67.6% MedQA vs GPT-4 86%:Med-PaLM v1 论文没 head-to-head 比 GPT-4,数字是后人回填的 — 引用时建议注明"2023 年 3 月 GPT-4 后回测"。
  • 15 名医生评分:样本量偏小,2023 年 follow-up 才扩大样本。
  • OpenAlex 261 被引:单库口径,Google Scholar 通常 1000+,引用时建议注明"OpenAlex 单库口径"。
  • IPU 的实际训练:Soft prompt 的训练步数与超参原文未完全公开,复现需依赖 Google 后续 release 的 checkpoint 与 train script。

工程落地与核查(Jay)

E1. MultiMedQA 评估流水线实战搭建

论文的 HealthSearchQA + MultiMedQA 评估框架在 2025-2026 年的实际复现路径:

# Step 1: 数据下载 (Google Research GitHub 公开)
git clone https://github.com/google/medpalm-research
cd medpalm-research/evaluation

# Step 2: MedQA / MedMCQA 评估 (HuggingFace 版本)
pip install datasets
python -c "from datasets import load_dataset; ds = load_dataset('medqa','usmle')"
# 4选项格式,需要写 prompt 包装器

# Step 3: HealthSearchQA 自由回答评分
# 原始 4 轴评分工具需要医生参与,但可以用 GPT-4o 做 proxy 评分
# ⚠️ Proxy 评分不等于临床评分,仅用于快速迭代

⚠️ 关键坑: - MedQA 4 选项格式在 2024 年后被多个数据集 fork 出不同版本(USMLE Step 1/2/3、BoardVitals、Amboss),引用数字时必须注明具体子集 - HealthSearchQA 的 3,173 条 query 中约 15% 包含非英语或医疗俚语,直接用英文模型评测会有约 5-8% 的 query 无意义

E2. IPU vs LoRA vs RLHF 的 2026 年工程选型

2022 年的 IPU(Soft Prompt Tuning)路径在 2025 年已被 LoRA / QLoRA 大规模取代,原因是:

方法 参数量 训练成本 医学场景适配效果 监管合规难度
IPU (2022) 0.1-1% (soft prompt) 中等 良(需大量人工设计 instruction) 低(不改权重)
LoRA (2023+) 0.5-5% (低秩矩阵) 优(医疗 QA 微调效果显著) 中(改权重需重新认证)
QLoRA (2023+) 0.5-2% (4-bit 量化) 极低 优(单卡可训 13B 模型)
RLHF/DPO (2024+) 全量 良(但 reward model 构建成本高) 高(对齐审计复杂)

工程建议: - 快速 MVP 阶段:LoRA + system prompt engineering,5-10 条专家示例起步 - 正式产品:RLHF/DPO + 临床医生红队测试,但监管备案周期 3-6 个月 - 不要用 IPU 做生产:Soft prompt 的 token 空间与模型推理引擎的兼容性差(HuggingFace PEFT 库对 soft prompt 支持有限),部署复杂度高

E3. 四轴评分的 CI/CD 工程化

论文的人类评分四轴(Factuality / Precision / Harm / Bias)在生产中的工程化路径:

# 每 1000 次推理后抽样 20 条,放入评分队列
SAMPLE_RATE = 20 / 1000  # 2%

def medical_response_audit(responses: list[dict]) -> dict:
    scores = {
        "factuality": [],  # 医生对照答案逐条核对
        "precision": [],   # 回答是否精确到剂量/禁忌/适应证
        "completeness": [], # 是否漏掉关键信息
        "harm_potential": [] # 是否有危害患者的风险
    }
    for r in responses:
        # 每条评分需要 1-2 名持牌医生,约 $50-150/条
        # 建议用 GPT-4o proxy 预筛,仅高风险 (harm_potential > 3) 才送人工
        ...
    return aggregate(scores)

成本估算: - 医生人工评分:约 $50-150 / 条(美国市场,2025 年行情) - GPT-4o proxy 初筛:约 $0.1 / 条,但 proxy 与临床评分相关性约 0.72(非完美替代) - 合规最低配置:每 1000 条推理,至少抽 5 条人工评分,harm_potential > 3 的直接送人工 100%

E4. 医疗 LLM 监管红线(FDA / MDR / NMPA)

Med-PaLM 的 harm / bias 差距在 2026 年仍是监管重点:

  • 美国 FDA (2024 AI/ML 导向 Software as Medical Device SaMD):
  • 医学问答 AI 若提出"治疗建议"可能被认定为 Class II 医疗设备,需 510(k) 认证
  • 2024-2025 年 FDA 已对多款"AI 医生"应用发出警告信(无证医疗建议)
  • 工程合规:产品侧加免责声明 + 不良反应上报机制,但产品定位只能做"健康信息"而非"诊断/处方建议"

  • 欧盟 MDR (EU 2017/745):

  • AI 驱动的医学问答若涉及诊断 → Class IIa/IIb,认证周期 6-18 个月
  • 2024 年 MDR 对 AI 应用的分类指南将"临床决策支持"列为高风险类别

  • 中国 NMPA:

  • AI 医疗软件需通过 NMPA 医疗器械注册(II/III 类)
  • 2024 年《人工智能医疗器械注册审查指导原则》明确:生成诊断建议的 AI 需临床试验数据
  • ⚠️ 实用信息:医疗 LLM 产品国内上市,合规路径比美国 FDA 更长,至少 12-24 个月

E5. 2022→2026 技术差距:Med-PaLM v1 的实际可用性

Med-PaLM v1 (2022) 的技术路径在 2026 年的实际状态:

维度 Med-PaLM v1 (2022) 2026 年实际水平 差距
MedQA 选择题 67.6% GPT-4o MedQA 91%+ 已落后
自由回答质量 4.2/9 (vs 医生 4.5/9) Claude-Medical / GPT-4o Medical 5-6/9 显著缩小但未超越
工具调用 MedRAG、药物 API 集成 2022 年无法实现
外部知识库 RAG + 医学知识图谱 2022 年无法实现
监管状态 研究原型 部分获 FDA 510(k) 已合规化

结论:Med-PaLM v1 的 IPU 路径在 2026 年已基本淘汰,但 四轴评分框架 + HealthSearchQA 数据集 仍是医疗 AI 评测的事实标准,所有后续工作(Med-PaLM 2、Claude-Medical)都在引用这套 schema。