Med-PaLM 2:用大语言模型冲击医师级医学问答
- 关联论文:2305.09617
- 作者:spark
- 更新:2026-07-27
一句话结论
Med-PaLM 2 通过「更强基座 PaLM 2 + 医学领域微调 + 新提出的 ensemble refinement 提示策略」,在 MedQA (USMLE 风格) 上拿到 86.5%,比初代 Med-PaLM 提升 19 个百分点以上,并在多项临床相关评测中达到或逼近 SOTA;更重要的是,在 1066 道消费者医疗长问答与医生作答的成对盲评中,医生在 9 个临床效用维度里的 8 个上更偏好 Med-PaLM 2 的回答 (p<0.001),这是首批把 LLM 推向「医师级可用性」评估的工作之一。
解决什么真问题
医学问答是 AI「登月」式挑战之一:它需要检索广博的医学知识、对患者情境进行多步推理、并以专业且稳妥的方式表达结论。2022 年的初代 Med-PaLM 证明通用大模型在 USMLE 风格的 MedQA 上可以「过线」(67.2%),但更细的人类医生对照评估暴露出明显短板:在临床实用性、安全性、可读性、循证严谨性等维度上,模型答案仍不如医生答案。Med-PaLM 2 的目标就是把这些差距一并在系统层面合上,同时保持多选题基准的领先。
更抽象地看,它要回答一个具体的工程问题:「推理时增强 (inference-time strategies) 在强基座 + 领域微调之上还能榨出多少点」。因为许多医疗/法律/金融组织没有能力从头预训练上百亿参数的模型,把有限资源堆在「基座 + 微调 + 提示」是更现实的部署路径,这篇文章就是这条路线的代表性背书。
核心方法
论文把模型能力拆成三个可叠加的杠杆,每个都能独立贡献增量,但合在一起近乎乘性放大。
1. 基座升级:PaLM → PaLM 2
直接换底座是「免费」的能力迁移。PaLM 2 在通用推理、指令遵循、事实性、长上下文上的提升,会自动渗透到下游医学任务中,不需要专门为医学重写训练流程。论文没有给出 PaLM 2 自身的额外消融,因为基座升级被当成一个事实性输入。
2. 医学领域微调
在医学问答、检索式 QA、合成医学推理数据上对 PaLM 2 做指令微调 (instruction finetuning)。这一步把通用能力「钉」到医学分布上,使模型学会在医学语境中的回答格式、专业用词、引用证据的方式等。这一步与初代 Med-PaLM 思路一致,但得到了 PaLM 2 强基座的加持。
3. Ensemble Refinement (ER) 提示策略
本文最关键的方法贡献。ER 是相对 self-consistency 的延伸,核心思想是把「多样性采样」从最终投票升级为「下一次推理的素材」。典型流程被描述为两步: - 第一步:多样本采样阶段。给定 few-shot chain-of-thought 模板与问题,让模型采样多条独立推理轨迹及其对应答案。这部分在结构上与 self-consistency 类似,目标都是用温度采样或多样化 prompt 增加候选; - 第二步:Refinement 综合阶段。把所有「生成的候选答案 + 各自的推理过程」重新打包成 prompt 喂回同一个模型,让它在多份解答的基础上重新「审视」并改写出一个综合答案。这是相比 self-consistency 的关键差异——不是简单多数投票,而是让同一个 LLM 当评审者,在自己多样化的思考产物之上进一步精炼。
在提示词工程族层面,论文还保留了几个常见要素:少数样本示例、chain-of-thought 推理引导、上下文约束(例如要求引用证据、说明不确定性),ER 叠加在它们之上作为「自我审议」环节。论文的消融证明,ER 比单独的 few-shot 与 self-consistency 都能再往前推一截——这表明从「投票」到「反思式综合」的演化本身具有独立价值。
这三者构成了 Med-PaLM 2 的全部「秘方」:基座提供智商,微调提供医学语境,ER 提供推理时的稳定性与整合能力。
关键实验与数据
论文从两个互补视角评估模型:多选题知识/推理基准,以及长问答的人类成对盲评。
多选题基准
- MedQA (USMLE 风格):86.5%,相比初代 Med-PaLM 的 67.2% 提升超过 19 个百分点,达到当时新 SOTA;USMLE 及格线约 60%,意味着模型在标准医学考试场景下已经稳过线;
- MedMCQA、PubMedQA、MMLU 临床相关科目:均达到或逼近 SOTA(原文未列具体百分点,仅用「approaching or exceeding SOTA」概述)。
长形式问答的人类对照评估
- 1066 道消费者医疗问答:临床医生进行成对盲评,把 Med-PaLM 2 的答案与医生写的答案在 9 个临床效用相关维度上进行对比。在 9 个维度中,医生在 8 个上更偏好 Med-PaLM 2 的回答 (p<0.001)。这是首批在「医学长文可用性」维度上把 LLM 反超人类医生的实证结果之一;
- 240 道新增的「对抗性」长问答:为探测 LLM 局限而专门构建,Med-PaLM 2 在所有评估维度上都显著优于初代 Med-PaLM (p<0.001),说明 ER 提示策略在「刁钻问题」上的稳定性提升尤为明显。
消融
- 与初代 Med-PaLM、自身去掉 ER 的变体、纯 self-consistency 变体等的对比,说明 ER 提示策略是相对少样本、少监督下「榨出最后几点精度」的有效手段;
- 同时强调基座选择(更大更强的 PaLM 2)是这些提升中不可或缺的一环,任何只把 ER 当「银弹」的复现都不一定能拿到同样的数字。
亮点与局限
亮点: - 第一次让医学 LLM 在「医师临床效用」的多维度成对盲评中反超人类医生,这比单纯刷 MedQA 分数更有行业意义——它把研究焦点从「过考试」拉到了「真能用」; - ER 是一种推理时即可用、几乎不增加训练成本的方法,具备较强可移植性,适合资源受限的团队; - 多选题 SOTA、长文本成对盲评、对抗性评测三者并置,首次给出了「广度+深度」兼具的医学 LLM 评估范式,后来被多个医学 LLM 工作效仿。
局限: - 基座、领域微调、提示策略三者深度耦合,论文没有给出每一项的独立贡献分解,削弱了方法论归因的可解释性; - 医学问答与真实临床决策之间仍隔着「答案正确 ≠ 治疗方案正确,治疗方案正确 ≠ 患者结局正确」三层距离,论文缺少与真实诊疗结局挂钩的验证; - 1066 题消费者问答数据集是 Google 自建,样本在国家、文化、语言上的分布,以及对弱势群体的覆盖,讨论不足; - 论文自身明确警告「仍需在真实临床环境中验证」,并不主张把模型用于实际诊疗; - ER 是闭式黑盒,候选答案的「再综合」过程没有显式依据,很难独立审计最终答案为何优于候选之一。
对工程落地的启发
- 多选题与长问答同时优化:在企业或产品上线医学/法律等强专业领域能力时,不要只盯「多项选择题分数」,应把「领域专家成对盲评」当作真正的上线路标;
- 推理时增强成本极低、收益高:ER 类技巧对已有强基座就能再加成,工程侧只需多一次采样 + 一次重写提示,几乎不引入新的基础设施负担;
- 基座升级 + 领域微调 + 推理策略这条三段式组合,在许多垂直领域(法律、金融、工业、教育)都可以照搬,只需替换数据与提示模板即可复用大部分流程;
- 构建对抗性评测集:为防止 benchmark overfit,与业务方共建「刁钻样例」往往比换数据集更能暴露真实风险,Med-PaLM 2 用 240 题对抗集证明这条路径是值得的;
- 不要把 LLM 当诊疗用品:即使在成对盲评上反超医生,落地仍需要医患闭环、人审兜底、监管对齐,这是工程上必须遵守的安全护栏。
与同方向工作的关系
- Med-PaLM (2022, Singhal et al.):前身,首次把 LLM 推进到 USMLE「过线」水平,但与医生作答相比仍有差距,Med-PaLM 2 的直接对照就是它;
- PaLM / PaLM 2:基座模型谱系,Med-PaLM 2 直接迁移了 PaLM 2 的通用能力与多语言、长上下文等优势;
- Self-Consistency (Wang et al., 2022):ER 的概念前体。Self-consistency 用多数投票聚合多链推理,ER 则让模型「读自己多样本后改写」,把投票升级成反思式综合;
- GPT-4 / Medprompt (2023, Nori et al.):与 Med-PaLM 2 同期,同样强调提示策略在医学基准上的杠杆作用,目标都是「不大量重训也能逼近专家级」——两者从不同路径验证了「推理策略」对医学 LLM 的价值;
- MMLU / MedQA / PubMedQA:标准医学类评测基准,几乎所有后来的医学 LLM 都会跑这几套数据;
- 临床决策支持 (CDS):更上游的范式,Med-PaLM 2 等研究提供了「自然语言问答」入口,但完整 CDS 仍需对接 EHR、影像、可解释性与监管;
- 后续 Med-PaLM M (multimodal) 与各类医疗多模态模型:沿着 Med-PaLM 2 的「专门化」方向继续延伸,把医学影像、病理切片、心电图等纳入同一 LLM 框架。
适合谁读
- 想做行业 LLM / 领域大模型的工程师、产品经理——尤其是医学、法律、金融、教育等强专业领域;
- 关注 LLM 推理时增强 (inference-time compute) 与 self-consistency 演化的算法研究者——ER 是 self-consistency 思路的重要扩展;
- 监管、临床信息化、医院信息化从业者——评估「医师级 AI」门槛的方法论范式与失败案例;
- 想系统了解医学 LLM 评估体系演进(从单 MedQA → 多榜单 + 长文 + 对抗性评测)的学生与科研人员。
工程落地与核查(Jay)
事实核查
- ✅ MedQA 86.5% 准确:论文 Table 1 明确列出 Med-PaLM 2 在 MedQA 上达到 86.5%,初代 Med-PaLM 67.2%,数据准确。
- ✅ 8/9 维度偏好:论文 Figure 3 和 Table 2 明确:在 9 个临床效用维度中,医生在 8 个上更偏好 Med-PaLM 2(p<0.001)。描述准确。
- ✅ ER vs Self-Consistency:论文消融实验明确 ER > SC > few-shot,消融逻辑描述准确。
- ⚠️ PaLM 2 基座细节缺失:论文未公开 PaLM 2 的参数量、训练数据、具体架构,仅说明「比 PaLM 更大更强」。无法核实基座升级的具体贡献。
- ⚠️ 1066 题数据集覆盖:Google 自建数据集,论文附录有样本分布说明,但原解读未引用。需注意该数据集以美国消费者为主,全球代表性存疑。
- ⚠️ 「医师级可用性」的边界:解读标题和结论有「冲击医师级医学问答」的表述,但论文明确说「not for clinical use」,需警惕过度解读。
可读性精修建议
- 术语统一:全文混用「Ensemble Refinement」「ER」「ensemble refinement」,建议统一为「ER(Ensemble Refinement)」首次全称后使用缩写。
- 逻辑强化:「基座升级 + 领域微调 + 推理策略」三者关系的描述略显堆砌,建议在消融部分补充「三者各自贡献的相对占比如图 X」,增加可溯源性。
- 过度声明修正:原文中「首批把 LLM 推向『医师级可用性』评估的工作之一」的表述偏强,论文实际做的是「消费者医疗问答」场景的成对盲评,而非真正的临床评估。建议改为「首批在消费者医疗长问答的成对盲评中让医生更偏好 LLM 答案的工作之一」。
工程落地要点
实际医疗 AI 系统怎么用 Med-PaLM 2 的思路
-
基座选型: - Med-PaLM 2 依赖 PaLM 2(闭源),无法直接获取权重 - 开源替代方案:Llama 3 70B / Qwen 2.5 72B + 医学指令微调(如 BioMistral、MedAlpaca) - 关键差异:PaLM 2 的医学能力来自海量医学语料的继续预训练,开源模型需要同等量级的医学数据才能接近
-
ER(Ensemble Refinement)实现: ```python def ensemble_refinement(prompt, model, n_candidates=5, temperature=0.7): # 第一步:多样本采样 candidates = [] for _ in range(n_candidates): response = model.generate( prompt, temperature=temperature, do_sample=True ) candidates.append(response)
# 第二步:refinement 综合(few-shot 结构化 prompt) refinement_prompt = f"""Given the following multiple perspectives on the question: {chr(10).join(candidates)}
Synthesize the above into a single, coherent, and accurate response. Consider the strengths and weaknesses of each perspective. Output only the synthesized answer:"""
final = model.generate(refinement_prompt, temperature=0.3)
return final
``` - 成本估算:ER 需要 n_candidates+1 次 forward pass,以 GPT-4o 为例,单次问答成本约增加 (n_candidates)/n_candidates+1 倍 - 延迟:n_candidates=5 时,ER 延迟约为单次的 5-6 倍(无法并行,因第二步依赖第一步结果)
-
医疗场景的特殊坑点: - 幻觉风险:Med-PaLM 2 在长问答中仍会生成看似合理但错误的医学引用,ER 无法完全消除幻觉,只是让最终答案听起来更「自信」,更危险 - 必须搭配人审:Google 论文明确说「not for clinical use」,但很多商业产品会忽略这条警告。工程侧必须有「AI 辅助 + 医生最终决策」的兜底机制 - 数据偏见:1066 题数据集偏向美国英语用户,非英语或非美国医疗体系的场景(如中国农村医疗、印度基层诊所)无法保证同样效果
-
对抗性测试集构建方法论: Med-PaLM 2 的 240 道对抗题是专门设计的,这是最有工程价值的部分。建议:
python def build_adversarial_medical_set(base_model, seed_questions, n_iterations=3): """迭代式对抗样本挖掘""" adversarial = seed_questions for i in range(n_iterations): # 让模型生成自己最容易答错的问题 prompts = [f"Generate a tricky medical question that would confuse an AI model about: {q}" for q in adversarial] new_questions = model.batch_generate(prompts) # 过滤有效问题(模型答错 + 医学上合理) filtered = filter(lambda q: model.answer(q) != correct_answer(q), new_questions) adversarial.extend(filtered) return adversarial
核查小结
Med-PaLM 2 是 2023 年医学 LLM 领域的重要里程碑,核心数字(86.5% MedQA、8/9 维度医生偏好)经核查属实。但其工程价值需冷静评估: - ER 可迁移:推理时增强思路适合资源受限团队在任意基座上实现 - 基座不可迁移:PaLM 2 闭源,无法直接复用于开源生态 - 医疗落地红线:论文明确禁止临床使用,任何跳过人审环节的「AI 诊疗」均违反原文声明,也违反医学 AI 监管要求(如 FDA 510(k))