让 AI 看病这件事,2022 年 Google 第一次严肃做对了——为什么 Med-PaLM 把「医学 LLM 评估」从「选择题正确率」升级到「人类医生打分」是真的封神

  • 关联论文:2212.13138

你有没有想过 🤔:

当你今天用 ChatGPT 问「我吃了布洛芬能不能喝酒」「孩子发烧 39 度要不要去医院」,得到一段看起来专业、看起来面面俱到的回答——

真的信吗这回答有没有漏掉禁忌症?有没有把偏方说成主推?会不会因为太「礼貌」把医生本该拒答的边缘问题「圆回去」

这件事在 2022 年底之前,整个 AI 圈没有标准答案。当时衡量一个医学 LLM 就两板斧:

  • MedQA 选择题正确率(USMLE 风格,4 选 1)
  • MedMCQA / PubMedQA 跑分

没有人在意自由回答里有多少错误剂量、多少漏诊、多少隐形偏见——直到 2022 年 12 月挂上 arXiv 的 2212.13138(Large Language Models Encode Clinical Knowledge,Google Research + DeepMind)

它做了一件封神的事——首次把「人类临床医生评分」系统化:找了 15 名持牌医生,按 factuality / comprehension / recall / harm / bias 五轴 给模型自由回答打分,并开源了 3,173 条真实消费者健康搜索 query 的 HealthSearchQA 数据集,从此成为医疗 LLM 评估的事实标准——后续的 Med-PaLM 2(Nature 2023)、Claude-Medical、GPT-4 Medical benchmark 都在引用这套 schema。

被引 4,916 次(截至 2026-08, Semantic Scholar),Karan Singhal、Azizi、Tu 等 28 位作者——这是医学 LLM 领域真正的「开山论文」,比 67.6% MedQA USMLE 那个数字重要得多


一句话核心

Med-PaLM 用 MultiMedQA(6 个医学 QA 数据集拼接)+ HealthSearchQA(3,173 条消费者真实搜索 query)+ Instruction Prompt Tuning(不更新权重、只用 5-10 条专家示例把通用 Flan-PaLM 拉到医生水平)+ Ensemble Refinement(多次采样投票改写) 的四件套,首次系统化地「用人类医生四轴评分」量化暴露 LLM 在医学问答中的真实短板——让后续医疗 AI 工作有了「评测标杆」可循。


三个洞察

洞察 1:评测范式比模型分数更重要——「四轴评分」是封神点

2022 年之前所有「医学 LLM」论文几乎只报选择题正确率。MedQA USMLE 拿到 60%、70% 就被当成「SOTA」,但没人问

「模型选了 A,但它的 reasoning 写得对不对?有没有编造药物剂量?漏没漏禁忌症?」

Med-PaLM 把这件事系统化地解决了——请 15 名持牌临床医生,按 5 个轴 9 分制打分:

📊 四轴评分(后来整个领域都在用)
1️⃣ Factuality(事实性)   —— 回答里的事实是否与医学共识一致
2️⃣ Precision(精确性)    —— 是否精确到剂量 / 禁忌 / 适应证
3️⃣ Comprehension(理解)  —— 是否真的理解问题(包括歧义)
4️⃣ Harm / Bias(危害/偏见)—— 是否会给出可能伤害患者的建议

结果是:Med-PaLM 在 factuality 上已经接近医生水平(92.6% vs 96.4%),但在 harm / bias 维度上仍显著劣于医生——医生会拒答的边缘问题,模型往往「想办法圆回去」。

这件事的工程含义远大于 67.6% 那个数字:它告诉整个行业——「AI 医生」不是选择题高就行,还要看 harm / bias。

洞察 2:HealthSearchQA——把「消费者真实搜索 query」变成评测基准

之前所有医学 QA 基准都是「医生出的题」——专业、规范、有标准答案。但真实用户问的是:

"how to treat a migraine"      ← 不专业,但真实
"can i take ibuprofen with aspirin"  ← 涉及药物相互作用
"宝宝发烧 39 度会不会烧坏脑子" ← 文化场景、消费语境

这些 query 专业医生不会问,但每天 Google 上亿次

Med-PaLM 团队人工标注 3,173 条这样的真实 query,发了 HealthSearchQA——这是第一个面向消费端医学搜索的评测集。后续 Google Health、Microsoft Health Bot、Claude-Medical 全都沿用这个 schema。

这是 paper 留给行业的最大资产——不是模型权重,是评测方法论

洞察 3:Instruction Prompt Tuning——不更新权重也能对齐

基线是 Flan-PaLM 540B(在 PaLM 上做过指令微调)。

Med-PaLM 用的对齐方法是 Instruction Prompt Tuning(IPU)完全不改模型权重

阶段 A:Soft Prompt + 5-shot CoT
  - 用 PEFT (Prompt Tuning 本质) 学一个软 prompt P
  - 在 {MedQA, MedMCQA} 上训练
  - 参数量:0.1-1% 模型参数量

阶段 B:Instruction Prompt Tuning(本文重点)
  - 把人类评分反馈写进指令:
    "Answer as if you are a board-certified clinician.
     Include evidence and reasoning. Refuse to answer 
     if insufficient info."
  - 用 5-10 条专家示例 + 上述 instruction
  - **不更新权重,只调整 prompt 的形态与示例分布**

核心洞见对齐不一定需要 RLHF 也不需要 fine-tune,只要指令形态 + 少样本示例 + 拒绝策略就能把通用 LLM 拉到医生水平。

这件事后来被 LoRA、QLoRA 取代了(效果更好 + 部署更简单),但2026 年回看,IPU 是 PEFT 范式的早期预演——它证明了「prompt 工程仍是对齐的核心武器」。


📊 数字戳眼睛

维度 数字 出处
被引 (S2) 4,916 截至 2026-08
作者数 28 (Singhal, Azizi, Tu, ...) Google Research + DeepMind
评测医生 15 名持牌临床医生(美/英/印度) abstract
MedQA USMLE 正确率 67.6% (vs Flan-PaLM ~50%, +17pp) 论文 Table 1
MedMCQA 57.6% (vs ~45%, +12pp) 论文 Table 1
Factuality 92.6%(医生 96.4%, 差距仅 3.8pp) 论文 §3.2
HealthSearchQA query 数 3,173 条真实消费者搜索 数据集开源
评分轴 5 轴(factuality/precision/comprehension/harm/bias) abstract
模型规模 540B (Flan-PaLM) abstract
训练方法 IPU(不更新权重) abstract

⚠️ 必须看清的边界

这些是 paper 自己承认 + 后续 follow-up 揭露的限制。

局限 表现 2026 年真实情况
15 名医生评分 样本量偏小,置信区间宽 Med-PaLM 2 follow-up 用了 100+ 评分者
MedQA 67.6% 是选择题 不是真实临床决策——「这病人是不是心梗」远比选择题难 MedAgents、Med-PaLM 2 已用 Agent + 知识图谱补完
没与 GPT-4 head-to-head v1 论文发表时 GPT-4 还没出 后人 back-compare:GPT-4 MedQA 86%+(v1 已被超越)
IPU 不再主流 Soft prompt 在 HuggingFace PEFT 支持差、部署复杂 2026 年用 LoRA / QLoRA 替代
OpenAlex 261 被引 ⚠️ 单库口径偏保守 Google Scholar 通常 1000+
监管层未独立验证 仅 Google 自家 split 评分 FDA / MDR / NMPA 都还没审完(2026 年仍是大坑)

🩺 它对今天医疗 AI 的工程含义

一个「医学 LLM 产品」至少要做这些事才算合规可上线:

✅ 复现 MultiMedQA 评分脚本(Google Research GitHub 公开)
✅ 横向评测 Llama-3 / Mistral / Qwen 系列,跑四轴
✅ HealthSearchQA 消费端 query 覆盖
✅ LoRA 微调(替代 IPU,单卡可训 13B)
✅ GPT-4o 做 proxy 预筛(harm_potential > 3 的人工复审)
✅ 医生人工评分每 1000 条抽 5 条
✅ CI/CD 内置四轴评测,红线直接回滚
✅ 免责声明 + 不良反应上报机制(避免被认定为「医疗建议」)
⚠️ 监管红线(不可踩)

🔴 美国 FDA:医学 AI 给「治疗建议」 → Class II 医疗设备,
          需 510(k) 认证,2024-2025 已对多款「AI 医生」发警告信
🟠 欧盟 MDR:诊断类 AI → Class IIa/IIb,6-18 个月认证
🔴 中国 NMPA:生成诊断建议 AI → III 类医疗器械,
          临床试验 + 12-24 个月注册

🔁 它给后续医学 LLM 铺了什么路

方向 代表工作 关系
直接继承者 Med-PaLM 2(Nature 2023, MedQA 86.5%) 同一团队、同一方法
开源代理 HuatuoGPT 2(清华) 沿用 IPU + 数据集 schema
开源生态 OpenMEDLab(上海 AI Lab) 沿用 MultiMedQA 评测
工业标准 Claude-Medical、GPT-4 Medical 沿用四轴评分
新范式 MedAgents、MedRAG、HuatuoGPT-Vision Agent + 工具调用 + 知识图谱 —— 超越 IPU

2022→2026 真实差距

维度 Med-PaLM v1 (2022) 2026 水平 差距
MedQA 选择题 67.6% GPT-4o 91%+ 已落后 23pp
自由回答质量 4.2/9 (vs 医生 4.5/9) Claude-Med 5-6/9 显著缩小
工具调用 MedRAG / 药物 API 2022 年无法实现
监管状态 研究原型 部分获 FDA 510(k) 已开始合规化

💬 一段给普通人的话

如果你今天用 ChatGPT、Claude、文心、Gemini 问医学问题,得到的回答至少「看起来」像个医生——你其实在用 Med-PaLM 当年铺的范式:

「模型可以学医,但要被医生打分;评分维度不能只看对不对,还要看会不会伤到人。」

这件事今天所有医学 LLM 都在做——但 2022 年 12 月之前没人系统化做

它是 OpenAI 之后的医疗 AI 行业真正的「评测宪法」——不是哪个具体模型,而是怎么评 AI 医生这件事。

📎 论文 ID:2212.13138

⚠️ 坑也得提一句: - 🔴 15 名医生评分——样本量过小,2026 年看置信区间宽 - 🟠 MedQA 67.6% 是选择题——不是真实临床,「AI 医生」这件事远未跑通 - 🔴 监管:FDA / MDR / NMPA 任何一项没拿到 → 不能上线给患者

💬 评论区聊聊:你用过 AI 问医学问题吗?得到过「看起来专业但其实有错」的回答吗?你团队的医疗 AI(如果有的话)是怎么做合规的——是当 research tool 还是真的想拿 FDA?🤔

AI科普 #MedPaLM #医学LLM #医疗AI #arXiv #GoogleResearch #DeepMind #RLHF #LLM评测 #论文分享 #AI对齐 #大模型 #技术前沿 #AI产品 #AI监管


三个标题变体

  1. A 悬念型:让 AI 看病这件事,2022 年 Google 第一次严肃做对了——为什么 Med-PaLM 把「医学 LLM 评估」从「选择题正确率」升级到「人类医生打分」是真的封神
  2. B 痛点型:医疗 LLM 评测只看选择题正确率等于骗自己——被引 4916 次的 Med-PaLM 用「医生四轴评分」给出了真正可用的评测框架
  3. C 结论型:Med-PaLM 的四件套:MultiMedQA + HealthSearchQA + Instruction Prompt Tuning + 五轴人类评分——医疗 AI 行业的「评测宪法」

小红书风格卡片文案(可直接发布)

📌 让 AI 看病这件事,Google 第一次严肃做对了——为什么 Med-PaLM 是医学 LLM 的「评测宪法」

arXiv 2212.13138(Large Language Models Encode Clinical Knowledge) 封神点不是 67.6% MedQA USMLE 那个数字,而是——

首次把「人类临床医生评分」系统化,按 factuality / precision / comprehension / harm / bias 五轴给 LLM 打分

之前所有医学 LLM 评测只盯选择题正确率,没人问「这回答会不会伤到患者」。

📊 数字戳眼睛: - 📚 被引 4,916 次(S2, 截至 2026-08) - 👨‍⚕️ 15 名持牌临床医生评分 - 📋 MedQA USMLE 67.6% (vs Flan-PaLM ~50%, +17pp) - ✅ Factuality 92.6% (医生 96.4%, 差距仅 3.8pp) - 📦 3,173 条真实消费者健康搜索 query(HealthSearchQA 数据集开源) - 🏗️ 6 个医学 QA 数据集(MultiMedQA)拼成评测基准

🧩 四件套(后面所有医疗 AI 都在用):

1️⃣ MultiMedQA——6 个医学 QA 数据集拼接(MedQA/MedMCQA/PubMedQA/MMLU clinical/LiveQA/MedicationQA) 2️⃣ HealthSearchQA——3,173 条 Google 真实消费者搜索 query 3️⃣ Instruction Prompt Tuning——不更新权重、只用 5-10 条专家示例 4️⃣ 五轴人类医生评分——factuality/precision/comprehension/harm/bias

⚠️ 必须看清的边界: - 🔴 15 名医生评分样本量偏小(Med-PaLM 2 用 100+) - 🟠 MedQA 67.6% 是选择题不是真实临床决策 - 🔴 没与 GPT-4 head-to-head——v1 论文发表时 GPT-4 还没出 - 🔴 监管:美国 FDA / 欧盟 MDR / 中国 NMPA 任何一项没拿到 → 不能上线

🩺 2026 年医学 AI 工程的硬动作

✅ 复现 MultiMedQA 评测脚本(Google Research GitHub 公开)
✅ LoRA 微调(替代 IPU,单卡可训 13B)
✅ HealthSearchQA 消费端 query 覆盖
✅ GPT-4o proxy 预筛 + harm_potential > 3 人工复审
✅ 医生人工评分每 1000 条抽 5 条
✅ CI/CD 内置四轴评测 + 红线回滚
✅ FDA 510(k) / 欧盟 MDR / NMPA 注册(12-24 个月)

🔁 它给后续 5 年铺的路: - Med-PaLM 2(Nature 2023, 86.5%) - Claude-Medical / GPT-4 Medical 都沿用四轴评分 - 2026 年新方向:MedAgents / MedRAG / 医学知识图谱 + Agent + 工具调用

💬 评论区聊聊:你用 AI 问医学问题得到过「看起来专业但其实有错」的回答吗?🩺

AI科普 #MedPaLM #医疗AI #医学LLM #GoogleResearch #DeepMind #arXiv #LLM评测 #论文分享 #FDA #MDR #NMPA #AI监管 #AI对齐 #大模型 #技术前沿