AI 医生能不能看病?2023 年这篇论文让医生在 8/9 个维度上更偏好 AI 答案
- 关联论文:2305.09617
你有没有想过这种问题:
网上搜症状,搜出来的医疗信息要么是广告,要么是莆田系。 ChatGPT 写出来的医学回答看起来很专业,但你能信吗? 2023 年 5 月 Google 发的这篇 Med-PaLM 2 论文,是第一次让医生在成对盲评中系统地更偏好 AI 答案——但它真的能替代医生看病吗?
直接说结论:能打辅助,不能看病。
这篇论文到底干了什么
Google 的 Med-PaLM 2 团队做了一件非常"工程"的事:
基座升级:从第一代 Med-PaLM 用的 PaLM,换到更大的 PaLM 2(闭源基座)。
领域微调:在医学问答、医学检索、合成医学推理数据上对 PaLM 2 做指令微调。
推理时增强(最关键的创新):Ensemble Refinement(ER)——让模型先自己"想" 5 次,每次都给出独立推理路径 + 答案;然后把所有 5 个答案 + 推理过程一起塞回同一个模型,让它"反思"并写出一个综合答案。
不是简单多数投票,是让同一个 LLM 当自己的评审员。
效果有多炸
多选题基准:
- MedQA(美国医师执照考试 USMLE 风格):86.5%——USMLE 及格线是 60%,意味着模型已经稳过线。
- 对比初代 Med-PaLM 的 67.2%,提升 19 个百分点以上。
真正关键的是第二组实验——1066 道消费者医疗长问答的成对盲评:
Google 找了临床医生,对每道题对比"AI 的答案" vs"医生的答案",在 9 个临床效用维度(准确性、安全性、可读性、循证严谨性、临床实用性等)上做成对偏好选择。
结果:9 个维度中,医生在 8 个维度上更偏好 Med-PaLM 2 的回答(p<0.001)。
这是首批在"医学长文可用性"维度上让医生系统性地更偏好 LLM 答案的工作之一。
ER 这个技巧为什么值钱
传统 Self-Consistency 是让模型想 5 次然后"投票"——哪个答案出现次数最多就选哪个。
ER 是升级版——把 5 个答案连同推理过程都喂回模型,让它"看着自己多样化的思考产物"重新写一个综合答案。
直觉:让 AI 当自己的"红队"——先发散再收敛,比单纯投票更稳。
工程上几乎零额外训练成本——你只需要多写一段 few-shot prompt 让模型做反思总结。所有已有的强基座都能叠加这个技巧。
成本代价:单次问答需要 5-6 次 forward pass(5 次采样 + 1 次综合),延迟和费用都约增加 5-6 倍。
关键警告:这是消费者问答,不是临床决策
论文和官方声明里反复强调:"not for clinical use"。
为什么?三层距离:
- 答案正确 ≠ 治疗方案正确——AI 可能答对"这个症状对应什么病",但推荐的治疗方案可能不是最优解。
- 治疗方案正确 ≠ 患者结局正确——同样的病在不同人身上要不同处理,AI 看不到病人的病史、生活习惯、家庭支持。
- 没有医患闭环——真正的诊疗是医患之间的信任建立、动态调整、情绪支持,AI 只是工具。
更细的隐患:
- 幻觉问题更危险:ER 让最终答案听起来更"自信"、更"流畅",但底层事实可能仍然有错。在医学场景,"自信地说错"比"犹豫着说对"危险得多。
- 数据偏见:1066 题数据集是 Google 自建,以美国英语用户为主。在中国农村、印度基层诊所、拉美贫民窟的医疗场景,效果完全无法保证。
- 基座依赖:PaLM 2 是闭源的,国内团队没法直接用。开源替代(Llama 3 70B、Qwen 2.5 72B + 医学指令微调)效果差不少。
工程落地怎么用这篇论文的思路
可迁移的部分:
- ER 提示策略:任何强基座 + 几乎零成本就能叠加。代码实现就是两段 prompt + 5-6 次 forward pass。
- 多维度成对盲评:不要只盯"多选题分数",把"领域专家成对盲评"当作真正的上线路标——这比 benchmark 分数更接近真实可用性。
- 对抗性测试集:与业务方共建"刁钻样例"往往比换数据集更能暴露真实风险。
不可迁移的部分:
- PaLM 2 基座本身:闭源,无法直接复用。
- 86.5% MedQA 数字:不同基座 + 不同微调数据 + 不同评测协议,数字会大幅变化。
- "医生偏好"的结论:依赖 Google 自建的 1066 题数据集,换数据集这个结论可能反转。
医疗场景的工程红线:
- 必须有"AI 辅助 + 医生最终决策"的兜底机制——任何跳过医生直接给患者诊疗建议的产品都违反论文原文声明,也违反 FDA 510(k) 等监管要求。
- 必须有幻觉检测 + 不确定性提示——AI 应该明确说"我不确定",而不是用流畅的语气胡编。
- 必须有人审兜底——尤其是罕见病、危重症、儿童、孕妇等高风险场景。
这篇论文真正教会我们的事
不是"AI 能看病"——这是过度解读,论文明确否认。
是"LLM 在垂直专业领域(医学 / 法律 / 金融 / 工程)可以逼近专家级辅助水平"——只要三件事做到位:
- 强基座(通用能力不能差)
- 领域微调(把通用能力钉到领域分布上)
- 推理时增强(用 ER / self-consistency / 多链推理等技巧榨出最后几点精度)
这三段式组合在几乎所有"垂直领域 LLM"产品里都能复用——法律咨询、金融研报、工业故障诊断、教育辅导——只是数据、提示模板、合规要求不一样。
一句话给老板
"2023 年 Google 的 Med-PaLM 2 论文证明了:LLM 在医学长问答上可以逼近医生辅助水平(86.5% MedQA + 医生 8/9 维度偏好)。但这不是 AI 诊疗,是 AI 辅助 + 医生最终决策的工程范式。ER 提示策略几乎零成本可迁移,基座(PaLM 2)不可迁移。任何跳过医生直接给患者诊疗建议的产品都违反论文原文声明。"
三个标题变体
- "AI 医生能不能看病?Google 2023 年的这篇论文给出了最严谨的答案——能打辅助,不能看病"
- "医学 LLM 的分水岭:86.5% MedQA 分数 + 8/9 维度医生偏好,但论文明令禁止临床使用"
- "为什么你的 AI 医疗产品不能直接落地?Med-PaLM 2 的三层距离警告"
📱 小红书风格卡片文案
📚 今天被 Google 2023 年的这篇论文震到了
它干了件非常工程的事:
基座:用更大的 PaLM 2 替换第一代的 PaLM 微调:在医学问答、医学检索数据上做指令微调 推理技巧(关键创新):让模型自己"想 5 次",然后让同一个模型当自己的评审员,看着 5 个答案反思并写出一个综合答案——这叫 Ensemble Refinement (ER)
效果有多炸: - 美国医师执照考试风格 MedQA:86.5%(及格线 60%) - 1066 道消费者医疗长问答:医生在 9 个临床效用维度中的 8 个维度上更偏好 AI 答案(p<0.001)
但—— 论文和 Google 官方反复强调:not for clinical use(不允许临床使用)
为什么?因为三层距离: 1. 答案正确 ≠ 治疗方案正确 2. 治疗方案正确 ≠ 患者结局正确 3. 没有医患闭环(信任、动态调整、情绪支持)
真正的工程价值: - ✅ ER 技巧几乎零成本可迁移(任何强基座都能叠加) - ✅ "基座 + 微调 + 推理时增强"三段式可复用所有垂直领域 - ❌ PaLM 2 基座闭源不可复用 - ❌ 不能跳过医生直接给患者诊疗(违反 FDA 等监管)
📎 arXiv 2305.09617 · Google Research · 2023-05
#AI科普 #医疗AI #LLM #MedPaLM #GoogleAI #推理时增强 #AI安全 #医学 #论文分享
📎 arXiv 2305.09617 · 2023-05 发布 · Semantic Scholar 被引 814 次 📅 Google Research / DeepMind 团队 · 首批让医生系统偏好 LLM 答案的工作之一
💬 评论区聊聊:你在工作中有没有用 LLM 处理过"专业领域问答"?是用"通用 LLM + prompt"还是"领域微调 + 推理增强"?效果差距大吗?