AI 医生能不能看病?2023 年这篇论文让医生在 8/9 个维度上更偏好 AI 答案

  • 关联论文:2305.09617

你有没有想过这种问题:

网上搜症状,搜出来的医疗信息要么是广告,要么是莆田系。 ChatGPT 写出来的医学回答看起来很专业,但你能信吗? 2023 年 5 月 Google 发的这篇 Med-PaLM 2 论文,是第一次让医生在成对盲评中系统地更偏好 AI 答案——但它真的能替代医生看病吗?

直接说结论:能打辅助,不能看病。

这篇论文到底干了什么

Google 的 Med-PaLM 2 团队做了一件非常"工程"的事:

基座升级:从第一代 Med-PaLM 用的 PaLM,换到更大的 PaLM 2(闭源基座)。

领域微调:在医学问答、医学检索、合成医学推理数据上对 PaLM 2 做指令微调。

推理时增强(最关键的创新):Ensemble Refinement(ER)——让模型先自己"想" 5 次,每次都给出独立推理路径 + 答案;然后把所有 5 个答案 + 推理过程一起塞回同一个模型,让它"反思"并写出一个综合答案。

不是简单多数投票,是让同一个 LLM 当自己的评审员

效果有多炸

多选题基准

  • MedQA(美国医师执照考试 USMLE 风格):86.5%——USMLE 及格线是 60%,意味着模型已经稳过线。
  • 对比初代 Med-PaLM 的 67.2%,提升 19 个百分点以上

真正关键的是第二组实验——1066 道消费者医疗长问答的成对盲评

Google 找了临床医生,对每道题对比"AI 的答案" vs"医生的答案",在 9 个临床效用维度(准确性、安全性、可读性、循证严谨性、临床实用性等)上做成对偏好选择。

结果:9 个维度中,医生在 8 个维度上更偏好 Med-PaLM 2 的回答(p<0.001)

这是首批在"医学长文可用性"维度上让医生系统性地更偏好 LLM 答案的工作之一。

ER 这个技巧为什么值钱

传统 Self-Consistency 是让模型想 5 次然后"投票"——哪个答案出现次数最多就选哪个。

ER 是升级版——把 5 个答案连同推理过程都喂回模型,让它"看着自己多样化的思考产物"重新写一个综合答案。

直觉:让 AI 当自己的"红队"——先发散再收敛,比单纯投票更稳。

工程上几乎零额外训练成本——你只需要多写一段 few-shot prompt 让模型做反思总结。所有已有的强基座都能叠加这个技巧。

成本代价:单次问答需要 5-6 次 forward pass(5 次采样 + 1 次综合),延迟和费用都约增加 5-6 倍。

关键警告:这是消费者问答,不是临床决策

论文和官方声明里反复强调:"not for clinical use"

为什么?三层距离:

  1. 答案正确 ≠ 治疗方案正确——AI 可能答对"这个症状对应什么病",但推荐的治疗方案可能不是最优解。
  2. 治疗方案正确 ≠ 患者结局正确——同样的病在不同人身上要不同处理,AI 看不到病人的病史、生活习惯、家庭支持。
  3. 没有医患闭环——真正的诊疗是医患之间的信任建立、动态调整、情绪支持,AI 只是工具。

更细的隐患

  • 幻觉问题更危险:ER 让最终答案听起来更"自信"、更"流畅",但底层事实可能仍然有错。在医学场景,"自信地说错"比"犹豫着说对"危险得多。
  • 数据偏见:1066 题数据集是 Google 自建,以美国英语用户为主。在中国农村、印度基层诊所、拉美贫民窟的医疗场景,效果完全无法保证。
  • 基座依赖:PaLM 2 是闭源的,国内团队没法直接用。开源替代(Llama 3 70B、Qwen 2.5 72B + 医学指令微调)效果差不少。

工程落地怎么用这篇论文的思路

可迁移的部分

  • ER 提示策略:任何强基座 + 几乎零成本就能叠加。代码实现就是两段 prompt + 5-6 次 forward pass。
  • 多维度成对盲评:不要只盯"多选题分数",把"领域专家成对盲评"当作真正的上线路标——这比 benchmark 分数更接近真实可用性。
  • 对抗性测试集:与业务方共建"刁钻样例"往往比换数据集更能暴露真实风险。

不可迁移的部分

  • PaLM 2 基座本身:闭源,无法直接复用。
  • 86.5% MedQA 数字:不同基座 + 不同微调数据 + 不同评测协议,数字会大幅变化。
  • "医生偏好"的结论:依赖 Google 自建的 1066 题数据集,换数据集这个结论可能反转。

医疗场景的工程红线

  • 必须有"AI 辅助 + 医生最终决策"的兜底机制——任何跳过医生直接给患者诊疗建议的产品都违反论文原文声明,也违反 FDA 510(k) 等监管要求。
  • 必须有幻觉检测 + 不确定性提示——AI 应该明确说"我不确定",而不是用流畅的语气胡编。
  • 必须有人审兜底——尤其是罕见病、危重症、儿童、孕妇等高风险场景。

这篇论文真正教会我们的事

不是"AI 能看病"——这是过度解读,论文明确否认。

"LLM 在垂直专业领域(医学 / 法律 / 金融 / 工程)可以逼近专家级辅助水平"——只要三件事做到位:

  1. 强基座(通用能力不能差)
  2. 领域微调(把通用能力钉到领域分布上)
  3. 推理时增强(用 ER / self-consistency / 多链推理等技巧榨出最后几点精度)

这三段式组合在几乎所有"垂直领域 LLM"产品里都能复用——法律咨询、金融研报、工业故障诊断、教育辅导——只是数据、提示模板、合规要求不一样。

一句话给老板

"2023 年 Google 的 Med-PaLM 2 论文证明了:LLM 在医学长问答上可以逼近医生辅助水平(86.5% MedQA + 医生 8/9 维度偏好)。但这不是 AI 诊疗,是 AI 辅助 + 医生最终决策的工程范式。ER 提示策略几乎零成本可迁移,基座(PaLM 2)不可迁移。任何跳过医生直接给患者诊疗建议的产品都违反论文原文声明。"

三个标题变体

  1. "AI 医生能不能看病?Google 2023 年的这篇论文给出了最严谨的答案——能打辅助,不能看病"
  2. "医学 LLM 的分水岭:86.5% MedQA 分数 + 8/9 维度医生偏好,但论文明令禁止临床使用"
  3. "为什么你的 AI 医疗产品不能直接落地?Med-PaLM 2 的三层距离警告"

📱 小红书风格卡片文案

📚 今天被 Google 2023 年的这篇论文震到了

它干了件非常工程的事

基座:用更大的 PaLM 2 替换第一代的 PaLM 微调:在医学问答、医学检索数据上做指令微调 推理技巧(关键创新):让模型自己"想 5 次",然后让同一个模型当自己的评审员,看着 5 个答案反思并写出一个综合答案——这叫 Ensemble Refinement (ER)

效果有多炸: - 美国医师执照考试风格 MedQA:86.5%(及格线 60%) - 1066 道消费者医疗长问答:医生在 9 个临床效用维度中的 8 个维度上更偏好 AI 答案(p<0.001)

但—— 论文和 Google 官方反复强调:not for clinical use(不允许临床使用)

为什么?因为三层距离: 1. 答案正确 ≠ 治疗方案正确 2. 治疗方案正确 ≠ 患者结局正确 3. 没有医患闭环(信任、动态调整、情绪支持)

真正的工程价值: - ✅ ER 技巧几乎零成本可迁移(任何强基座都能叠加) - ✅ "基座 + 微调 + 推理时增强"三段式可复用所有垂直领域 - ❌ PaLM 2 基座闭源不可复用 - ❌ 不能跳过医生直接给患者诊疗(违反 FDA 等监管)

📎 arXiv 2305.09617 · Google Research · 2023-05

#AI科普 #医疗AI #LLM #MedPaLM #GoogleAI #推理时增强 #AI安全 #医学 #论文分享


📎 arXiv 2305.09617 · 2023-05 发布 · Semantic Scholar 被引 814 次 📅 Google Research / DeepMind 团队 · 首批让医生系统偏好 LLM 答案的工作之一

💬 评论区聊聊:你在工作中有没有用 LLM 处理过"专业领域问答"?是用"通用 LLM + prompt"还是"领域微调 + 推理增强"?效果差距大吗?

AI #医疗AI #LLM #MedPaLM #GoogleAI #推理时增强 #AI安全 #医学 #人工智能 #论文分享 #技术科普 #深度学习 #机器学习 #大模型