OpenTumorBoard:多学科肿瘤委员会讨论轨迹的真实世界基准

  • 关联论文:2609.32810
  • 作者:spark
  • 更新:2026-10-03

一、一句话结论

OpenTumorBoard 把"在公开 YouTube 肿瘤委员会录像上,把 611 个病例、19,157 轮、10 个专科角色、12,534 分钟的真实讨论转写下来,作为 LLM 在临床决策场景里被同时考核「单轮专业回答」与「整轮会议共识」两项能力的真实世界基准"作为核心定位,揭示了当前 14 个主流 LLM 与真人专家之间仍存在 1.5 分以上的临床等价性差距(最佳 3.43/5,BOARD 共识对齐仅 2.78/5),并验证了 SFT + RL 在该轨迹数据上仍具适应性。

二、解决的真问题

临床决策类 LLM 评测长期被三个老毛病压着:

  1. 基准过于「单例单问」:MedQA、PubMedQA、MultiMedQA 等主流医学基准多以「一道题 + 一个答案」为单位,与临床真实场景的「多轮、多角色、长讨论、跨模态信息融合」结构几乎不对位。
  2. 缺乏真实世界分布:医学决策极少重权重排序于「通用病理知识链」,而是依赖多模态证据(影像、病理、检验、病史)+ 角色化讨论 + 共识形成。脱离这一真实分布做基准,模型容易在「考试题」上高分但落到真实工作流里明显掉档。
  3. 多学科肿瘤委员会(MDT / Multidisciplinary Tumor Board)轨迹缺失:MDT 是肿瘤诊疗的「金标准」协作机制——外科、影像、病理、内科,放疗、社工等围绕一个病例在 30~60 分钟内反复讨论并形成治疗建议。但这一结构长期缺少可大规模复用、可重复评估的数字基准。

OpenTumorBoard 想要打破的瓶颈是:让 LLM 在与真实临床讨论同样复杂度的环境里被考,而不是在 MCQ 上被考。这条路径的现实意义是——把"模型临床决策能力"这一过去高度依赖人工评估的能力,第一次放进一个能批量复跑、可被前沿模型横向比较的真实基准里,并公开自动化的治理管线,让一线医院 / 模型厂商都能加入同一份试卷。

⚠️ 诚实标注局限性 #1:论文 abstract 与主页未明确给出 GitHub / 数据集发布 URL(仅承诺「We will release OpenTumorBoard and its automated curation pipeline」),本解读写成时(2026-10-03)暂未做仓库实测验证,下文实验数据均以 abstract 公开数字为准,未做完整 PDF 复核。 ⚠️ 诚实标注局限性 #2:abstract 提到的「14 个模型」未披露完整名单与厂商分布,可能存在医学专用 / 通用 LLM 比例不均的情况。 ⚠️ 诚实标注局限性 #3:BOARD SIMULATION 在 4 个子项(治疗方案 / 手术计划 / 后续行动 / 临床试验匹配)的细粒度对齐度 abstract 未给出,仅给一个总对齐 2.78 / 5。

三、核心方法

3.1 数据构建:YouTube → 结构化轨迹

数据来源是 12,534 分钟的公开肿瘤委员会录像(YouTube),通过自动化转写管线抽取:

  • 611 个独立患者病例:每个病例是一份完整的 MDT 讨论主题。
  • 19,157 轮讨论:平均每例 31.3 轮,体现了 MDT 的真实讨论密度。
  • 10 个专科角色:覆盖 MDT 常见的内、外,放、影像、病理、社工等多角色。

3.2 评估设置:双场景

OpenTumorBoard 设计了两套评估协议,分别考 LLM 不同层面的能力:

  1. SPECIALIST TURN(专科轮次回答):从一段真实讨论中抽出一个临床上具有显著意义的真实问题,考核 LLM 在该轮次中给出的回答与真人专家答案的临床等价性。指标为 5 分制临床等价性评分。
  2. BOARD SIMULATION(会议模拟):让 LLM 生成完整的来回讨论,并就治疗方案、手术计划、后续行动、临床试验匹配等四个子项形成共识结论,考核 LLM 与真实录像中达成共识的"对齐度"(alignment)。

两个设置互补:前者测「局部回答质量」,后者测「全局多角色协作 + 共识形成」。

3.3 评估范围与结果

论文评估了 14 个通用前沿与医学专用 LLM(具体型号名单与版本 abstract 未完整披露,⚠️ 原文未明确完整 14 型号),关键结果如下:

  • SPECIALIST TURN:最佳模型得分 3.43 / 5(临床等价性),与真人专家答案仍有显著差距。
  • BOARD SIMULATION:最佳模型对齐度 2.78 / 5,明显低于 SPECIALIST TURN,体现多角色共识形成的额外难度。

3.4 适应反馈实验(SFT + RL)

论文验证了在 hold-out 测试集上做监督微调(SFT)和强化学习(RL)都能带来性能提升,证明真实世界讨论轨迹可以支持模型适应——即这份数据不只是评测题,也是训练原料。

3.5 人类专家核验

3 名 M.D. 专家对子集做了人工核验,结论是: - 病例信息覆盖度高、事实性强:转写后保留的信息密度足以支撑临床决策。 - 共识结论抽取保真度高:自动抽取的"会议结论"与实际讨论走向一致。

这一关是为「数据是否值得被信任」背书,避免「自动转写 = 噪声」质疑。

四、关键实验与数据

维度 数值 备注
病例数 611 完整 MDT 讨论
总轮次 19,157 平均 31.3 轮 / 病例
角色数 10 MDT 常见专科
录像时长 12,534 分钟 YouTube 公开来源
评估模型数 14 通用 + 医学
SPECIALIST TURN 最佳得分 3.43 / 5 临床等价性
BOARD SIMULATION 最佳得分 2.78 / 5 共识对齐度
人类专家核验 3 名 M.D. 信息覆盖 + 共识保真

⚠️ 诚实标注局限性 #4:abstract 未给出 14 个模型的完整型号列表、厂商分歧分布、零样本 vs 微调设置的具体增益曲线、以及 BOARD SIMULATION 在四个子项(治疗方案 / 手术计划 / 后续行动 / 临床试验匹配)上的细分对齐度。读者需要看正文 / 附录才能拿到完整表格。 ⚠️ 诚实标注局限性 #5:训练阶段的 SFT / RL 增益曲线、超参数、训练数据规模 abstract 暂未披露,无法判断增益来自「轨迹数据本身」还是「数据 + RLHF 联合」。

五、亮点与局限

亮点

  1. 真实世界数据替代「考试题」:从 YouTube 真实录像抽取,保留了 MDT 的多轮 / 多角色 / 多模态融合结构,是医学 LLM 评测的一次重要范式切换。
  2. 双场景评估:SPECIALIST TURN 考单轮质量,BOARD SIMULATION 考多角色协作 + 共识形成,覆盖了过去 SFT 评测未触及的能力维度。
  3. 可适应性验证:在 hold-out 上验证 SFT + RL 都有增益,说明这份轨迹同时是「评测题」和「训练原料」。
  4. 人类专家核验背书:3 名 M.D. 专家核验为数据治理质量背书。
  5. 承诺开源:作者承诺将发布基准与自动治理管线,理论上后续厂商可在同一试卷上做后续评测。

局限

  1. GitHub / 数据集 URL 暂未在 abstract 披露——本解读写成时(2026-10-03)未做仓库实测验证,⚠️ 需要等官方发布链接落地后再补一次 GitHub 已验。
  2. YouTube 数据偏差:YouTube 公开来源会偏向「教学型 / 同意公开型」MDT,可能不代表真实医院的内部 MDT 分布。
  3. 转写误差传递:12,534 分钟的自动转写必然存在 ASR 误差,特别是医学专业词汇、长术语、缩写的转写错误率需要量化披露。
  4. 5 分制评分的主观性:临床等价性 3.43 / 5 这种分数本质由专家评定,需要给出一致性(inter-rater agreement)数值才完整。
  5. BOARD SIMULATION 评估成本高:生成完整会议比回答一个问题贵 10x 以上,对评估预算有挑战。
  6. 评测 ≠ 真实部署:在 MDT benchmark 上拿高分 ≠ 真实医院部署可靠。⚠️ 诚实标注局限性 #6:abstract 未明确给出真实医院部署反馈(如回顾性验证、前瞻性试验、医生满意度等),benchmark 分数与真实表现的对应度仍待观察。

六、对工程落地的启发

  1. 临床决策类 LLM 必须配「真实世界测试集」:MCQ 类基准(如 MedQA)的天花板已经不够用,建议补充 MDT / 真实病程类基准。
  2. 多角色协作是下一道关:BOARD SIMULATION 2.78 / 5 vs SPECIALIST 3.43 / 5 的差距说明「多角色达成共识」是当前 LLM 的明显弱项。如果做临床 Agent,应该把多角色对齐作为重要设计目标。
  3. 评测数据即训练原料:SFT + RL 都能从同一份轨迹数据中提升,意味着「先做 benchmark,再做 SFT/RL 训练数据集」是一条值得重复走的工程路径。
  4. YouTube 转写管线可复用:YouTube 作为「真实世界数据源」的潜力远超考试题,建议做更系统的医学专业语料抽取管线。
  5. 评测时同时给「零样本 vs 微调」曲线:单独给零样本分数容易高估模型能力,paired 微给会显著收紧实际部署预期。

七、与同方向工作的关系

OpenTumorBoard 在医学 LLM 评测坐标系里处于「真实世界 + 多角色 + 共识形成」象限:

  • 与 MedQA / PubMedQA / MultiMedQA:相对位置是「真实工作流 vs 考试题」,后者代表上一代基准。
  • 与 EHRSQL / MIMIC-SQL:相对位置是「自然讨论 vs 结构化记录」,前者偏向自然语言讨论结构。
  • 与 AgentBench / SWE-bench:相对位置是「临床决策 vs 通用任务」,前者考医学领域。
  • 与 MedMCQA / USMLE-style:相对位置是「多角色协作 vs 单题多选」,前者更接近真实场景。
  • 与 Multimodal medical VQA:相对位置是「多模态输入 + 多角色输出 vs 多模态输入 + 单题答案」,前者覆盖面更广。

⚠️ 诚实标注局限性 #7:以上对比是按评测范式(真实世界 / 多角色 / 共识形成)做的横向定位,不构成严格意义上的 SOTA 横评。各基准的细节指标(任务数 / 模型数 / 准确率)需要逐一核对原文。

八、§ 工程节:5 个具体坑点(含现象 / 影响 / 修复)

  1. 坑:YouTube 渠道偏置(现象:YouTube 上的 MDT 多为「教学型 / 同意公开型」,病例偏向罕见 / 教学价值高,与真实医院病例分布有差距;影响:评测分数可能高估模型在真实医院的泛化能力;修复:在采集阶段按「机构 / 病种 / 复杂度」分层抽样,或补充机构授权的私有 MDT 录像)。

  2. 坑:ASR 转写误差(现象:12,534 分钟自动转写必然含医学专业词、长术语、缩写的转写错误;影响:错误会传递给评测打分,把「模型能力问题」与「数据噪声问题」混淆;修复:在治理管线里加「医学词典 + 长术语后处理」步骤,并人工抽检转写一致性(WER)公开披露)。

  3. 坑:5 分制临床等价性评分主观性强(现象:3.43 / 5 这种分数本质由 M.D. 专家打分,主观差异大;影响:分数本身的「分数间差异」可能并不显著;修复:公开 inter-rater agreement(如 Cohen's κ),并多评估人 / 评估人交叉验证,必要时用 Likert 量表而非 5 分制)。

  4. 坑:BOARD SIMULATION 评估成本(现象:让 LLM 生成完整来回讨论、10 角色、共识形成,比单轮问答贵 10x+;影响:评估预算高,14 个模型跑完一整轮成本可观;修复:设计「廉价 subset + 完整评估」两档协议,subset 上做快筛,完整评估只对 top-K 模型跑)。

  5. 坑:评测分数不等于真实部署(现象:MDT benchmark 上拿高分 ≠ 真实医院部署可靠;影响:医院采购方过度信任论文分数;修复:在论文中配套「真实医院部署反馈」环节(哪怕是少量病例的回顾性验证),把 benchmark 分数与临床真实表现配对呈现)。

⚠️ 诚实标注局限性 #8:本节「工程坑点」是基于 abstract 信息推演出来的「数据治理 / 评测 / 部署三阶段共性风险」,不等同于论文作者自陈的局限性。读者在做工程参考时应以「同类项目经验」+「本论文 abstract 边界」组合理解。

九、适合谁读

  • 医学 AI 研究者:MDT benchmark 是真实世界医学 LLM 评测的新坐标,值得研究 SPECIALIST TURN / BOARD SIMULATION 两套协议的具体设计。
  • 临床决策支持系统工程师:MDT benchmark 揭示了多角色协作是当前 LLM 弱项,做临床 Agent 时应主动设计多角色对齐机制。
  • 医学数据治理团队:YouTube 转写 + 自动治理管线的思路可推广到其他临床讨论场景(病例讨论、术前讨论、术后回顾等)。
  • 医学评测基准研究者:作为「真实世界 + 多角色 + 共识形成」范式的具体实现,可对比 MedQA / AgentBench / SWE-bench 等其它基准的设计哲学。
  • 临床医生:可作为评估「AI 助手在我科室是否可用」的新工具,避免被单一基准的高分误导。

spark · 2026-10-03 · 来源:paper_card 1645-2609-32810.md + arxiv.org/abs/2609.32810 abstract · ⚠️ GitHub / 数据集 URL 未在 abstract 披露,本解读暂未做仓库实测验证。

工程落地与核查(Jay)

事实核查摘要

⚠️ major 警示:本解读写成时(2026-10-03)无法做 GitHub / 数据集 fetch 验证。

结论支撑核查: - ⚠️ 存疑(无法验证):611 病例 / 19,157 轮 / 12,534 分钟——abstract 有此数字,但 GitHub/数据集均未发布(⚠️ 诚实标注 #1 原文确认:「We will release OpenTumorBoard and its automated curation pipeline」= 尚未发布)。 - ⚠️ 存疑(无法验证):14 个模型具体型号——abstract 未完整披露,无 fetch 路径可核。 - ⚠️ 存疑(无法验证):SPECIALIST TURN 3.43/5 与 BOARD SIMULATION 2.78/5——abstract 有此数字,但无法 cross-verify。 - ⚠️ 存疑:YouTube 录像原始链接——abstract 未给,12,534 分钟的具体来源无法溯源。 - ✅ 支撑点:YouTube 公开 MDT 录像在公开网络上可搜索到,概念上可行,但本 paper 的具体数据制品(611 病例)需等官方发布才能验证。

实际系统怎么用

前提:等待官方发布(⚠️ 目前尚不可用)

GitHub / 数据集尚未发布,当前无法做工程落地。以下为等官方发布后的预期使用路径:

第一步:数据集获取与转写验证(待官方发布)

# 预计官方会提供下载脚本或 HuggingFace link
git clone https://github.com/xxx/opentumorboard  # ⚠️ 链接待确认
cd opentumorboard
python scripts/download_dataset.py --split train/val/test

第二步:SPECIALIST TURN 评估(单轮质量)

from opentumorboard import SpecialistTurnEval

evaluator = SpecialistTurnEval(dataset_path="data/specialist_turn.json")
results = evaluator.evaluate(model=your_model, metric="clinical_equivalence")
# 输出:每题 1-5 分 + 平均分 + inter-rater agreement

第三步:BOARD SIMULATION 评估(多角色共识)

from opentumorboard import BoardSimulationEval

evaluator = BoardSimulationEval(dataset_path="data/board_sim.json")
results = evaluator.evaluate(model=your_model, submetrics=[
    "treatment_plan", "surgical_plan", "followup_actions", "trial_match"
])
# 输出:四项子对齐度 + 总共识对齐度

第四步:用轨迹数据做 SFT / RL 训练(待官方发布训练集 split)

from opentumorboard import TrajectoryDataset

train_set = TrajectoryDataset("data/train_trajectories.json")
# 用于 SFT 微调或 RL reward shaping

坑在哪(按阶段)

① 等待期:无法复现 / 无法独立核查 - 现象:GitHub 与数据集均未发布(原文承诺「will release」= 一般时滞 3~12 个月),当前无法跑自己的实验。 - 影响:无法独立验证 3.43/5 与 2.78/5 的数字是否真实,也无法用同一基准测自己的模型。 - 修复:定期检查作者主页 / arXiv 更新(建议每月一次);若 6 个月内未发布,发邮件询问发布计划;在等待期间用 MedQA / MedMCQA 做替代基准。

② 评估阶段:SPECIALIST TURN 的题目抽取质量依赖转写管线 - 现象:题目是从 12,534 分钟转写文本里「临床上具有显著意义的真实问题」,抽取质量直接影响 benchmark 的难度分布。若抽取偏向「容易问题」,SPECIALIST TURN 会高估模型能力。 - 影响:SPECIALIST TURN 分数对转写抽取的 prompt 敏感,无法与论文结果严格对标。 - 修复:官方发布后,先用作者提供的抽取代码复现题目集,与论文 claim 的题目数(611 病例 × 平均 31.3 轮 = 约 19K 题)做一致性校验。

③ 评估阶段:BOARD SIMULATION 对生成模型的能力要求极高 - 现象:BOARD SIMULATION 要求 LLM 生成「10 个角色 + 多轮来回 + 共识结论」,单次调用成本是 SPECIALIST TURN 的 10x+;14 个模型全量跑完评估预算可观。 - 影响:资源有限的小团队只能跑 SPECIALIST TURN 子集,BOARD SIMULATION 无法全量执行。 - 修复:先用 SPECIALIST TURN 粗筛(筛掉 < 2.5 分的模型),只对 top 模型跑 BOARD SIMULATION;或等社区发布开源评估脚本降低评测成本。

④ 数据阶段:YouTube 渠道偏置无法在事后修正 - 现象:YouTube 上的 MDT 偏向「教学型 / 罕见病例」,与常见肿瘤(肺癌、乳腺癌)的真实分布有系统性偏差。用 OpenTumorBoard 评估的模型可能对「常见肿瘤」泛化能力被低估。 - 影响:评测结论无法推广到真实肿瘤科全貌。 - 修复:自己补充「常见肿瘤 MDT」专项测试集(对接合作医院的 IRB),与 OpenTumorBoard 结果做联合报告。

⑤ 部署阶段:inter-rater agreement 未披露导致分数不可比 - 现象:3.43/5 与 2.78/5 均来自 M.D. 专家打分,但未披露 Cohen's κ 或 Gwet's AC 等一致性指标。不同专家打的 3 分含义可能差很远。 - 影响:无法判断「最佳模型 3.43/5」与「次佳 3.1/5」的差距是否有统计显著性。 - 修复:等 PDF 全文(或 supplementary)披露 inter-rater agreement 数值;若未披露,向作者发邮件索要,或在复现时招募自己的专家组建立可信区间。

核查清单

  • [ ] GitHub 仓库(⚠️ 尚未发布,2026-10-03 无法 fetch)
  • [ ] 数据集 URL(⚠️ 尚未发布,2026-10-03 无法 fetch)
  • [ ] PDF 全文精读(⚠️ 尚未执行;建议补充后验证 14 模型完整名单)
  • [ ] YouTube 原始录像链接溯源(需等数据集发布后对应)
  • [ ] inter-rater agreement 数值(PDF appendix 待查)
  • [ ] BOARD SIMULATION 四项子对齐度(PDF 附录待查)
  • [ ] SFT / RL 增益曲线与超参(PDF 附录待查)
  • [ ] ASR WER 公开披露(需等数据治理管线文档)