论文
OpenTumorBoard:基于真实肿瘤会诊记录的LLM评测基准
OpenTumorBoard: A Real-World Benchmark of Multidisciplinary Tumor Board Discussion Trajectories
摘要
多学科肿瘤委员会通过专家讨论整合多模式临床观察和纵向患者病史,但基准很少捕捉到这些真实世界的轨迹。我们引入 OpenTumorBoard,这是一个基准,包含 611 个患者病例和 10 个专家角色的 19,157 次讨论,转录自 YouTube 上公开的 12,534 分钟肿瘤委员会录音。该基准评估两种设置:“专家轮转”,LLM在真实讨论中回答提出的具有临床意义的问题;“委员会模拟”,产生完整的来回讨论,并就治疗建议、手术计划、下一步行动和临床试验匹配达成共识。对 14 个通用前沿和医学LLM的评估揭示了很大的局限性:最佳模型在与专家答案的临床等效性方面得分为 3.43 分(满分 5 分),与记录的委员会结论一致得分为 2.78 分(满分 5 分)。有监督的微调和强化学习提高了测试集的性能,这表明现实世界的讨论轨迹可以支持模型适应。三位医学博士专家审查了基准的一个子集,发现患者病例的信息覆盖率和真实性很高,并且提取的共识结论具有很强的保真度。我们将发布 OpenTumorBoard 及其自动管理流程,以支持LLM的开发和评估,以进行多学科、个性化的癌症决策。