论文

OpenMTB-Audit:揭露基于大语言模型的分子肿瘤委员会安全评估中的过度拒绝和临床专家观点

OpenMTB-Audit: Exposing Over-Refusal and Clinical Expert Perspectives in LLM-Based Molecular Tumor Board Safety Evaluation

模型评测基准与评测资源

摘要

分子肿瘤委员会整合了基因组发现、临床背景和治疗证据,以支持精准肿瘤学。随着人工智能进入这一工作流程,一个关键的安全挑战是将真正不受支持的建议与有证据支持的选项区分开来,这些选项由于信息不完整、ECOG 表现状态不佳或其他临床警告而仍然需要肿瘤学家审查。我们推出 OpenMTB-Audit,这是一个包含 500 个合成非小细胞肺癌病例的开源基准,涵盖五个对抗性错误类别和四个安全标签:支持、部分支持、不支持和信息不足。在八个大语言模型配置中,我们发现了普遍的过度拒绝:在 83.3-100% 的真正部分支持案例中,所有 LLM 配置未能保留部分支持标签,通过标签崩溃而不是临床校准推理来实现高总体安全评分。为了解决这一限制,我们开发了 MTB-AuditAgent,这是一个确定性的七模块框架,将证据验证、缺失信息检测、安全分类和弃权分开。它将过度拒绝率降低至 6.7%,准确率达到 91.2%(95% CI:88.6-93.6%)。一项两名肿瘤学家注释研究发现,分歧集中在信息充分性和治疗优化之间的界限,强调需要保留临床上有意义的区别。