论文

BenchX:针对具有人口统计和协议偏差的癌症检测和定位的人工智能模型进行基准测试

BenchX: Benchmarking AI Models for Cancer Detection and Localization with Demographic and Protocol Biases

模型评测鲁棒性、公平性与可信度评测

摘要

人工智能 (AI) 在医学成像领域取得了巨大成功,但人们普遍认为这些模型在现实临床环境中的表现往往不一致。当患者人口统计数据和成像方案不同时,例如在检测小肿瘤、分析不同对比阶段的扫描或评估不同年龄或性别的患者时,就会出现这种不一致。为了量化这些不一致之处,我们开发了一个包含 85,355 个 CT 扫描的大规模开放基准,系统地评估了跨肿瘤大小、位置、患者亚组和成像协议的 12 个肿瘤检测 AI 模型。我们利用 大语言模型 (LLM) 从临床数据中提取和组织亚组信息,这使得分析具有可扩展性和可重复性。我们的基准测试表明,当前最先进的人工智能模型(针对平均准确度进行了优化)在罕见或代表性不足的亚群体(例如年轻的非洲裔美国人女性)中表现不佳。然而,为这些罕见的情况收集足够的带注释的数据通常是不切实际的。该基准为构建更可靠、更稳健的肿瘤检测人工智能模型奠定了基础,并强调了在医学成像和计算机视觉领域进行严格的亚组级评估的必要性。数据集、代码