论文

性能与一致性:评估 Lung-RADS 筛查中的基础模型

Performance vs Consistency: Evaluating a Foundation Model in Lung-RADS Screening

模型评测模型能力评测

摘要

基础模型最近在广泛的医学成像任务中展示了强大的功能。然而,它们在结构化临床解释环境中的表现仍未得到充分探索。在肺癌筛查中,尽管有 Lung-RADS 等标准化框架,但解释的变异性仍然存在。在本研究中,我们评估了 MedGemma(一种源自 Gemini 的医学通用基础模型)及其适用于肺癌检测和诊断的微调版本,并与放射科医生在 NLST 数据集上执行 Lung-RADS v2022 评估进行比较。十二名放射科医生独立评估了多阅读器设计中的每个病例,从而能够量化阅读器之间的变异性。放射科医生的平均 AUC 为 0.90,不同读者之间存在很大差异(范围:0.80-0.94)。原生基础模型的 AUC 为 0.70,未能达到临床相关性能。相比之下,微调将性能显着提高至 AUC 0.83,使模型处于个体放射科医生性能的较低范围内。这些发现强调了峰值准确度和预测一致性之间的权衡。与放射科医生不同,在固定条件下,该模型产生确定性输出,消除了相同输入下的运行间变异性,这与放射科医生中观察到的读者间变异性形成鲜明对比。这支持了微调基础模型在临床决策支持方面的潜在补充工具的作用,特别是在专业知识有限的环境中。然而,评估是在 NLST 的病例丰富队列中进行的,并未考虑现实世界的患病率或外部验证,限制了直接的临床推广。