从密度到活检决策和恶性肿瘤预测:数字和对比增强乳房X线照相术中针对放射科医生的多模态大语言模型的基准研究
From Density to Biopsy Decisions and Malignancy Prediction: A Benchmark Study of Multimodal Large Language Models Against Radiologists in Digital and Contrast-Enhanced Mammography
摘要
目的:将四种多模态大语言模型 (MLLM) 与在乳腺密度评估、BI-RADS 评估、活检候选资格确定和使用数字乳房 X 线摄影 (DM) 和对比增强乳房 X 线摄影 (CEM) 的连续恶性肿瘤概率估计方面具有不同专业知识的放射科医生进行比较。方法:本研究纳入了 179 名女性,并进行了配对 DM/CEM 检查和参考标准。四个 MLLM(ChatGPT-5.2、Gemini-3.1 Pro、Sonnet-4.6、Muse Spark)解释带或不带掩模的图像;三名放射科医生解释了非遮蔽图像。结果:对于 DM 的二元密度分类,放射科医生的准确度范围为 55.81% 至 78.60%,超过了大多数 MLLM 值 (62.33%-71.63%),而口罩的效果有限。与 MLLM(DM 31.16-45.12%;CEM 40.00-55.81%)相比,DM(56.74-67.44%)和 CEM(62.33-82.79%)的放射科医生的五类 BI-RADS 准确率更高。放射科医生(DM 85.12-89.77%;CEM 86.98-92.09%)的二元活检候选准确率同样高于 MLLM(DM 61.39-75.35%;CEM 69.30-82.79%),尽管 CEM 提高了所有读者的表现。病变掩模显着提高了 MLLM 连续恶性肿瘤概率准确度,DM 上从 64.65%-71.63% 提高到 72.56-78.60%,CEM 上从 67.91%-77.21% 提高到 72.56%-81.86%,接近放射科医生的范围(DM 63.72-82.79%;CEM) 81.86-88.84%)。顶部屏蔽模型的相应 AUC 与人类读者的 AUC 重叠。总体而言,Muse Spark(其次是 Sonnet-4.6)在跨领域的 MLLM 中表现出了最强的性能。结论:放射科医生在分类任务中普遍优于 MLLM,而选定的蒙版模型在连续恶性肿瘤概率估计方面接近人类表现,这表明其具有潜在的辅助作用。