论文

超越基准分数:审核胸部 X 射线结核病筛查的医学视觉语言模型

Beyond Benchmark Scores: Auditing Medical Vision-Language Models for Chest X-Ray Tuberculosis Screening

模型评测鲁棒性、公平性与可信度评测

摘要

医学模型的基准分数并不能证明相同的结论在不同的评估下成立。这项研究测试了有关模型排名、评分可靠性和筛查性能的主张是否能够在队列、提示、阴性谱、指定患病率和操作阈值的变化中幸存下来。我们对来自四个数据集(Montgomery、Shenzhen、TBX11K 和 VinDr-CXR)的 12,200 条胸部 X 线照片记录进行了三种医学视觉语言模型(BioMedCLIP、CheXficient 和 MedSigLIP)和通用域 OpenCLIP 比较器的审核。五个固定提示系列产生 244,000 个模型-图像-提示分数。没有模型领先于每个队列和可靠性标准。在 48 项多重对照比较中的 21 项中,即时家族变化改变了 AUROC。在所有四种模型中,用患病的非结核病对照替换健康对照可使 AUROC 降低 0.075--0.306。在 VinDr-CXR 上,这三种医学模型区分结核病和无发现对照的效果明显好于区分肺炎或肺肿瘤;他们对两种指定疾病的 AUROC 点估计值均低于 0.5。 CheXficient 记录了 VinDr-CXR 预训练暴露,这限制了对其结果的解释。为 TBX11K 训练的 95% 灵敏度选择的阈值在 16 个目标评估中只有 4 个保留了点估计的约束。五种子监督源模型在 TBX11K 验证中达到 0.999 AUROC,但在两个外部队列中各达到 0.629。保守地排除感知重叠的候选者会缩小这一差距,但不会消除它。这些回顾性的单任务结果表明,区分度、分数可靠性和阈值保留支持不同的可移植性主张。胸部 X 射线结核病筛查的证据应确定完整的评估规范,而不是仅将临床可移植性归因于检查点。