论文

看看探头拖进去了什么! MedCLIP 中的真实胸部 X 射线捷径

Look What the Probes Dragged In! Real-World Chest X-ray Shortcuts in MedCLIP

模型评测模型行为与机制分析

摘要

视觉语言模型,例如基于对比语言图像 预训练 (CLIP) 的方法,已经在医学人工智能领域达到了最先进 (SOTA) 的结果。然而,最近的研究表明,基于 CLIP 的模型仍然容易受到捷径的影响。我们研究了现实世界的捷径如何在基于 CLIP 的医学模型 MedCLIP 及其视觉编码器(冻结的 ResNet-50)的不同层中体现。我们将 17 个线性分类探针附加到 ResNet-50 的中间层,并在三种不同的数据集配置和目标上训练它们:NIH-CXR14(气胸)和 PadChest(心脏肥大和气胸)。此设置允许我们使用基于子组的校准和逐层置信曲线来观察评估期间的模型行为。我们发现最终的线性探针实现了较高的 AUROC,但模型中的校准较差。分层置信度分析表明,捷径出现在不同的深度。与局部快捷方式一致的模式(例如排水管)出现在后面的层中,而与扩散快捷方式一致的模式(例如扫描仪特定的噪声模式)则更早出现,与之前的工作保持一致。最后,我们对图像进行手动分析,揭示了 NIH-CXR14 和 PadChest 中的数据质量问题。我们的研究结果强调,即使是 SOTA 模型也仍然容易受到捷径的影响,并且需要高质量且注释良好的数据集才能得出可靠的结论。代码可以在我们的 GitHub 上找到:https://github.com/nikodice4/MedCLIP_shortcuts。