当适应受到损害时:将代表性漂移与 MedSAM 微调 中的 OOD 失败联系起来
When Adaptation Hurts: Connecting Representational Drift to OOD Failures in MedSAM Fine-Tuning
摘要
医学图像分割的基础模型(例如基于提示的 MedSAM)可以很好地跨领域和模式推广,通常是在零次或几次镜头设置中。然而,它们的性能取决于提示的质量以及模型对自定义数据集的适应。这项工作系统地研究了 MedSAM 如何在不同的医学成像基准上进行推广,并采用六种适应策略:全模型和仅编码器 LoRA、浅层和深层视觉提示调整 (VPT) 以及仅解码器和完整 微调。模型在国际皮肤成像协作挑战赛 (ISIC 2018) 数据集上进行训练,并在 IN 和分布外 (OOD) 数据集上的干净且越来越嘈杂的提示下进行评估:近 OOD PH2(皮肤镜检查)、远 OOD BUSI(乳腺超声图像数据集)和 CBIS-DDSM(用于筛查乳腺 X 线摄影的数字数据库的精选乳腺成像子集)。我们表明,自适应提高了 IN 和近 OOD 数据的性能,但通常会降低远 OOD 数据的性能。完整的 微调 提供了最佳的权衡,而仅编码器的 LoRA 是最强的参数效率替代方案,在远 OOD 移位下优于标准 LoRA 和 VPT。使用中心核对齐 (CKA),我们表明远 OOD 退化与解码器表示中的漂移密切相关,而编码器相似性本身并不能解释鲁棒性。这表明仅编码器的 LoRA 通过使编码器适应视觉特征的分布变化,同时保留解码器路径,提供了比标准 LoRA 更强的鲁棒性。我们进一步表明,提示上的随机 0-100 像素抖动可以产生更稳健、性能更好的模型。因此,我们得出的结论是,稳健的 MedSAM 适应需要综合考虑即时噪声暴露、域转移和表示保留。我们发布代码:https://github.com/ImSounic/medsam-vpt