论文

利用 CLIP 桥接视觉基础模型先验,实现医学图像中的空间感知少样本异常检测

Bridging Vision Foundation Model Priors with CLIP for Spatial-aware Few-shot Anomaly Detection in Medical Images

模型训练监督微调与指令调优

摘要

CLIP 等视觉语言模型可通过强大的图像文本语义对齐实现有效的少量医疗异常检测 (AD)。然而,他们的全局对比预训练缺乏明确的空间监督,限制了精确的病变定位。相比之下,诸如 DINO 之类的视觉基础模型 (VFM) 通过自蒸馏和局部到全局的一致性来学习空间连贯的斑块表示,从而更好地捕获细粒度的解剖结构。利用这种互补性,我们提出了 Spatial-FAD,这是一种空间感知的少样本医学 AD 框架,它通过将 VFM 空间先验与 CLIP 语义相结合来改进病变定位。具体来说,我们引入了一种 VFM 增强型适配器,它将源自 DINO 的先验结构亲和力注入到 CLIP 特征中。这种结构引导的细化鼓励视觉嵌入更好地遵循病变边界,同时保持语义对齐。为了解决补丁造成的空间细节损失和 CLIP 有限的输入分辨率,我们采用了滑动窗口聚合策略。这会生成高分辨率、空间密集的嵌入,以进一步增强定位粒度。此外,我们引入了原型增强的支持内存方案来有效地利用少样本支持集。该模块存储正常和异常模式的紧凑原型,通过融合补丁到原型和图像文本相似性来降低内存成本,同时提高性能。对三个基准数据集(包括肝脏 CT、视网膜 OCT 和脑 MRI)的大量实验表明,Spatial-FAD 显着优于最先进的方法,尤其是在病变分割方面。值得注意的是,在 4-shot 场景中,我们的方法在 Dice 分数上平均提高了 11.4% 以上,在 AUC 上平均提高了 1.8%。代码位于:https://github.com/JuzhengMiao/Spatial-FAD。