论文
多视图协同学习与视觉语言适应低资源生物医学图像分类
Multi-View Synergistic Learning with Vision-Language Adaption for Low-Resource Biomedical Image Classification
摘要
由于有限的注释、微妙的类间视觉差异和复杂的疾病语义,在资源匮乏的条件下进行准确的生物医学图像分类仍然具有挑战性。虽然视觉-语言模型为缓解数据稀缺提供了有希望的基础,但它们在生物医学环境中的有效适应受到参数高效调整以及细粒度和语义一致的表示学习的需求的限制。在这项工作中,我们提出了多视图协同学习(MVSL),这是一个统一的框架,通过共同考虑适应范式、表示粒度和疾病语义关系来应对这些挑战。 MVSL 将视觉和文本编码器的适应解耦,以尊重其独特的表征特征,从而实现更稳定、更有效的参数效率 微调。它还引入了多粒度对比学习,以明确地建模全局图像语义和局部病变级别证据,从而改善对视觉相似疾病类别的细粒度区分。此外,MVSL 通过合并源自 大语言模型 的结构化监督来保留疾病级别的语义结构,它限制类级别的文本表示,并通过跨模态对齐间接规范视觉嵌入。这些组件共同实现了更稳定的跨模式对齐,并在有限的监督下改善了区分度。对涵盖 9种成像模态和 10个解剖区域的 11个公开生物医学数据集进行的广泛实验表明,MVSL 在少样本和零样本分类设置中始终优于最先进的方法。