论文
DistMedVL:用于不确定性感知医学图像分割的分布式视觉语言对齐
DistMedVL: Distributional Vision-Language Alignment for Uncertainty-Aware Medical Image Segmentation
摘要
视觉和文本表示的跨模态对齐是多模态医学图像理解的基础,但在现实临床条件下这两种模态的不确定性仍然受到阻碍。现有的视觉语言分割方法依赖于确定性的跨模态匹配,它忽略了模糊边界的任意不确定性和有限训练数据的认知不确定性,导致域转移下的性能脆弱。为了解决这个问题,我们提出了 DistMedVL,这是一种概率视觉语言框架,它在冻结编码器上引入了轻量级概率跨模态适配器(PCM-Adapter),以显式地模拟表征不确定性。具体来说,PCM-Adapter 包括两个用于渐进概率对齐的顺序模块。我们首先设计了一个马哈拉诺比斯对齐模块(MAM),它将文本标记建模为高斯分布,并通过马哈拉诺比斯距离计算补丁文本兼容性,产生方差条件匹配,从而降低不可靠特征维度的权重。此外,我们设计了一个分布流模块(DFM),它可以估计模态置信参数并执行视觉引导的文本分布细化,以适应跨成像模态的分布变化。跨八个医学分割基准的大量实验表明,DistMedVL 仅具有 630 万个可训练参数,性能优于最先进的方法,表现出卓越的数据效率、扰动鲁棒性和跨数据集泛化能力。