论文

通过证据解耦表征医学视觉语言分割中的文本分支敏感性

Characterizing Text Branch Sensitivity in Medical Vision-Language Segmentation via Evidence Decoupling

模型评测模型行为与机制分析

摘要

预训练的视觉语言模型(VLM)通过结合临床文本在医学图像分割中表现出了良好的性能。然而,目前尚不清楚文本信息实际上对像素级预测有多少贡献。在这项工作中,我们系统地研究了文本在多模态医学图像分割中的作用。我们首先分析了几种常用的融合策略,发现分割性能很大程度上对融合模块的选择不敏感。为了进一步理解模态交互,我们提出了一种基于证据深度学习和深度监督的证据解耦解码器(EDD)。 EDD 用作内部表示分析工具,可在整个解码过程中分解图像证据和文本调制证据,同时保持有竞争力的分割性能。实验结果表明,不同数据集对文本扰动的敏感性差异很大。在 BUSI 和 BTMRI 上,删除文本会导致灾难性的性能下降,表明模型对文本输入的强烈依赖。在 ISIC 和 Kvasir-SEG 上,文本的影响相对较小。我们进一步发现,文本主要通过全局语义调制而不是独立的空间定位来影响预测,并且驱动文本敏感性的特定语义成分在不同数据集中有所不同。这些发现提供了对多模态医学图像分割中模态交互的更深入的理解,并为未来的模型设计提供了实用的见解。