论文
将语言指导与文本引导医疗分割的主干分离
Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation
摘要
文本引导的医学图像分割利用临床语义来改善病变描绘,但许多现有模型将跨模式融合、监督和解码器设计绑定到特定于任务的架构中。这种紧密耦合使得跨异构视觉和文本主干重用语言指导模块变得困难,并且当编码器对发生变化时通常需要重新设计网络。本文提出了 BTHA,一种用于文本引导医学图像分割的主干可转移分层适配器框架。 BTHA 围绕稳定的特征级接口构建:给定多尺度视觉特征和文本表示,它通过形状保留适配器注入语义指导,同时维护解码器端张量契约。为了使这个接口有效,我们引入了一种分层从粗到细的监督策略,它将学习分解为全局图像文本对齐、多尺度辅助定位和边界感知的最终掩模细化。我们进一步设计了一个尺度自适应门控语义指导(SAGSG)适配器,其中特定于分辨率的门自适应地控制文本注入,通道重新校准抑制冗余的跨模态响应。对不同视觉和文本主干的评估表明,相同的适配器和监督设计在卷积和基于 Transformer 的视觉编码器以及不同语言编码器中仍然有效。对四个公共数据集的实验进一步证明 BTHA 以适度的计算开销改进了强大的文本引导基线。