论文

用于语言引导医学图像分割的多模态路由和区域细化

Multimodal Routing and Region Refinement for Language-Guided Medical Image Segmentation

模型训练参数高效训练

摘要

文本描述可以通过指定要描绘的发现和位置来减少医学图像分割中的歧义。现有的文本引导方法主要改进图像和语言特征交互的地方,但通常保留跨所有图像文本对的单一学习更新路径。我们提出了 MRSeg,一个参数高效的框架,它使用每个图像文本对在密集预测之前路由视觉和文本特征的适应。 Frozen ConvNeXt-Tiny 和 PubMedBERT 编码器提供多尺度视觉特征和临床文本标记。联合路由器使用最深层的视觉特征和池化文本来预测低秩适配器基础上的稀疏混合物。生成的路线在两个视觉尺度和文本的不同适配器库之间共享,协调它们的适应,同时保持特定于功能的参数分开。区域桥使用文本派生查询将密集的视觉标记聚合到潜在区域,通过自注意力和文本交叉注意力细化这些区域,并将细化的信息重新分配回特征图。最后,多尺度解码器将精细的语义特征与浅层图像证据相结合。在 QaTa-COV19 和 MosMedData+ 上,MRSeg 分别达到 90.90/83.32 和 81.53/68.82 Dice/mIoU,具有 7.11M 可训练参数和 7.60 GFLOP。代码:此 https URL。