论文

文本作为照明:用于语言引导的医学图像分割的空间对比视网膜学习

Text as Illumination: Spatial Contrastive Retinex Learning for Language-guided Medical Image Segmentation

应用与实践视觉感知与空间理解

摘要

语言引导的医学图像分割(LMIS)显示出通过整合临床文本信息来改善解剖结构和病变描绘的巨大潜力。现有方法通常依赖于文本和视觉特征之间的隐式交互或辅助粗粒度监督来进行跨模式对齐。然而,这些方法缺乏明确和细粒度的约束来确保语义一致性,导致语言和分割输出之间的不匹配。为了解决这个问题,我们提出了文本作为照明 Retinex 网络(TIRNet),这是一种受 Retinex 启发的新型框架,它将文本嵌入视为特征调制的语义照明,从而提高 LMIS 中的语义一致性。 TIRNet 在每个解码器阶段引入了两个集成的关键模块:(1)受 Retinex 启发的文本调制模块(RTMB),它采用正负照明图来增强与文本相关的前景特征并抑制背景干扰; (2) 一致细节补偿模块 (CDCB),它通过以照明可靠性为条件的一致性门控机制选择性地恢复高频细节。此外,我们提出了一种多尺度照明监督损失(MSIS-Loss),包括区域定位对比损失(RGC-Loss)和背景抑制损失(BS-Loss),前者强制跨模态相似性集中在文本相关的前景区域并在背景区域受到抑制,后者为负照明图提供像素级监督,共同确保每个解码器阶段的精确跨模态对齐。对 MosMedData+ 和 QaTa-COV19 数据集的大量实验表明,TIRNet 在 LMIS 中实现了最先进的性能。该代码位于:https://github.com/anaanaa/TIRNet。