论文

ThyCLIPNet:BiomedCLIP 引导的轻量级注意力增强 DeepLabV3+ 框架,用于稳健的甲状腺结节分割

ThyCLIPNet: A BiomedCLIP-Guided Lightweight Attention-Enhanced DeepLabV3+ Framework for Robust Thyroid Nodule Segmentation

应用与实践行业应用

摘要

准确的甲状腺超声分割常常受到低对比度、散斑噪声和边界不清晰的挑战。尽管最近的方法提高了分割精度,但许多方法依赖于资源密集型架构或缺乏多尺度特征与全局生物医学视觉指导的明确集成。在本文中,我们介绍了 ThyCLIPNet,这是一种新颖的轻量级语义引导混合编码器-解码器框架,它将 BiomedCLIP 衍生的生物医学语义指导集成到轻量级多尺度 CNN 分割管道中,同时保持较低的计算开销。该编码器将 MobileNetV2 与高效通道注意力相结合,以细化分层多尺度特征,而自适应的空洞空间金字塔池化模块与瓶颈处的自定义卷积块注意力模块相结合,以丰富语义上下文并细化特征。该解码器将分层跳跃连接和轻量级注意力细化与 BiomedCLIP 引导的门控融合路径相结合,将仅视觉的全局生物医学嵌入投射到解码器特征空间中,并通过语义局部融合和空间门控在较低分辨率阶段选择性地集成它们。据我们所知,ThyCLIPNet 是首批采用这一方案的轻量级甲状腺超声分割框架之一,仅使用 BiomedCLIP 的视觉编码器进行仅图像全局语义指导,无需文本提示。这种仅图像语义调节策略特别适合甲状腺超声数据集,该数据集提供图像和分割掩模,而无需配对临床文本。对四个公开的甲状腺超声数据集 TG3K、TN3K、DDTI 和 PKTN 进行的广泛实验证明了 ThyCLIPNet 的有效性。该模型的Dice相似度系数分别为96.22%、87.58%、84.73%和80.70%;交并比分别为 92.72%、77.91%、73.51% 和 67.64%;和第95百分位Hausdorff距离分别为 3.75、16.38、18.23 和 10.86。这些结果证明了所评估的数据集具有竞争性的分割性能,同时保持了 8.55 M 参数和 22.99 G FLOP 的紧凑分割级配置。总体而言,研究结果支持选择性地将全局生物医学语义指导与轻量级多尺度 CNN 表示相结合,作为稳健且计算高效的甲状腺超声分割的有效策略。我们提出的模型的源代码可公开获取:https://github.com/Tasnim-Jahan/ThyCLIPNet

ThyCLIPNet:BiomedCLIP 引导的轻量级注意力增强 DeepLabV3+ 框架,用于稳健的甲状腺结节分割的原论文方法或结果图
图 1:预处理和数据增强流程的图示:超声图像和掩模的大小调整为 256$\times$256 并标准化;应用特定于数据集的离线增强;从原始图像和增强图像中提取 512 维 BiomedCLIP 嵌入;对图像和嵌入执行动态在线增强;所得数据被输入到训练的分割模型中。