论文
T-Gated Adapter:以相邻切片上下文改善医学分割
T-Gated Adapter: A Lightweight Temporal Adapter for Vision-Language Medical Segmentation
摘要
传统上,医学图像分割依赖于完全监督的 3D 架构,该架构需要临床专家提供大量密集的体素级注释,这是一个极其昂贵的过程。视觉语言模型 (VLM) 通过利用从数十亿图像中学习到的广泛视觉语义表示,提供了强大的替代方案。然而,当独立应用于 3D 扫描的 2D 切片时,这些模型通常会产生嘈杂且解剖学上不可信的分割,从而违反了解剖结构的固有连续性。我们提出了一种时间适配器,通过将相邻切片上下文直接注入模型的视觉标记表示来解决这个问题。该适配器包括一个负责 词元级 处固定上下文窗口的时间 Transformer、一个细化切片内表示的空间上下文块,以及一个平衡时间和单切片特征的自适应门。对 FLARE22 数据集中的 30 个标记体积进行训练,我们的方法在 13 个腹部器官中实现了 0.704 的平均 Dice,与没有时间上下文训练的基线 VLM 相比,增益 +0.206。对 BTCV 和 AMOS22 数据集进行零样本评估,得到了 +0.210 和 +0.230 的一致改进,平均跨域性能下降从 38.0% 减少到 24.9%。此外,在 AMOS22 MRI 的跨模态评估中,两个模型均未接受任何 MRI 监督,我们的方法实现了 0.366 的平均 Dice,优于仅在 CT 上训练的完全监督的 3D 基线(DynUNet,0.224),这表明 CLIP 的视觉语义表示比卷积特征更能优雅地跨成像模态进行泛化。