论文

Vision Transformer-Conditioned UNet,用于域自适应语义分割

Vision Transformer-Conditioned UNet for Domain-Adaptive Semantic Segmentation

模型架构混合架构

摘要

语义分割对于分析生物医学研究中的解剖特征至关重要,但 Vision Transformer (ViTs) 在该领域仍然存在性能差距,特别是对于稀疏、精细结构和低信噪比的目标。我们将这一挑战部分归因于提示 ViT 模型中常用的轻量级像素解码器,这些解码器可能缺乏高精度生物医学掩模所需的局部感应偏置。我们通过引入 ViTC-UNet 来弥补这一差距,它通过可学习的标记和双向注意力解码器将 UNet 置于冻结的预训练 ViT 表示上。这将 ViT 全局视觉先验与 UNet 的局部归纳偏差和高分辨率解码能力相结合,同时即使在跨域设置中也避免了端到端 ViT 微调。 ViTC-UNet 在跨 MRI 和 CT 模式的语义分割任务中优于基线结果,表明结构条件 UNet 解码可以有效地将大规模视觉先验适应高复杂性的生物医学分割。