论文
VolDiT:具有扩散功能的可控体积医学图像合成 Transformer
VolDiT: Controllable Volumetric Medical Image Synthesis with Diffusion Transformers
摘要
扩散模型已成为高保真医学图像合成的主要方法。然而,大多数现有的 3D 医学图像生成方法依赖于潜在扩散框架内的卷积 U-Net 主干。虽然有效,但这些架构强加了强烈的局部性偏差和有限的感受野,这可能会限制可扩展性、全局上下文集成和灵活的调节。在这项工作中,我们介绍了 VolDiT,这是第一个纯粹基于 Transformer 的 3D 扩散 Transformer,用于体积医学图像合成。我们的方法通过体积补丁嵌入和直接在 3D 词元上运行的全局自注意力,将扩散 Transformer 扩展到原生 3D 数据。为了实现结构化控制,我们提出了一种时间步门控控制适配器,它将分段掩码映射到可学习的控制词元中,这些控制词元在去噪期间调制 Transformer 层。这种 词元级 调节机制可实现精确的空间引导,同时保留 Transformer 架构的建模优势。我们在高分辨率 3D 医学图像合成任务上评估我们的模型,并将其与基于 U-Net 的最先进的 3D 潜在扩散模型进行比较。结果表明,整体一致性得到改善,生成保真度更高,可控性也得到增强。我们的研究结果表明,完全基于Transformer的扩散模型为体积医学图像合成提供了灵活的基础。使用公共数据训练的代码和模型可在 https://github.com/Cardio-AI/voldit 上获取。