论文

像素级残余扩散 Transformer:可扩展 3D CT 体积生成

Pixel-Level Residual Diffusion Transformer: Scalable 3D CT Volume Generation

应用与实践内容创作

摘要

由于现有生成模型固有的大量计算需求和优化困难,生成具有精细细节的高分辨率 3D CT 体积仍然具有挑战性。在本文中,我们提出了像素级残留扩散 Transformer (PRDiT),这是一种可扩展的生成框架,可以直接在体素级别合成高质量的 3D 医疗体积。 PRDiT 引入了一个两阶段训练架构,包括 1) 局部降噪器,其形式为基于 MLP 的盲估计器,在重叠的 3D 块上运行,以有效分离低频结构;2) 全局残差扩散 Transformer,采用内存高效的注意力来建模和细化整个体积的高频残差。这种从粗到精的建模策略简化了优化,增强了训练稳定性,并有效地保留了微妙的结构,而不受自动编码器瓶颈的限制。在 LIDC-IDRI 和 RAD-ChestCT 数据集上进行的大量实验表明,PRDiT 始终优于最先进的模型,例如 HA-GAN、3D LDM 和 WDM-3D,显着降低 3D FID、MMD 和 Wasserstein 距离分数。