论文

医学潜在扩散的可学习性差距

The Learnability Gap in Medical Latent Diffusion

模型评测模型行为与机制分析

摘要

使用潜在扩散模型的生成数据增强是解决医学成像中类别不平衡的一种有前景的策略,但当前的方法侧重于感知保真度和特定领域的自动编码器 微调,而忽略了更基本的瓶颈。我们识别并形式化了可学习性差距:大规模预训练自动编码器忠实地编码了医学分类的判别性特征,正如重建空间中近乎无损的性能所证明的那样,但它们的潜在表示的结构方式是分类器难以学习的。在五个自动编码器系列和涵盖胸部放射成像、皮肤镜检查、计算机断层扫描和超声心动图的四个医学基准中,我们表明,无论架构、初始化策略或超参数调整如何,这种差距仍然存在,并且自动编码器的医学领域 微调 并不能弥补这一差距。为了探测并部分缩小差距,我们开发了具有 FiLM 层和图像空间 蒸馏 的噪声调节潜在分类器,其吞吐量比图像空间模型高出 64 倍,内存增益提高了 120 倍,同时充当潜在空间质量的诊断工具。我们的分析提供了一个用于评估自动编码器潜在空间的新框架,并确定其结构,而不是其保真度或领域特异性,是缩小真实和合成医学训练数据之间性能差距的主要障碍。