论文

通过网络修剪的跨分辨率扩散模型

Cross-Resolution Diffusion Models via Network Pruning

摘要

扩散模型已经展示了令人印象深刻的图像合成性能,但许多基于 UNet 的模型都是在某些固定分辨率下进行训练的。当以训练之外的分辨率生成图像时,它们的质量往往会下降。我们将此问题追溯到与分辨率相关的参数行为,其中在默认分辨率下运行良好的权重在空间尺度发生变化时可能会变得不利,从而削弱语义对齐并导致 UNet 架构中的结构不稳定。基于此分析,本文介绍了 CR-Diff,这是一种通过修剪扩散模型的一些参数来提高跨分辨率视觉一致性的新方法。具体来说,CR-Diff 有两个阶段。它首先执行分块剪枝以选择性地消除不利权重。然后,进行剪枝输出放大以进一步纯化剪枝预测。根据经验,大量实验表明 CR-Diff 可以提高各种扩散主干和未见过的分辨率的感知保真度和语义一致性,同时在很大程度上保留默认分辨率下的性能。此外,CR-Diff 支持特定于提示的细化,从而能够按需提高质量。