论文
超级采样稳定扩散及其他:使用常见插值方法缩放神经网络的无缝 无需训练 方法
Supersampling Stable Diffusion and Beyond: A Seamless, Training-Free Approach for Scaling Neural Networks Using Common Interpolation Methods
摘要
稳定扩散 (SD) 通过在潜在空间而不是特征空间中进行去噪,显着地发展了基于 DDPM(去噪扩散概率模型)的图像生成。由于成本和计算障碍显着降低,基于 DDPM 的图像生成得到了普及。然而,这些模型只能根据其训练配置生成固定分辨率的图像。当我们尝试生成更高分辨率时,生成的图像始终显示对象重复伪影。为了在不微调 SD 模型的情况下解决这个问题,最近的工作尝试扩大模型的卷积核,并取得了很大的成功。但由于零间隙,膨胀内核更难微调。除此之外,其他方法(例如修补扩散)无法有效解决对象重复问题。因此,为了克服扩张卷积的局限性,我们提出了 SD 模型的核插值来生成更高分辨率的图像。在这项工作中,我们从数学上证明,如果乘以常数系数,插值可以正确缩放卷积核,并在使用零训练的稳定扩散生成超出训练分辨率的图像方面取得有竞争力的经验结果。此外,我们证明我们的方法能够使深度神经网络插值适应更高维度的训练数据,最坏情况下准确度和 F1 分数相对于基线性能下降 2.6\%$。这表明我们的方法具有普遍的适用性,我们可以插入全连接层,超越卷积层。我们还讨论了如何使用我们的方法减少训练神经网络的内存占用至少 $4\times$。