论文

冻结像素空间扩散模型可以用自己的样本进行自我引导

A Frozen Pixel-Space Diffusion Model Can Guide Itself with Its Own Samples

模型评测基准与评测资源

摘要

像素空间扩散模型旨在直接在原始像素上学习端到端生成器。这是具有挑战性的,因为单个模型必须捕获同一高维空间中的全局结构和局部纹理。虽然最近的工作通过替代预测目标、训练目标和架构改善了像素扩散,但这些进步通常需要从头开始训练新模型。我们证明有一种更便宜的补充策略:\textbf{冻结的、预训练的像素扩散模型可以自我引导}。我们的主要观察结果是,预训练像素扩散 Transformer 的中间层可以解码为捕获主要低频结构的粗略预测,而最终层则逐步细化局部高频细节。因此,我们将轻量级预测头附加到中间层,保持骨干网冻结,并使用中间预测和最终预测之间的差异作为采样期间的自我引导方向。为了训练这个大脑,我们进一步发现真实图像并不是必需的。相反,模型生成的样本足以甚至优于真实图像来训练头部,特别是在增强像素扩散往往不适合的高频分量方面。在 ImageNet 上的多个像素扩散模型中,我们的 \textbf{合成自指导 (SSG)} 持续改进生成,而适配器训练需要不到 1$\%$ 的完整 模型训练 计算:它在没有无分类器引导 (CFG) 的情况下,在评估的 JiT 变体中将 FID 减少了 50$\%$ 以上,并进一步提高了 CFG 的强基线,例如,JiT-H/16 从 1.86到 1.67,PixelREPA-H/16 从 1.81 到 1.59。我们的代码可在 https://github.com/zfu006/SSG 获取。