论文

像素扩散的对抗训练

Adversarial Training for Pixel Diffusion

模型训练强化学习

摘要

像素扩散模型直接生成 RGB 图像,避免了自动编码器的瓶颈,但它们的输出仍然系统性地不足以代表精细尺度的自然图像统计数据。我们证明对抗性学习为这一缺陷提供了有效的训练后纠正。从预训练模型开始,我们保留其原始扩散或流匹配目标,并在非高噪声时间步长的预测输出中添加对抗性损失,使模型架构和采样程序保持不变。据我们所知,这是对像素扩散的对抗性后训练的第一个系统研究。在两个像素主干上,该方法共同提高了分布保真度、覆盖范围、即时对齐和感知质量。我们进一步研究它为何有效。频带和幂律分析表明,原始模型系统地生成了自然图像高频内容,而对抗性后训练则恢复了这种缺失的频谱功率。相反,感知损失也会增加高频内容,但会牺牲分布保真度和及时对齐。最近邻、召回和匹配的非 GAN SFT 控制进一步排除了记忆、模式丢弃和额外的优化作为简单的解释。最后,我们检查这种效应的边界。在测试的潜在扩散配置下,相同的过程不会产生可比较的联合增益,并且几乎不增加解码的高频功率。这些结果表明,对正在校正的图像统计数据的直接输出访问是控制对抗性后训练成功的关键因素。