论文

CrossFlow:跨潜在空间和像素空间的一步生成

CrossFlow: One-Step Generation Across Latent and Pixel Spaces

模型训练预训练

摘要

大多数扩散和流匹配生成器在同一表示空间中定义先验、概率路径和预测目标。潜在扩散通过将该路径移动到自动编码器潜在空间中来提高效率,但最终样本仍然由单独训练的解码器产生。这种分离会造成不匹配:生成器针对潜在空间预测进行了优化,而最终质量取决于解码器如何处理可能与干净编码器输出不同的生成潜在。我们引入了 CrossFlow,一种跨空间流公式,可将噪声潜在输入直接映射到像素空间图像。关键的技术步骤是无速度的一步目标:潜在轨迹定义训练路径,但监督预测是图像而不是潜在位移。这使得一个模型既可以充当单步潜在像素生成器,又可以充当潜在扩散管道的解码器替代品。在 $256\times256$ 的类条件 ImageNet-1k 上,CrossFlow-XL 通过一次函数评估实现了 1.62 FID。消融表明,潜在编码器和像素空间感知和对抗性损失对于保真度非常重要。这些结果表明,跨空间流目标可以将潜在表示的效率与直接像素空间监督相结合,而无需在推理时使用单独的解码器。