论文

用于视觉合成的生成细化网络

Generative Refinement Networks for Visual Synthesis

模型架构新型架构

摘要

虽然扩散模型在视觉生成领域占据主导地位,但它们的计算效率较低,无论复杂程度如何,都应用统一的计算工作。相比之下,自回归 (AR) 模型本质上是复杂性感知的,其可变可能性就证明了这一点,但经常受到有损离散标记化和错误累积的阻碍。在这项工作中,我们介绍了生成细化网络(GRN),这是一种解决这些问题的下一代视觉合成范例。 GRN 的核心是通过理论上近乎无损的分层二进制量化 (HBQ) 解决离散标记化瓶颈,实现与连续对应物相当的重建质量。 GRN 建立在 HBQ 的潜在空间之上,通过全局细化机制从根本上升级了 AR 生成,逐步完善和修正艺术品——就像人类艺术家的绘画一样。此外,GRN 集成了熵引导采样策略,可在不影响视觉质量的情况下实现复杂性感知、自适应步骤生成。在 ImageNet 基准上,GRN 在图像重建(0.56 rFID)和类条件图像生成(1.81 gFID)方面创造了新记录。我们还将 GRN 扩展到更具挑战性的文本到图像和文本到视频生成,从而在同等规模上提供卓越的性能。我们发布所有模型和代码以促进 GRN 的进一步研究。