论文

SRC-Flow:紧凑的语义表示实现图像生成的标准化流程

SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation

应用与实践内容创作

摘要

归一化流 (NF) 提供精确的似然性和确定性可逆采样,但在历史上落后于大规模图像生成的扩散模型。我们发现了一个关键障碍:NF 需要学习整个环境空间中的单个可逆传输,这使得它们对高维表示高度敏感。这导致现代视觉表示空间中的语义能力不匹配,其中语义信息是紧凑的,但编码在过完整的特征中。我们提出了 SRC-Flow,它引入了语义表示压缩器(SRC),在流建模之前将高维 RAE 特征压缩到低维语义空间,并通过冻结的 RAE 解码器保留重建。这种紧凑的空间减少了 NF 的建模负担,并在语义表示空间中实现了基于似然的有效生成。我们进一步采用针对流学习的固定无条件双射量身定制的恒定噪声正则化。在 ImageNet 256x256 和 512x512 上,SRC-Flow 在归一化流方法中实现了最先进的生成质量,在无分类器指导下 gFID 得分为 1.65 和 2.07,同时保留了紧凑语义表示空间中的精确似然计算和流级别的确定性可逆采样。代码和模型将在未来发布。