论文

等待信号:简单的频率感知流量匹配

WaiT for the Signal: Simple Frequency-Aware Flow-Matching

模型训练预训练

摘要

随着图像生成模型的分辨率越来越高,全局一致性、局部细节和纹理保真度成为生成质量的关键轴。然而,标准流量匹配统一处理所有空间频率,忽略固有频率层次结构,其中高频带比粗糙结构更早地与纯噪声无法区分。我们引入了 Wait,一种小波感知图像 Transformer,它通过无损小波将生成分解为粗带和细带。顾名思义,高频段等待信号:保持纯噪声,直到出现粗结构,然后加入流程进行联合细化。由于标准 FID 通过积极的下采样丢弃细粒度细节,因此我们引入了更严格的三轴评估协议来评估原始分辨率下的质量。在 ImageNet 512x512 上,WaT 实现了 1.43 的像素空间 FID,并且在所有三个轴上都是帕累托最优,从而减少了高达 50% 的采样计算量。借助我们最大的 2B 模型,我们为 ImageNet 512 分辨率的像素空间模型设置了新的最先进的 FID 1.3。我们的公式在纹理保真度方面甚至优于最强的潜在空间模型,并无缝缩放到高分辨率 OpenImages 和视频生成,在 Kinetics-600 上实现最先进的 0.84 FVD,无需算法修改。