论文
用于生成高质量图像的频率感知流量匹配
Frequency-Aware Flow Matching for High-Quality Image Generation
摘要
通过学习逆转逐渐增加高斯噪声的损坏过程,流匹配模型已成为现实图像生成的强大框架。然而,由于噪声被注入到潜在域中,因此它对不同频率分量的影响是不均匀的。因此,在推理过程中,流匹配模型往往会在早期阶段生成低频成分(全局结构),而高频成分(精细细节)则在逆向过程的后期才出现。基于这一见解,我们提出了频率感知流匹配(FreqFlow),这是一种通过时间相关自适应权重将频率感知调节明确纳入流匹配框架的新颖方法。我们引入了一个两分支架构:(1)一个频率分支,分别处理低频和高频分量,以捕获全局结构并细化纹理和边缘;(2)一个空间分支,在频率分支输出的引导下合成潜在域中的图像。通过将频率信息显式集成到生成过程中,FreqFlow 可确保对大规模相干性和细粒度细节进行有效建模,低频调节可增强全局结构,而高频调节可增强纹理保真度和细节清晰度。在类条件 ImageNet-256 生成基准上,我们的方法实现了最先进的性能,FID 为 1.38,分别超过了先前的扩散模型 DiT 和流匹配模型 SiT 0.79 和 0.58 FID。代码可在 https://github.com/OliverRensu/FreqFlow 获取。