论文
FrequencyBooster:高保真像素扩散的全频建模
FrequencyBooster: Full-Frequency Modeling for High-Fidelity Pixel Diffusion
摘要
为了规避基于 VAE 的潜在扩散固有的保真度瓶颈和优化偏差,像素空间扩散模型已成为一种引人注目的端到端范例。然而,现有的像素扩散模型通常难以平衡计算效率与高频细节的保留。他们经常采用基于补丁的压缩或受限的本地解码,导致高频和细粒度像素信息被抑制的“频谱妥协”。为了应对这些挑战,我们提出了 \textbf{FrequencyBooster},这是一种新颖的框架,旨在使像素扩散具有全频率建模功能,而无需过高的开销。我们方法的核心是一个高容量解码器,专门提取详尽的高频细节和低频语义,后者源自 Diffusion Transformer (DiT) 主干。与之前为了局部细化而牺牲全局上下文的工作不同,FrequencyBooster 利用高维特征表示来保持全局结构完整性,同时实现卓越的像素级精度。 ImageNet 上的大量实验证明了我们方法的有效性:我们的模型仅在 320 个 epoch 内就以 256 × 256$ 分辨率实现了最先进的 FID \textbf{1.60}。此外,在 512 美元× 512 美元的分辨率下,FrequencyBooster 的 FID 为 \textbf{1.69},显着优于现有的像素空间和潜在空间生成模型。