论文

PixelU:U 形 Transformer,用于高效的端到端像素扩散

PixelU: A U-Shaped Transformer for Efficient End-to-End Pixel Diffusion

模型架构Transformer

摘要

端到端像素空间扩散模型绕过了潜在扩散模型(LDM)的有损压缩,但难以联合建模高维空间中的低频语义和高频信号。现有的工作严重依赖复杂的像素解码器来缓解这个问题。在本文中,我们通过揭示这些解码器主要补偿速度预测($v$-预测)固有的优化困难来挑战这一趋势。在干净的数据范式($x$-预测)下,它们是多余的。受这一见解的激励,我们提倡简单性而非复杂性,并推出 PixelU,这是一款专为像素空间量身定制的极简单级 U 形扩散 Transformer。 PixelU 放弃了辅助解码器,转而采用零成本跳跃连接,它提供了一条“信息高速公路”,可以直接将未损坏的高频空间细节从浅层路由到深层。为了进一步使骨干网专注于低频语义建模,我们引入了恒定通道空间下采样机制作为自然低通滤波器,它将深层特征压缩为紧凑的低频语义流形。大量实验表明,这种频率解耦可以优于强基线 (JiT-G),而计算成本仅为强基线 (JiT-G) 的 1/3 左右。在 ImageNet 256$\times$256 和 512$\times$512 上,PixelU 分别实现了 1.63 和 1.92 的 FID,超越了最近的像素空间方法,并为端到端扩散模型建立了简单而强大的新范式。