论文
HyperDiT:用于高保真像素空间扩散的超连接 Transformer
HyperDiT: Hyper-Connected Transformers for High-Fidelity Pixel-Space Diffusion
摘要
像素空间扩散模型绕过了变分自动编码器(VAE)的重建瓶颈,但面临着一个基本的“粒度困境”:捕获全局语义有利于大块尺度,而生成高保真细节则需要细粒度的输入。为了解决这个问题,我们提出了 HyperDiT,这是一个建立超连接跨尺度交互以桥接语义和像素流形的统一框架。与 AdaLN 注入语义不同,HyperDiT 利用交叉注意力机制,使细粒度词元能够全局查询多级语义锚。为了解决多尺度交互过程中的空间不匹配问题,我们引入了尺度感知旋转位置嵌入(SA-RoPE),以确保不同补丁大小的标记之间的精确几何对齐。此外,我们结合寄存器来从预训练的视觉基础模型(VFM)中学习密集语义,有效减少幻觉和伪影的产生。大量实验表明,HyperDiT 直接在像素空间内在 ImageNet $256\times256$ 上实现了 $\mathbf{1.56}$ 的最先进 (SoTA) FID。通过将细粒度流与语义指导相结合,HyperDiT 为高保真像素生成提供了卓越的范例。