论文

SEGA:光谱能量引导注意力,用于扩散中的分辨率外推 Transformer

SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers

模型架构Transformer

摘要

Diffusion Transformer (DiTs) 已成为文本到图像生成的主要架构,但当生成的分辨率超出其训练范围时,其性能会下降。现有的 无需训练 方法通过修改推理时间注意力行为来缓解这一问题,通常是通过旋转位置嵌入 (RoPE) 外推法与注意力缩放相结合。然而,这些策略在具有不同频率特性的 RoPE 组件上应用统一且与内容无关的缩放,从而在保留全局结构和恢复精细细节之间进行权衡。我们引入 SEGA,这是一种 无需训练 方法,它根据每个去噪步骤中潜在的空间频率结构动态地调整 RoPE 组件的注意力。这种自适应缩放提高了结构连贯性和细节保真度。实验表明,SEGA 持续改进了多个目标分辨率的高分辨率合成,优于最先进的 无需训练 基线。