论文
超越逐点匹配:加速扩散的结构表示对齐 Transformer
Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers
摘要
Diffusion Transformer (DiTs) 的最新进展表明,将噪声潜在状态与训练有素的语义特征对齐(如表示对齐 (REPA) 所倡导的那样)可以大大加速训练并提高生成保真度。随后的分析(例如 iREPA)表明,这些增益主要来自于传输预先训练的视觉表示中包含的空间结构。然而,大多数现有的对齐方法采用逐点匹配目标或依赖于隐式架构调整,这无法对视觉基础模型中固有的空间关系几何进行显式建模。我们认为,这种逐元素的监督不足以捕获视觉表示的丰富空间拓扑,并且生成的有效对齐应该被制定为显式的结构约束。为此,我们提出了 sREPA,一种结构表示对齐框架,用于强制特征图关系几何的一致性,而不仅仅是匹配单个特征点。与最先进的对齐策略相比,通过鼓励模型将整体空间布局和来自预训练特征的结构相关性内化,sREPA 实现了更快、更稳定的收敛,并提高了样本质量。我们的代码和模型将被发布。