论文
从 SRA 到自流:数据增强还是自我监督?
From SRA to Self-Flow: Data Augmentation or Self-Supervision?
摘要
表示对齐已成为加速扩散 Transformer 训练和提高生成质量的有效方法。最近的自对准方法,例如 SRA 和 Self-Flow,通过在扩散模型本身内构建对准,进一步消除了对外部预训练编码器的依赖。然而,从 SRA 到自流、双时间调度的改进背后的机制仍未得到充分研究:自流将其增益归因于不同噪声水平下词元之间的交互,其中更干净的词元有助于推断噪声更大的词元。在这项工作中,我们重新审视这一解释,并询问增益是否来自沿噪声维度的数据增强。为了理清这些因素,我们引入了注意力分离,它保留了与自流相同的双时间步输入,同时阻止分配给不同噪声级别的标记之间的注意力。令人惊讶的是,消除这种交互并不会降低性能,甚至可以提高性能,这表明从 SRA 到 Self-Flow 的改进主要来自数据增强。此外,我们表明注意力分离本身通过将单个图像分割成多个有效的训练部分来扩展训练数据来提供增强效果。基于这些观察,我们将自我表示对齐与双时间步和注意力分离增强相结合,并在 ImageNet 上证明了这种设计的有效性。