论文

生成中的设计表示:扩散Transformer中的跨视图类词元对齐

Representation by Design in Generation: Cross-View Class-Token Alignment in Diffusion Transformers

模型训练预训练

摘要

生成学习和表示学习仍然保持不对称的联系:语义表示用于改进扩散生成,而模型自身的表示通常被视为综合的副产品。我们询问是否可以训练扩散模型来学习更强的语义表示而不牺牲生成质量。 SelfFlow 通过将自监督补丁对齐引入到流匹配中,朝这个方向迈出了一步,但其主要收益仍然是更快的收敛和改进的生成。受 DINO 和 iBOT 的启发,我们通过跨视图类词元对齐扩展了该框架,以进一步加强语义表示。具体来说,我们对每个图像形成两个独立的噪声、双时间步观察,并将每个学生类别标记表示与另一个观察中的停止梯度 EMA 教师目标对齐。该目标与继承的流匹配和本地补丁目标联合优化。值得注意的是,虽然附加目标仅作用于类词元,但它增强了类词元和补丁表示。与匹配的双视图基线相比,使用类标记的 ImageNet 线性探测精度提高了 9.4%,使用平均池补丁标记提高了 10.1%,而冻结骨干 VOC2012 分割提高了 3.6 mIoU。这些表示增益是在保持可比较的 ImageNet 一代 FID 的同时实现的。在文本到图像训练中,相同的目标还改进了生成 FID,将匹配检查点处的 FID 从 2.52 降低到 2.37。我们的结果表明,表示不必仍然是生成的副产品,或者仅仅是改进它的工具:它可以直接优化为与生成一起的扩散预训练的一流功能。