论文

使用表示自动编码器改进基线

Improved Baselines with Representation Autoencoders

模型架构新型架构

摘要

表示自动编码器 (RAE) 用预训练的视觉编码器取代了传统的 VAE。在本文中,我们系统地研究了几种设计选择,并找到了简化和改进 RAE 的三个见解。首先,我们研究一个广义的公式,其中表示被定义为最后 k 个编码器层的总和,而不仅仅是最后一层。这个简单的改变极大地改善了重建,无需编码器微调或专门的数据(例如文本、面部)。其次,我们研究了普遍的假设,即 RAE(使用预训练表示作为编码器)取代了表示对齐(REPA),后者将相同的表示提炼到中间层。通过大规模的实证分析,我们发现了一个令人惊讶的发现:RAE 和 REPA 表现出互补的工作机制,允许将相同的表示用作中间扩散层的编码器和目标。最后,最初的 RAE 难以应对无分类器引导 (CFG),并且需要为自动引导 (AG) 训练第二个较弱的扩散模型。我们证明 REPA 本身可以被视为 RAE 潜在空间中的 x 预测。通过简单地重新参数化 DiT 模型的输出,它就可以“免费”提供指导。总体而言,RAEv2 的收敛速度比原始 RAE 快 10 倍以上,在 ImageNet-256 上仅用 80 个 epoch 就实现了最先进的 gFID 1.06。在 FDr6 上,RAEv2 仅用 80 个 epoch 就达到了最先进的 2.17,而之前没有任何 后训练 的最佳成绩为 3.26(800 个 epoch)。这促使 EPFID@k(达到无引导 gFID < k 的时期)作为训练效率的衡量标准。 RAEv2 的 EPFID@2 为 35 个时期,而原始 RAE 为 177 个时期。我们还在文本到图像生成和导航世界模型的不同设置中验证了我们的方法,显示出一致的改进。该代码可从 https://raev2.github.io 获取。