论文

FuseReg:随机层融合缩小重建与生成差距

FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders

模型训练预训练

摘要

表示自编码器(RAE)复用预训练视觉编码器的特征作为重建和扩散潜变量,将视觉表示接入图像生成。但 RAE 需要选择哪些编码器层构成生成器与像素解码器共享的潜在空间,其中存在权衡:较浅层通常更好地保留像素细节,较深层则通常得到更好的生成指标。因此,固定的启发式层融合将受益于不同信息的两个阶段耦合起来。我们提出 FuseReg,通过随机采样编码器层的子集训练,替代启发式特征选择。理论分析表明,子集采样会显式惩罚对跨层分歧的敏感性。在采用 DINOv3-L 的 ImageNet-256 上,一个 FuseReg 解码器无需重新训练即可从完整、稀疏或单层融合中重建,PSNR 高于针对固定融合训练的解码器。这种灵活性也有利于生成:保持 RAEv2 DiT-XL 生成器不变,仅替换解码器便使无引导 gFID 降低 27%。相同正则化原则还能用于扩散训练,在 DiT-Base 上联合正则化两个阶段可使无引导 gFID 降低 29%。这些结果表明,让下游模型适应不同层融合,可以在不修改预训练编码器的情况下缩小重建与生成之间的差距。

FuseReg与RAEv2在不同编码器层融合方式下的解码特征余弦相似度图。
图2(图注摘要):FuseReg与RAEv2在不同编码器层融合方式下的解码特征余弦相似度图。