论文

RAE-AR:用表征自编码器驯服自回归模型

RAE-AR: Taming Autoregressive Models with Representation Autoencoders

模型训练预训练

摘要

生成式建模的潜空间长期由VAE编码器主导。来自预训练表征编码器(如DINO、SigLIP、MAE)的潜变量此前被认为不适合生成式建模。近期,RAE方法点燃了希望,揭示出表征自编码器也能取得与VAE编码器相当的性能。然而,将表征自编码器融入连续自回归(AR)模型仍基本未被探索。在本工作中,我们研究在AR范式下使用高维表征自编码器所面临的挑战,记为RAE-AR。我们聚焦AR模型的独特性质,识别出两大主要障碍:复杂的逐token分布建模,以及被高维放大的训练-推理差距(曝光偏差,exposure bias)。为解决这些问题,我们引入通过分布归一化实现的token简化,以降低建模难度并改善收敛。此外,我们在训练过程中加入高斯噪声注入以缓解曝光偏差,增强预测稳健性。实证结果表明,这些改进显著缩小了性能差距,使表征自编码器在AR模型上取得与传统VAE相当的结果。这项工作为视觉理解与生成建模之间更统一的架构铺平了道路。

RAE-AR:用表征自编码器驯服自回归模型:论文配图
图1:将表征自编码器引入AR模型的两大挑战——token方差与曝光偏差,并对应给出token归一化与噪声扰动两种策略。