论文
GenFirst:重构前的生成,实现稳定的端到端潜在生成建模
GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling
摘要
潜在生成模型通常遵循两阶段流程,训练变分自动编码器进行重建,然后在冻结的潜在空间上训练生成模型。由于重建优化的潜在模型不一定对生成友好,因此联合训练两个模型是一种有吸引力的选择。然而,直接的端到端训练仍然具有挑战性,因为它很容易出现潜在崩溃并面临代重建冲突。我们通过分析不同的目标如何塑造潜在空间并确定两个关键见解来重新审视这个问题。首先,Kullback-Leibler 散度目标中的熵项对于防止崩溃至关重要:重建和先验拟合往往会缩小后验,而熵则保留了非简并的潜在不确定性。其次,重建和生成表现出不对称的学习动态:重建速度快且受到严格监督,而生成速度较慢且难以优化。基于这些见解,我们实现了第一个没有潜在崩溃的直接端到端训练,并提出了 GenFirst,一种简单的重建前生成策略。生成目标首先在弱重建压力下塑造潜在空间,然后逐步加强重建以恢复视觉细节。我们使用具有精确似然的连续自回归先验和具有隐式似然的 SiT 先验来验证 GenFirst。通过我们的端到端目标和 GenFirst,SiT 在 ImageNet-256 上使用 CFG 时的 gFID 为 0.97,不使用 CFG 时为 1.45,而 MMDiT 在文本到图像生成方面的 GenEval 得分为 0.90。除了图像生成之外,我们还将框架扩展到用于生成和表示学习的共享视觉潜伏,以及连续的统一文本图像生成。这些结果证明了跨生成先验和模式的稳定的端到端潜在学习的普遍性。