论文
GEAR:用于图像合成的引导式端到端自动回归
GEAR: Guided End-to-End AutoRegression for Image Synthesis
摘要
视觉生成模型通常分两个阶段进行训练。首先训练分词器进行重建,然后冻结,然后对生成器进行离散索引或连续潜在变量的训练。这种解耦使得分词器不知道生成器发现什么容易建模。我们提出了 GEAR(引导式端到端自动回归),它在表示对齐的指导下联合端到端地训练矢量量化 (VQ) 分词器和自回归 (AR) 生成器。主要障碍是输入 AR 模型的 VQ 索引是不可微分的,因此梯度无法到达分词器,直通式估计器就会崩溃。 GEAR 通过码本分配的双重读出解决了这个问题。硬的、单热的分支通过下一个标记预测来训练 AR,而可微分的软分支则带有表示对齐损失,该损失会流回以仅指导标记生成器。因此,AR 模型将其分词器引导至可以更轻松预测的索引分布。这将对齐负担从分词器转移到了 AR:分词器自身的特征变得不太像 DINOv2,而 AR 则变得更像,这与使潜在本身语义化的扩散侧配方相反。相对于强大的 LlamaGen-REPA 基线,GEAR 将 ImageNet gFID 收敛速度提高了 10 倍,学习明显更好的块级和空间相干特征,并在量化器(VQVAE、LFQ、IBQ)和文本到图像生成之间进行泛化。