论文

自回归视觉生成需要序言

Autoregressive Visual Generation Needs a Prologue

模型架构Transformer

摘要

在这项工作中,我们提出了 Prologue,一种弥合自回归(AR)图像生成中重建生成差距的方法。 Prologue 不是修改视觉标记来满足重建和生成的要求,而是生成一小组放在视觉标记序列前面的序言标记。这些序言标记专门使用 AR 交叉熵 (CE) 损失进行训练,而视觉标记仍然致力于重建。这种解耦设计让我们能够通过 AR 模型的真实分布来优化生成,而不会影响重建质量,我们从 ELBO 角度进一步将其形式化。在 ImageNet 256x256 上,Prologue-Base 在没有无分类器指导的情况下将 gFID 从 21.01 降低到 10.75,同时保持重建几乎不变; Prologue-Large 在没有辅助语义监督的情况下使用标准 AR 模型,达到了具有竞争力的 rFID 0.99 和 gFID 1.46。有趣的是,仅在 AR 梯度的驱动下,序言标记表现出新兴的语义结构:对 16 个序言标记的线性探测达到 35.88% Top-1,远高于标准标记器的前 16 个标记的 23.71%;使用固定序言标记进行重采样保留了类似的高级语义布局。我们的结果提出了一个新的方向:通过引入单独的学习生成表示,同时保持原始表示完整,可以提高生成质量。