论文

使用一维语义标记器生成端到端自回归图像

End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer

应用与实践内容创作

摘要

自回归图像建模依赖于视觉分词器将图像压缩为紧凑的潜在表示。我们设计了一个端到端的训练管道,联合优化重建和生成,从而实现从生成结果到分词器的直接监督。这与之前分别训练分词器和生成模型的两阶段方法形成鲜明对比。我们进一步研究利用视觉基础模型来改进自回归建模的一维分词器。我们的自回归生成模型取得了强有力的实证结果,包括在没有 ImageNet 256x256 生成指导的情况下,最先进的 FID 得分为 1.48。