论文

VibeToken:缩放一维图像分词器和自回归模型以实现动态分辨率生成

VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations

模型架构新型架构

摘要

我们引入了一种高效的、与分辨率无关的自回归 (AR) 图像合成方法,该方法可推广到任意分辨率和纵横比,从而缩小与扩散模型的差距。其核心是 VibeToken,这是一种新颖的、与分辨率无关的、基于 1D Transformer 的图像标记器,可将图像编码为动态、用户可控的 32-256 个标记序列,实现最先进的效率和性能权衡。在 VibeToken 的基础上,我们推出了 VibeToken-Gen,这是一种类条件 AR 生成器,具有对任意分辨率的开箱即用支持,同时需要的计算资源显着减少。值得注意的是,VibeToken-Gen 仅使用 64 个词元即可合成 1024x1024 图像,并实现 3.94 gFID;相比之下,基于扩散的最先进替代方案需要 1,024 个词元并获得 5.87 gFID。与 LlamaGen 等固定分辨率 AR 模型相比,其推理 FLOP 随分辨率呈二次方增长(1024x1024 时为 11T FLOP),VibeToken-Gen 保持恒定的 179G FLOP(63.4 倍效率),与分辨率无关。我们希望 VibeToken 能够帮助解锁 AR 视觉生成模型在生产用例中的广泛采用。