论文

ViTok-v2:将本机分辨率自动编码器扩展到 50 亿个参数

ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters

应用与实践内容创作

摘要

Vision Transformer (ViT) 自动编码器已成为引人注目的图像标记器,与卷积标记器相比,提供了改进的重建。然而,现有的 ViT 标记器无法探索这一领域,因为在训练分辨率之外性能会下降,并且对对抗性损失的依赖会阻碍稳定的扩展。 ViTok(Hansen-Estruch 等人,2025)发现压缩比 r 介导了重建与生成的权衡,其中较低的 r 意味着更好的重建,但生成更困难,因此改进分词器重建是实现帕累托最优分词器的关键。我们引入了 ViTok-v2,它通过 NaFlex 的原生分辨率支持解决了这些限制,以实现跨分辨率和纵横比的泛化,以及一种新颖的 DINOv3 感知损失,它取代了 LPIPS 和 GAN 目标,以实现任何规模的稳定训练。 ViTok-v2 在大约 2B 图像上进行训练,并缩放至 5B 参数,这是迄今为止最大的图像自动编码器。 ViTok-v2 在 256p 下匹配或超过最先进的重建,并在 512p 及以上优于所有基线。在使用流匹配生成器的联合缩放实验中,我们表明缩放自动编码器和生成器都推进了这种权衡的帕累托前沿。