论文

VFMTok:用冻结视觉基础模型构建通用图像编码器

Vision Foundation Models as Generalist Tokenizers for Image Generation

模型优化模型压缩

摘要

在这项工作中,我们探索了直接在冻结视觉基础模型(VFM)之上构建通用图像标记器的很大程度上尚未探索的方向。为了构建这个分词器,我们利用冻结的 VFM 作为编码器,并引入两项关键创新:(1) 区域自适应量化框架,用于消除标准 2D 网格特征中的空间冗余;(2) 语义重建目标,将解码输出与 VFM 的表示对齐,以保持语义保真度。基于这些设计,我们提出了 VFMTok,一种通用的视觉分词器,能够在离散和连续的潜在空间中无缝运行。 VFMTok 显着提高了合成质量,同时大幅提高了词元效率。对于离散自回归(AR)生成,它使模型收敛速度加快了 \textbf{3 倍},并在 ImageNet 类别条件生成上实现了 \textbf{1.36} 的最先进 gFID。类似地,对于连续空间生成,将 VFMTok 与去噪模型集成会产生 \textbf{1.25} 的特殊 gFID。此外,由于潜在空间本质上捕获了丰富的空间语义,VFMTok 可以在两种生成范式中实现高保真类条件合成,而无需无分类器指导(\textbf{w/o CFG}),从而显着加快推理速度。除了这些显着的实证结果之外,我们还系统地研究了我们方法的潜在机制。我们发现,VFM 预训练 期间使用的特定自监督学习目标决定了其作为标记器的有效性。具体来说,与全局对比学习和潜在掩模图像建模联合优化的 VFM 为图像标记化提供了最佳表示。这些见解为未来图像标记器的设计奠定了坚实的基础并提供了宝贵的指导。