论文

UniSpace:统一视觉表示和可扩展多模态建模

UniSpace: Unified Visual Representation and Scalable Multimodal Modeling

模型架构Transformer

摘要

语义视觉编码器已成为图像生成中多模态理解和语义调节的中央视觉界面。然而,它们的最终标记丢弃了细粒度的视觉细节,导致像素重建效果不佳,并限制了它们在图像生成和编辑等重建敏感任务中的使用。在这项工作中,我们询问是否可以在从预训练的语义 ViT 构建的单个视觉表示空间中对理解、生成和编辑进行建模。我们表明,语义 ViT 的冻结 Transformer 块本质上并非无法保留视觉细节。相反,原始补丁参数化将表示推向语义抽象,使得细粒度信息难以从最终标记中恢复。基于这一观察,我们引入了 \emph{Patch Reparameterization},它保留了原始语义路径,同时添加了重建感知的补丁嵌入,为相同的冻结 ViT 块提供了细粒度的视觉信息。由此产生的统一表示保留了多模态理解,同时实现高保真图像重建和有利的重建-生成权衡。我们进一步将此表示扩展为 \emph{UniSpace},这是一个 8B Mixture-of-Transformer-Experts 模型,可以在同一视觉空间中执行理解、生成和编辑,而无需单独的 VAE 路径。系统级评估展示了实用的文本到图像生成和基于指令的图像编辑,表明重新参数化的预训练 ViT 可以作为可扩展多模态建模的统一视觉界面。