论文

Tuna-2:像素嵌入击败视觉编码器以实现多模态理解和生成

Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

模型架构新型架构

摘要

统一的多模态模型通常依赖于预训练的视觉编码器,并使用单独的视觉表示来理解和生成,从而在两个任务之间造成错位,并阻止原始像素的完全端到端优化。我们引入了 Tuna-2,这是一种原生统一多模态模型,可直接基于像素嵌入执行视觉理解和生成。 Tuna-2 通过使用简单的补丁嵌入层对视觉输入进行编码,大大简化了模型架构,完全放弃了模块化视觉编码器设计,例如 VAE 或表示编码器。实验表明,Tuna-2 在多模态基准测试中实现了最先进的性能,证明统一像素空间建模可以与潜在空间方法充分竞争高质量图像生成。此外,虽然基于编码器的变体在早期预训练中收敛得更快,但 Tuna-2 的无编码器设计可以在规模上实现更强的多模态理解,特别是在需要细粒度视觉感知的任务上。这些结果表明,预训练的视觉编码器对于多模态建模来说并不是必需的,并且端到端像素空间学习为生成和感知提供了一条可扩展的路径,以实现更强的视觉表示。