论文

无瓶颈统一多模态模型的表示强迫

Representation Forcing for Bottleneck-Free Unified Multimodal Models

模型架构混合架构

摘要

统一多模态模型(UMM)旨在在单个模型中处理感知和生成。然而,现有的 UMM 仍然依赖于冻结的、单独预训练的 VAE 来生成图像,从而造成了结构瓶颈。天真地删除它会带来质量差距,因为模型必须从原始像素中学习高级结构和低级细节。在本文中,我们提出了表示强制(RF),这是一种通过使表示预测成为模型的本机功能来缩小这一差距的技术。具体来说,RF 迫使解码器以自回归方式预测视觉表示作为像素之前的中间标记;然后,这些标记留在上下文中以指导同一主干内的像素扩散。通过将感知输出的表征转化为生成目标,RF 消除了对任何外部生成潜在空间的需求。我们发现射频有利于理解和生成。在图像生成方面,我们的带有 RF 的像素空间模型与最先进的基于 VAE 的统一模型相匹配。在图像理解方面,像素空间 RF 通常优于其基于 VAE 的变体。总之,这些结果为实现端到端、无瓶颈 UMM 迈出了有效的一步。