论文

具有共享上下文视觉分词器的统一多模态自回归建模是统一的关键

Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification

模型架构新型架构

摘要

统一多模态建模旨在将视觉理解和生成集成到单个系统中。然而,现有的方法通常依赖于两个不同的视觉分词器,这会分割表示空间并阻碍真正的统一建模。我们提出了 UniAR,一个统一的自回归框架,其中单个离散视觉标记器充当理解和生成之间的关键桥梁,从而实现共享上下文,其中模型可以直接解释其自己生成的视觉标记,而无需额外的重新编码。 UniAR 采用具有多级特征融合和免查找按位量化方案的预训练视觉编码器,保留高级语义和底层细节,同时以最小的成本扩展有效的视觉词汇。在此基础上,统一自回归模型采用并行按位预测来联合预测空间分组的多级视觉代码,大大减少视觉序列长度并加速生成。最后,基于扩散的视觉解码器对离散视觉标记进行操作以解码高保真图像。通过大规模 预训练、监督式 微调 和强化学习,UniAR 在图像生成和图像编辑方面实现了最先进的性能,同时在多模态理解基准上保持竞争力。该项目页面位于 https://sharelab-sii.github.io/uniar-web。