论文
用于多模态理解和生成的解耦视觉语言系统
Decoupled Vision-Language System for Multimodal Understanding and Generation
摘要
我们引入了一种新的多模态 大语言模型 (MLLM) 架构设计 Libra,能够进行多模态理解和生成。 Libra 架构包含一种视觉系统和一种语言系统,通过跨模态桥梁连接。这种设计将自模态建模和跨模态交互解耦,使每种模态能够学习其独特的表示,同时保持有效的跨模态理解。解耦主要在切换注意力模块和切换FFN模块中实现,它们动态路由自模态建模和跨模态交互场景的计算流程。我们评估两个重要设置的有效性:\textbf{Libra-1} 用于仅理解图像到文本设置,\textbf{Libra-2} 用于统一图像到文本理解和文本到图像生成。除了架构设计之外,我们还讨论了标记化、位置编码和监督方面的各种改进。实验表明,专用的 Libra 设计能够实现多模态理解和生成的相互改进,在理解和生成基准上都取得了强劲的性能。