论文

多模态流:嵌入空间中语言和视觉的统一流建模

Multimodal Flow: Unified Flow Modeling of Language and Vision in Embedding Spaces

模型架构新型架构

摘要

我们提出了多模态流,这是一种完全连续的语言和视觉生成模型。大多数统一的多模态模型要么将语言和量化图像建模为离散标记,要么将离散语言预测与连续图像生成结合起来。前者引入了视觉量化瓶颈。后者需要依赖于模态的目标和抽样程序。完全连续建模避免了这些权衡,并实现了共享的生成过程,但多模态预训练的探索仍未充分。多模态流引入了一个统一的连续架构,它将多模态连续表示与共享的块因果流主干集成在一起。它将文本块和图像组织为有序的连续超块,保留文本标记顺序和视觉空间结构。主干网络通过流匹配在这些超块上学习单个向量场。联合注意力可以实现跨模态交互,而特定模态的前馈网络则处理每种模态。该模型在训练期间并行预测多个目标块,并在推理时顺序生成超块。我们实例化 MF-1 并在多模态数据上对其进行预训练。在 0.6B、1.2B 和 1.6B 尺度上,持续预训练持续改进多模态建模。仅用 150B 预训练 token,MF-1 在 GenEval 和 DPG-Bench 上的平均得分为 82.8,在 VQAv2、MMBench 和 POPE 上的平均得分为 75.3,与在更多数据上训练的统一模型相比仍然具有竞争力。在匹配的数据、优化和参数预算下,多模态流的性能进一步优于代表性的混合模型和离散模型。这些结果建立了基于连续块的嵌入流建模作为统一多模态建模的新的完全连续范例。相关代码和模型公开于https://github.com/hustvl/Multimodal-Flow.