论文

广义多模态基础模型

Generalized Multimodal Foundation Model

模型训练预训练

摘要

利用多模态数据进行预测广泛应用于各种场景。现有的多模态融合模型一旦部署,只能处理预定义的模态(例如视觉、文本和音频)和单一任务,难以快速适应新的下游应用。因此,一个自然但相当激进的问题出现了,是否存在可以应用于任意模态组合和任意预测任务的通用多模态融合模型。我们认为,统一的多模态融合模型不应依赖于特定模态,而应编码多模态相关性的可转移模式。为此,我们提出了一种简单有效的学习范式,基于对具有多种因果结构的大规模合成多模态数据集的生成进行训练,这些数据集正式表征了现实世界中多模态数据的生成过程。在此框架的基础上,我们提出了广义多模态基础模型,这是广义多模态学习的统一基础模型。通过构建具有不同相关模式的大规模合成多模态数据集,我们的模型在训练期间对可转移的多模态相关性进行编码,并在推理过程中通过上下文示例激活适当的关联。对涵盖 12 种模式和 11 项预测任务的 18 个现实数据集进行的广泛实验表明,我们的模型无需针对特定任务进行调整即可实现与专用模型的竞争性能。