论文
成对模式下的多模式 LLM
Multimodal LLMs under Pairwise Modalities
摘要
尽管多模态 大语言模型 (MLLM) 取得了令人印象深刻的结果,但它们的训练通常依赖于联合策划的多模态数据,需要大量的人力来构建多路对齐的数据集,从而限制了跨领域的可扩展性。在这项工作中,我们探索仅利用多个配对模态作为完整联合多模态分布的替代来训练 MLLM。具体来说,我们首先对仅通过观察成对模态即可识别表征的条件进行了理论分析。在此分析的基础上,我们提出了一种表示学习框架,用于仅使用成对数据来跨模态对齐潜在表示。该框架由两个阶段组成:潜在表示对齐和跨模式重组。具体来说,在第一阶段,我们通过自模态重建和成对对比学习来学习跨模态的共享潜在空间。我们还通过部分对齐和最小化潜在规范,将归纳偏差纳入对比学习过程中。在第二阶段,我们将新引入模态的编码器与预训练模态的解码器集成,以促进跨模态传输和生成。我们通过将 3D 点云和触觉模态新添加到具有三个模态对的预训练 MLLM 中来评估我们的方法,并表明,通过学习对齐的潜在表示空间,我们的模型实现了强大的跨模态性能。