论文

MODUS:仅解码器的多种模态的任意建模

MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

模型训练预训练

摘要

任意模型可以预测单个网络内其他任意组合的任何模态,这是多模态视觉和视觉语言模型中使用的公式,并且越来越多地应用于生态学和天文学等科学领域。现有的任意到任意模型通常使用编码器-解码器或扩散架构从头开始训练,这会影响它们的性能并阻止它们使用强大的预训练仅解码器模型作为先验。在这项工作中,我们研究了仅解码器的任意到任意多模态建模,该模型对称地处理所有模态并支持任意模态作为输入和输出,而无需模态特定的头、损失或任务管道。由于每种模态都是同一模型的输入和输出,因此生成的模型(名为 Modus)可以支持一系列应用,例如通过中间模态进行链式生成,或通过使用另一种生成模态对模型自身的输出进行评分来进行跨模态自我验证。 Modus 展示了强大的开箱即用性能,并且与跨各种基准使用单一模型的专业和多任务基准具有竞争力。所有材料均在 https://modus-multimodal.epfl.ch/ 上开源。