论文

Rosetta:可组合的原生多模态预训练

Rosetta: Composable Native Multimodal Pretraining

模型训练预训练

摘要

实现真正的通用人工智能需要能够在不忘记先验知识的情况下集成新模式的基础模型。然而,将连续的生成目标与离散的理解任务结合起来会导致严重的梯度冲突。现有架构,包括标准专家混合 (MoE),非常容易受到表示覆盖的影响。即使像 Mixture-of-Transformer (MoT) 这样的结构划分范式仍然容易遭受灾难性遗忘,严重阻碍多模式可扩展性。在这项工作中,我们介绍了 Rosetta,一个可组合的原生多模态预训练框架,专为无缝和非破坏性模态扩展而设计。 Rosetta 采用模块化范例,其中核心基础知识保留在全球共享专家中,而特定模式的功能则分布在即插即用专家中。为了保证无损合成,我们提出了动量锚定正交投影(MAOP)。 MAOP 利用优化器的动量状态作为隐式语义锚,有选择地中和新模态中冲突的梯度分量,同时保留协同更新。广泛的评估表明,虽然标准的 MoE 和 MoT 架构会遭受对先前获得的知识的灾难性遗忘,但 Rosetta 却稳健地保留了既定的语言和视觉理解。此外,它还提供卓越的图像生成并释放跨模式协同作用,为真正可组合和统一的多模式基础模型铺平了道路。为了促进进一步的多模式研究,我们向社区发布了我们的代码和检查点。项目页面位于 https://rosetta-lmm.github.io/。