论文
PivotMerge:通过对齐后模型合并桥接异构多模态 预训练
PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging
摘要
多模态 大语言模型 (MLLM) 依赖于不同数据源上的多模态 预训练,其中不同的数据集通常会产生互补的跨模态对齐功能。模型合并提供了一种经济高效的机制,可将具有互补优势的多个专家 MLLM 集成到统一模型中。然而,现有的模型合并研究主要集中在微调后的场景,而 预训练 阶段很大程度上未被探索。我们认为 MLLM 预训练 的核心在于建立有效的跨模态对齐,它将视觉和文本表示连接到一个统一的语义空间。受这一见解的启发,我们引入了对齐后合并任务,其目的是集成从异构多模态 预训练 中学到的跨模态对齐能力。这种设置引入了两个关键挑战:跨域参数干扰,即从不同数据分布学习到的参数更新在合并过程中发生冲突;以及逐层对齐贡献差异,即不同层和投影仪对跨模式对齐的贡献不均匀。为了解决这些问题,我们提出了 \textbf{PivotMerge},一种用于跨模式投影仪的对齐后合并框架。 PivotMerge 包含两个关键组件:共享空间分解和过滤,它将共享对齐模式与特定于域的变化分开并抑制冲突方向;以及对齐引导的逐层合并,它根据不同的对齐贡献分配特定于层的合并权重。我们构建了系统的基于 CC12M 的对齐后合并场景进行评估。对多个多模式基准的广泛实验表明,PivotMerge 始终优于现有基准,证明了其有效性和泛化能力。