论文
迈向多模态 大语言模型 联合预训练的一步
A Step Toward Federated Pretraining of Multimodal Large Language Models
摘要
多模态 大语言模型 (MLLM) 的快速发展受到高质量公共数据饱和的瓶颈,而大量不同的多模态数据在隐私敏感的孤岛中仍然无法访问。联邦学习 (FL) 提供了一种很有前途的解决方案来解锁这些分布式资源,但现有的研究主要集中在 微调 上,而基本的 预训练 阶段在很大程度上尚未得到探索。在本文中,我们正式介绍了联合 MLLM 对齐 (Fed-MA) 任务,这是一种轻量级 预训练 范例,可冻结视觉编码器和 LLM,同时协作训练跨模态投影仪。我们在此设置中确定了两个关键挑战:(i)聚合本地投影仪时的参数干扰; (ii) 一次性协作 SGD 中的梯度振荡。为了应对这些挑战,我们提出了 Fed-CMP,这是联邦 MLLM 预训练 的开创性框架。 Fed-CMP 采用规范可靠性感知聚合,构建规范空间,将客户端投影仪分解为共享对齐基础和客户端特定系数,然后执行可靠性加权融合以抑制参数干扰。此外,Fed-CMP 引入了正交性保留动量,它通过正交投影将动量应用于共享对齐基础,积累历史优化方向,同时保留几何结构。我们基于公共数据集构建了四个联合 预训练 场景,并且大量实验验证了 Fed-CMP 显着优于现有基线。