论文

扩展线性模式连接并合并至十亿个参数预训练 Transformer

Scaling Linear Mode Connectivity and Merging to Billion Parameter Pretrained Transformers

模型优化模型合并

摘要

线性模式连接 (LMC) 为理解和合并独立训练的神经网络提供了有希望的基础,但现有方法通常仅从一个模型端点优化插值路径,限制了它们对于大型预训练 Transformer 的可扩展性和有效性。我们提出了一种新颖且可扩展的框架,用于实现基于 LMC 的模型合并到{\em 十亿参数预训练 Transformer}。我们的方法应用适当的参数化功能保留权重变换来对齐功能等效的解决方案,并引入双重学习过程,其中两个模型共同学习其相应的变换以实现共享的线性插值路径。这种双向优化大大减少了插值障碍,并实现了跨大规模架构的更可靠的合并。根据经验,我们表明,我们的方法在 WikiText 上对于具有中等大小参数的语言模型实现了接近零的损失障碍,据我们所知,这代表了这种规模上近无障碍线性连接的首次演示。在视觉领域,ViT-L 在整个插值路径中保持超过 69% ImageNet top-1 精度,而现代十亿参数 LLM 仅表现出很小的损失障碍。这些结果表明,正确解决参数对称性可以使大型预训练 Transformer 通过简单的线性路径进行连接和合并,从而显着提高插值性能。代码:https://github.com/VILA-Lab/Dual-Learned-Matching。