论文
模型合并:基础和算法
Model Merging: Foundations and Algorithms
摘要
现代深度学习通常将模型视为单独的工件:独立训练,专门用于特定目的,并在改进版本出现时被替换。本论文研究模型合并作为替代范式:直接在权重空间中组合独立训练的神经网络,很少或没有优化,并且不需要访问原始训练数据。本文考虑了两种主要制度。在单任务设置中,模型共享目标但初始化不同,我们引入了 C$^2$M$^3$,一种基于 Frank-Wolfe 优化的循环一致合并算法。 C$^2$M$^3$ 将多个网络对齐到一个共享的、无参考的参数空间中,使权重平均有意义,而不会给任何单独的模型带来特权。在多任务设置中,模型通过常见的预训练初始化针对不同的下游任务进行微调,我们首先将任务向量作为近似梯度进行理论解释。这解释了任务算术的有效性和局限性。基于这个观点,我们证明任务向量继承了梯度的低秩结构,并引入了任务奇异向量(TSV),这是一种通过 TSV 合并实现压缩和减少干扰的分解。然后,我们提出 MASS,一种输入自适应路由方法,它使用 TSV 几何结构在推理时选择与任务相关的子空间。最后,我们介绍 MERGE$^3$,这是一种进化合并框架,它使用项目响应理论将评估成本降低多达 50$\times$,同时保持解决方案质量。这些贡献共同为模型合并提供了理论和算法基础,支持了可以跨模型组合、重用和扩展学习能力的范例。