论文
重新理解模型合并中任务算术的隐式正则
A Broader Look at Model Merging: Rethinking Implicit Regularization Induced by Task Arithmetic
摘要
模型合并旨在通过组合各个特定任务模型的权重来廉价地构建多任务模型。为了在多个任务中表现良好,大多数现有的合并方法使用额外的数据集来查找特定于任务的权重更新的最佳线性组合的系数。然而,我们在这个标准实践中发现了隐式正则化:搜索系数将候选模型限制在由特定于任务的权重更新跨越的子空间中。在这项工作中,我们研究了这种正则化是否真的有用。令人惊讶的是,实证结果表明,在没有这种正则化的情况下优化合并模型权重可以显着提高跨多个架构、领域的通用合并方法的性能,甚至在数据极其有限的情况下(每个类只有一个实例可用)。此外,直接优化预训练模型权重甚至优于一些现有的合并方法。分析表明,子空间之外存在更好的多任务权重,并且可以使用多种方法找到。我们研究使用附加数据集的不同策略,讨论它们的实际用途和对模型合并的影响。总的来说,这项工作要求重新审视现有的模型合并流程,激发对权重空间的更广泛探索,并重新考虑任务算术引起的隐式正则化。
