论文

重新理解模型合并中任务算术的隐式正则

A Broader Look at Model Merging: Rethinking Implicit Regularization Induced by Task Arithmetic

模型优化模型合并

摘要

模型合并旨在通过组合各个特定任务模型的权重来廉价地构建多任务模型。为了在多个任务中表现良好,大多数现有的合并方法使用额外的数据集来查找特定于任务的权重更新的最佳线性组合的系数。然而,我们在这个标准实践中发现了隐式正则化:搜索系数将候选模型限制在由特定于任务的权重更新跨越的子空间中。在这项工作中,我们研究了这种正则化是否真的有用。令人惊讶的是,实证结果表明,在没有这种正则化的情况下优化合并模型权重可以显着提高跨多个架构、领域的通用合并方法的性能,甚至在数据极其有限的情况下(每个类只有一个实例可用)。此外,直接优化预训练模型权重甚至优于一些现有的合并方法。分析表明,子空间之外存在更好的多任务权重,并且可以使用多种方法找到。我们研究使用附加数据集的不同策略,讨论它们的实际用途和对模型合并的影响。总的来说,这项工作要求重新审视现有的模型合并流程,激发对权重空间的更广泛探索,并重新考虑任务算术引起的隐式正则化。

重新理解模型合并中任务算术的隐式正则:论文原图
图 1:模型合并管道的新视角。现有的模型合并管道通过将特定于任务的权重更新 $\tau_{i}$ 的线性组合添加到预训练模型 $\theta_{0}$ 来构建合并模型 $\theta_{merge}$。标准实践使用额外的数据集(我们称之为辅助数据)来优化系数 $\lambda$ 以实现多任务性能。该系数优化将模型更新规则化到 $\tau_{i}$ 所跨越的子空间。我们通过使用相同的辅助数据来优化合并模型权重来挑战这个管道,从而允许超出这个子空间的优化。实验结果表明,探索更广泛的权重空间通常会导致合并方法(TA、TIES、DARE 和 TSV-M)的性能显着提高。