论文
PACT:在任务向量中保留锚定核心以进行模型合并
PACT: Preserving Anchored Cores in Task-vectors for Model Merging
摘要
模型合并已成为多任务学习的 无需训练 替代方案,旨在将多个特定于任务的微调模型组合成单个多任务模型。大多数现有的模型合并方法遵循任务算术范式,它将微调的权重分解为预训练的参数和任务向量,并专门在任务向量空间中执行合并。这种范式的有效性隐含地依赖于这样的假设:特定于任务的知识仅在任务向量中编码。我们认为,由于预训练模型的内在任务偏好,这种假设通常不成立。具体来说,我们确定了 \textbf{承重墙(LBW)尺寸},即一些仍然嵌入在预训练权重中而不是完全转移到任务向量中的任务关键知识。我们从标量权重和子空间角度描述了 LBW 维度,从而涵盖了现有模型合并方法的主要范例。我们的分析表明,通过忽略 LBW 维度,基于任务向量的方法无法完全解决任务冲突,并且可能会无意中损坏预训练模型中编码的特定于任务的知识,从而导致性能退化。为了解决这个问题,我们提出了 PACT,它通过将正交补码与预训练权重的子空间对齐来保留任务向量内锚定的特定于任务的核心(即 LBW 维度)。然后,在应用现有模型合并算法之前,从任务向量中删除这些对齐的子空间分量。此外,我们开发了一种基于随机 SVD 的有效变体,以提高可扩展性。 PACT 可以与现有方法无缝集成。跨多个基准的广泛实验表明,PACT 持续增强主流模型合并方法并建立新的最先进性能。