论文

并非所有任务向量都需要等秩:模型合并的能量比例分配

Not All Task Vectors Need Equal Rank: Energy-Proportional Allocation for Model Merging

模型优化模型合并

摘要

模型合并旨在将由同一预训练模型派生的多个微调模型组合为单一多任务模型,无需额外的联合训练。近期的谱方法合并通过利用任务特定更新的低秩结构改进了简单的权重平均,但它们通常给每个任务分配相同的秩容量。这种均匀分配忽略了任务向量可能具有异构的谱复杂度,导致共享合并空间未被最优使用。本文提出谱能量比例秩分配(SERA),一种简单的任务自适应策略,按每个任务向量的奇异值能量结构分配秩。通过为复杂或孤立的任务分配更丰富的谱容量、为紧凑的任务分配更少方向,SERA 将基于 SVD 的模型合并从均匀容量合并扩展到依赖任务的容量分配。在标准视觉模型合并协议下的实验表明,SERA 在保持与现有谱合并方法相同总秩预算的同时提升多任务合并性能。进一步分析表明,任务级谱集中度与自适应秩分配的逐任务效果密切相关,为 SERA 何时及为何有效提供了洞见。

并非所有任务向量都需要等秩:模型合并的能量比例分配:论文配图
图 1:我们的方法概览。与统一秩的谱合并不同,我们的方法根据各任务的谱能量重新分配相同的总秩预算,为复杂任务分配更多容量,为紧凑任务分配更少容量。