论文

动态模型合并变得更精简

Dynamic Model Merging Made Slim

模型优化模型合并

摘要

模型合并可以重用经过微调的模型,而无需联合训练或访问原始数据。动态合并通过有选择地激活任务相关参数并跨多个任务有效地组合专家,进一步提高了灵活性。然而,现有的动态方法要么与小型专家保持完全共享的模型,要么向专家分配过多的容量,从而导致精度不理想——效率权衡。为了解决这个问题,我们提出了 DiDi-Merging,这是一种精简的动态合并框架,它利用可微的排名分配来平衡共享参数和专家参数。通过将参数预算制定为低秩模块中的可微秩优化,并引入无数据细化步骤来恢复任务保真度,DiDi-Merging 仅以单个微调模型参数的 1.24 倍匹配先前的动态基线,并以 1.4 倍的速度超越它们,比需要 > 2 倍存储的方法更加紧凑。 DiDi-Merging 适用于视觉、语言和多模态任务。