论文
无需训练 多任务模型合并的任务分类
Training-free Task Classification for Multi-Task Model Merging
摘要
自从基础模型和 预训练 微调范例出现以来,人们为将多个特定于任务的专家合并到单个多任务模型中做出了许多努力。之前的工作主要集中在寻找单个合并模型,但由于参数干扰,它常常表现不佳。为了解决这个问题,动态模型合并采用路由来激活每个输入的任务相关参数。然而,现有的路由器通常需要使用丰富的标记数据集进行额外的训练,或者假设在推理时访问每个输入的任务 ID。在这项工作中,我们的目标是在无需额外训练或任务 ID 访问假设的情况下缩小与专家绩效的差距。为此,我们将每个测试输入的路由制定为 无需训练 任务分类。 SiM 对每个任务使用基于奇异值分解 (SVD) 的低秩流形近似,通过将测试输入特征的残差投影到每个任务流形上来对任务进行评分,并相应地进行路由。在合并过程之前,可以使用小型每任务支持集(例如,每个任务 32 个示例)从预先训练的主干中离线预先计算任务流形,在合并过程中不需要路由器训练,也不需要数据。此外,SiM 与基于子空间/掩码的合并无缝集成,通过轻量级压缩任务向量表示任务专家,从而无需存储完整的专家参数。任务未知推理下的计算机视觉和自然语言处理基准实验表明,SiM 极大地提高了合并模型的性能,并不断缩小与单个任务专家的差距。我们的代码可在 https://github.com/BAIKLAB/SiM 获取