论文
重新思考快速学习模型合并的专家训练
Rethinking Expert Training for Model Merging with Prompt Learning
摘要
模型合并旨在将从共享基础模型训练的多个领域专业专家合并到单个多任务模型中。现有方法主要集中于改进合并过程本身,并且通常假设通过全参数 微调 获得专家。在这项工作中,我们重新审视模型合并的专家训练。我们首先表明,基于提示的适应提供了强大的基线:可以跨任务利用独立学习的提示,同时保持主干固定,避免权重合并引入的干扰。基于这一观察,我们引入了双调谐专家(DTE),这是一种两阶段训练策略,首先学习提示,然后微调视觉编码器。这减少了特定于任务的参数更新的幅度,并产生具有更高合并兼容性的专家。跨多个 CLIP 架构、完整 微调 和 LoRA 专家的实验表明,DTE 持续改进标准合并方法的合并性能,并且即使在组合异构专家集时也保持有效。