论文
释放持续模型合并的潜力:ODE 视角
Unlocking the Potential of Continual Model Merging: An ODE Perspective
摘要
持续模型合并 (CMM) 通过顺序合并任务适应模型,无需重复重新训练,即可快速定制基础模型。然而,现有的合并规则通常通过固定的代数或基于投影的操作来更新部署的模型,从而对相对于传入任务模型应保留多少先前积累的知识提供有限的控制。这种限制导致长任务流中的保留不稳定和性能下降,并且当任务具有异构实用程序时变得更加明显。我们提出了 ODE 驱动合并(ODE-M),这是一种可控框架,它将每次连续合并制定为参数空间中的轨迹,而不是一步端点更新。在模式连通性的推动下,ODE-M 使用修正的时间相关速度场构建了障碍感知轨迹,其中来自小型校准集的轻量级一阶反馈抑制了损失增加的运动,同时保留了传入模型的进展。然后,通过效用感知时间表沿着该轨迹选择操作点,从而获得下一个合并模型,从而提供用于平衡保留的历史知识和传入任务专业知识的显式机制。对标准 CMM 基准的大量实验表明,ODE-M 在 CLIP ViT 主干、流长度和异构任务实用程序设置上持续改进强大的连续合并基线。