论文
作为 微调 参数空间中的概率推理的模型合并
Model Merging as Probabilistic Inference in Fine-Tuning Parameter Space
摘要
模型合并旨在将现有的单任务解决方案组合成多任务解决方案,而无需额外的数据驱动 微调。〜大多数现有方法使用局部解决方案空间的几何属性来实现这一点。然而,这样的几何视图对于在合并过程中对跨任务的每个特定于任务的更新方向在统计上的有用程度进行评分提供了有限的指导。为了解决这个问题,我们在专家产品(PoE)场景下从概率推理的新角度制定了模型合并,其中每个单任务解决方案都在合并参数上定义了一个基于能量的专家模型(EBM)。我们表明,几种现有的模型合并方法是我们框架在能量设计下的特殊情况,这些方法对合并模型和特定任务模型之间的方向残差施加隐式高斯假设。根据经验,我们发现这些残差通常是重尾的,这暴露了与强加的轻尾高斯结构的不匹配。我们通过基于柯西专家的重尾 PoE 设计来解决这个问题,它可以更好地捕获观察到的残差行为,同时承认可证明的收敛推理过程。跨多个任务和架构的实验表明,与最先进的基线相比有了显着的改进。我们的代码位于 https://github.com/MinhLong210/PoE-EBM-Merging.git。