论文
模型合并的多目标贝叶斯优化
Multi-Objective Bayesian Optimization for Model Merging
摘要
模型合并直接在权重空间中组合经过训练的模型,为额外的 微调 提供计算高效的替代方案。然而,选择合并参数很困难,因为下游评估成本高昂,梯度不可用,并且源功能可能发生冲突。我们将合并参数选择制定为黑盒多目标优化问题,并引入 MOBO-Merge,这是一个合并算子不可知的框架,它使用多目标贝叶斯优化在有限的评估预算下逼近 Pareto 前沿。我们使用 Linear、SLERP、TIES 和块合并运算符在二模型指令数学和三模型指令数学代码设置中评估 Qwen3-4B 和 Llama-3.1-8B。在保留的基准分区上,MOBO-Merge 在 12 次报告比较中的 11 次中获得了比随机搜索更高的平均超体积。对于一维线性插值,增益很小,但对于多个 TIES、逐块和三目标搜索,增益要大得多。没有哪个合并运算符是一律最好的:TIES 在四种系列设置组合中的三种中处于领先地位,而 Block-Linear 4x 对于 Llama 三模型合并来说是最强的。这些结果表明,多目标贝叶斯优化作为表达合并参数化的搜索层是有价值的。