论文
统一多目标模型的混合训练合并
Mixture-Trained Merging for Unified Multi-Objective Models
摘要
人们越来越期望统一语言模型能够在一组参数中结合异构功能,例如数学、代码、指令遵循和可控思维行为。一种常见的解决方案是对多个目标进行连续的后训练,但这会使所有目标沿着一个优化轨迹纠缠在一起,并使最终模型对训练顺序、数据比率、时间表和停止标准高度敏感。权重空间合并提供了一种模块化替代方案,但单目标专家的天真合并常常失败:领域能力急剧下降,或者思考/非思考模式崩溃为一种主导行为。我们将这两种失败归因于不兼容的权重空间几何:受过单一目标训练的专家漂移到参数空间的遥远区域,将他们的插值放置在任何共享的低损耗盆地之外。我们提出混合训练合并(MTM),它在目标偏向的数据混合而不是单个目标上训练每个分支,使其暴露于跨目标交互并使分支在合并时兼容。 MTM 使用合并模型评估作为选择分支混合的低成本信号,避免昂贵的数据混合消融。该过程是迭代的:每一轮都使用全局选择的合并系数来提升基本模型,并在保留其他目标的约束下使用域首选系数来细化每个分支混合。为了超越单纯形网格搜索,MTM 使用基于 qNEHVI 的多目标贝叶斯优化。在代码、数学、指令遵循和思考/非思考控制方面,MTM 优于朴素合并,并在单目标合并崩溃时保留行为分离,这表明有效的统一模型需要经过训练的分支可合并。