论文

我们是否合并了正确的模型?专家训练持续时间对 LLM 模型合并的影响

Are we Merging the Right Models? Impact of Expert Training Duration on Model Merging for LLMs

模型优化模型合并

摘要

多任务模型合并将单独训练的专家模型组合成一个模型,无需协同训练即可处理所有任务。标准实践以最佳验证损失合并专家。我们通过系统地研究领域专家的训练持续时间如何影响合并模型的质量来挑战这一惯例。我们对三个模型大小(Qwen 3.5 0.8B、2B 和 4B)的五个领域(数学、代码、指令遵循、多语言和安全)的专家进行微调,将检查点从最佳训练步骤的 25% 节省到 500%,并在每个持续时间评估五种合并方法。我们的研究结果揭示了一种惊人的方法依赖模式:简单平均会因过度拟合而急剧退化,而基于稀疏化的方法则实现了远远超过验证最佳值的最佳性能。我们通过偏差-方差分解分析将其形式化,与随机森林相似,其中平均来自高方差个体学习者的收益。这些结果表明训练持续时间和合并方法应该联合选择而不是独立选择。