论文

反思异构LLM合并:加权模型平均视角

Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective

模型优化模型合并

摘要

参数空间差异巨大的大语言模型能不经训练或语义对齐、直接加权平均合并吗?现有异构融合方法通常引入蒸馏、适配器、学习的潜空间、路由或特征对齐,留下一个问题:更简单的配方能否对真正不同的十亿参数检查点奏效。我们通过免训练的维度适配加比率受控插值重访这一反直觉问题:并集式合并把小模型扩展到大参数空间;交集式合并把大模型截断到小参数空间。在Qwen家族模型对与覆盖数学推理、代码生成、语言理解、常识推理、知识与指令跟随的基准上:确定性扩展基本保留源模型功能,小比率插值可通过迁移互补能力超越强源检查点;但近均衡插值常崩溃,任务级结果呈现跷跷板效应——部分能力的增益与其他能力的回退并存。这些结果表明,简单参数平均配上轻量维度适配与受控比率,是异构LLM合并中出人意料的强基线;直接加权融合的极限可能同样约束更复杂异构合并方法所能达到的规模。

反思异构LLM合并:加权模型平均视角:论文配图
图 1:两种异构模型合并策略。 (1)联合式合并:扩展较小的模型以匹配较大模型的维度,然后合并。 (2)交集式合并:将较大模型截断为较小模型的维度,然后合并。