论文

超越参数算术:面向分布感知模型合并的稀疏互补融合

Beyond Parameter Arithmetic: Sparse Complementary Fusion for Distribution-Aware Model Merging

模型优化模型合并

摘要

模型合并(model merging)已成为一种有前景的范式,它通过直接在权重空间中操作来组合大型语言模型的能力,无需昂贵的重新训练即可整合专用模型。然而,现有合并方法大多依赖参数空间启发式,往往引入严重干扰,导致泛化能力退化以及重复、输出不连贯等不稳定的生成行为。本文提出带反向KL的稀疏互补融合(Sparse Complementary Fusion with reverse KL,SCF-RKL),一个通过稀疏、分布感知更新显式控制功能干扰的新型模型合并框架。SCF-RKL不假设参数空间的线性可加性,而是使用反向Kullback-Leibler散度度量模型间的功能散度,并选择性地纳入互补参数。这种模式寻求、诱导稀疏的设计在整合新能力的同时有效保持稳定的表示。我们在广泛的模型规模与架构上评估SCF-RKL,涵盖推理导向与指令微调两类模型。在跨越高级推理、通用推理与知识、指令遵循以及安全性共24个基准上的大量实验(含视觉分类)表明,SCF-RKL持续优于现有模型合并方法,同时保持强大的泛化能力和生成稳定性。

超越参数算术:面向分布感知模型合并的稀疏互补融合
图1:Mistral-7B、Qwen2.5-14B 和 Qwen2.5-32B 上各融合方法的重复率。即使基座模型的重复率接近于零,基线合并方法仍会严重放大重复,而 SCF-RKL 在所有规模上都能持续保持低重复率( < 1.6%)。