论文

异构语言模型能够被融合吗?

Can Heterogeneous Language Models Be Fused?

模型优化模型合并

摘要

模型合并旨在将多个专家模型整合为单一模型,使其继承各模型的互补优势,同时不承担集成(ensembling)的推理时开销。近期进展表明,当所有源模型都是同构的——即派生自同一预训练主干、因而共享对齐的参数坐标或兼容的任务向量——时,合并可以非常有效。然而在开放模型生态中,这一假设日益不现实:有用的专家模型往往构建于Llama、Qwen、Mistral等不同家族之上。在此类异构设定下,由于架构失配、潜在基不对齐与跨源冲突放大,直接的权重空间融合变得病态。我们以HeteroFusion解决异构语言模型融合问题,它包含两个关键组件:基于拓扑的对齐——通过匹配功能模块结构而非原始张量坐标在异构主干间迁移知识;冲突感知去噪——在融合过程中抑制不兼容或含噪的迁移信号。我们进一步提供分析性论证,表明在预测结构化更新的同时保留目标适配器基,可带来稳定且良态的迁移过程。在异构迁移、多源融合、噪声源鲁棒性与跨家族泛化等设定下,HeteroFusion一致优于强合并、融合与集成基线。

异构语言模型能够被融合吗?:论文配图
图1:HeteroFusion总览:基于拓扑的对齐将兼容模块映射入统一上下文,冲突感知去噪过滤跨源噪声,实现异构语言模型融合。