论文
异构语言模型能够被融合吗?
Can Heterogeneous Language Models Be Fused?
摘要
模型合并旨在将多个专家模型整合为单一模型,使其继承各模型的互补优势,同时不承担集成(ensembling)的推理时开销。近期进展表明,当所有源模型都是同构的——即派生自同一预训练主干、因而共享对齐的参数坐标或兼容的任务向量——时,合并可以非常有效。然而在开放模型生态中,这一假设日益不现实:有用的专家模型往往构建于Llama、Qwen、Mistral等不同家族之上。在此类异构设定下,由于架构失配、潜在基不对齐与跨源冲突放大,直接的权重空间融合变得病态。我们以HeteroFusion解决异构语言模型融合问题,它包含两个关键组件:基于拓扑的对齐——通过匹配功能模块结构而非原始张量坐标在异构主干间迁移知识;冲突感知去噪——在融合过程中抑制不兼容或含噪的迁移信号。我们进一步提供分析性论证,表明在预测结构化更新的同时保留目标适配器基,可带来稳定且良态的迁移过程。在异构迁移、多源融合、噪声源鲁棒性与跨家族泛化等设定下,HeteroFusion一致优于强合并、融合与集成基线。
