论文

通过可引导模型合并增强多语言推理

Enhancing Multilingual Reasoning via Steerable Model Merging

模型优化模型合并

摘要

模型合并是组合多语言模型和推理模型能力的有效技术。它通过对齐不同模型的特征空间,在多语言推理任务中实现了有前景的泛化。然而,合并的单一模型通常无法解决源模型之间的冲突,导致性能不佳。换句话说,一刀切的合并策略可能与不同输入的特征不相符,这可能需要优先考虑某些模型而不是其他模型。为此,我们提出了一个可操纵模型合并(ST-Merge)框架来调节每个源模型的贡献。为了实现这个想法,我们引入了门控交叉注意力机制,以自适应方式对两个参与源模型进行加权或过滤。大量实验表明,ST-Merge 在 21 种不同语言的 4 个多语言推理基准测试中始终优于多个强基线。