论文

通过顺序本地运算符对齐进行无需训练变压器合并

Training-Free Transformer Merging via Sequential Local Operator Alignment

模型优化模型合并

摘要

无需训练模型合并旨在将多个微调模型组合成单个模型,而不需要对标记数据进行进一步优化。然而,在 Transformer 中,独立合并各个层可能会影响共享注意力计算,因为查询键和值输出运算符依赖于组合矩阵,而忽略了功能结构。此外,当合并较早的组件时,下游组件会收到与原始模型中不同的激活,因此,合并后的执行路径与原始执行路径不再匹配。在本文中,我们介绍了顺序局部运算符对齐,这是一种沿部分合并模型的执行路径合并变压器的无需训练方法。我们的方法使用校准数据来估计每个功能组件的局部行为,在部分合并模型的中间激活下按顺序对齐运算符,然后将合并的运算符分解回有效的转换器参数。我们凭经验表明,这个顺序步骤减少了跨层的错误累积。此外,所提出的算子分解步骤可以实现秩扩展,为增加多任务容量提供原则性机制。我们证明,我们的方法可以泛化到各种模式、模型规模和不同数量的任务,从 CLIP 和 RoBERTa 到十亿个参数LLM,并进一步自然地扩展到 LoRA 微调模型的合并。结果表明,在不需要秩扩展的情况下,对强合并基线的改进,而可选的扩展提供了进一步的准确性-推理-成本权衡。项目链接:https://akansh12.github.io/SLOA-Merge/