论文
转变为混合注意力模型
Morphing into Hybrid Attention Models
摘要
混合注意力模型通过仅保留全注意力层的子集并用线性注意力替换其余层来提高长上下文效率。然而,Transformer 到混合转换的有效性关键取决于哪些层保留全注意力。现有的混合层选择方法通常依赖于启发式策略,例如固定放置模式或分层评分,隐式地将层重要性视为孤立的,并忽略全局混合配置下相互依赖的层效应。在这项工作中,我们将混合层选择制定为预算受限的子集优化问题。我们进一步提出了 FlashMorph(混合 MORPHing 的快速层选择),这是一种用于 Transformer 到混合转换的有效、高效且可扩展的层选择方法。 FlashMorph 首先通过为每个全注意力层配备转换后的线性注意力分支来构建可变形模型。然后,它冻结所有模型权重,并联合优化合成长上下文检索数据的分层门,并通过线性化正则化鼓励模型依赖线性注意力来提高效率。学习到的门在预设的全注意力预算下进行离散化,以实例化混合架构,然后进行标准 logits 蒸馏 和长上下文微调。大量实验表明,FlashMorph 发现了更有效的混合配置,保留了强大的长上下文召回和一般基准性能,同时与现有的层选择方法相比,大幅降低了层选择成本,证明了其有效性、效率和可扩展性。