论文
切换线性注意力
Switching Linear Attention
摘要
设计具有高效推理的表达序列层仍然是现代机器学习的核心挑战。标准的softmax注意力通过丰富的非线性token交互实现了出色的序列建模性能,但它需要一个随序列长度线性增长的键值缓存,限制了其可扩展性。线性注意力能够以恒定的内存占用实现高效的循环计算,但其表达能力的降低通常会导致建模性能较差。我们引入了切换线性注意力(SwiLA),这是一种新颖的序列层,它通过增强表示能力同时保留线性注意力的固定大小的循环状态来弥补这一差距。我们从测试时间回归框架中推导出 SwiLA 递归,将状态更新规则转换为混合线性回归模型中的在线期望最大化。在测试时,每个输出维度根据输入在多个线性注意组件中动态选择。在联想回忆、上下文语言学习和语言建模基准测试中,SwiLA 表现出了强大的性能,缩小了与 softmax 注意力的差距,甚至在一些设置中超越了它。