论文
自剪枝Transformer:通过Universal Attention压缩KV缓存
A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention
摘要
现代 LLM 的大 KV 缓存大小对高效部署造成了障碍。最近的工作探索了用替代的基于衰减的机制替换注意力层的 RoPE 位置嵌入,然后可以在推理过程中使用该机制来修剪 KV 缓存。然而,这些衰减函数的表达能力有限,并且在实践中会演变成类似滑动窗口的驱逐模式。在这项工作中,我们提出了一个补充和新颖的衰减机制的统一框架,捕获复杂的关键统计数据和交互,同时保留富有表现力的 RoPE 嵌入和 Softmax 注意力。由此产生的通用注意力是一种高度表达和端到端可训练的架构,其复合衰减机制充当自然的 $\textit{adaptive}$ 修剪标准,删除对注意力计算贡献最小的标记。实验上,Universal Attention 在自然语言和合成任务数据上实现了最先进的 $10\times$ 压缩,同时与最先进的基线和未经修剪的预言机相比 $\textit{improving}$ 下游性能。它进一步展示了卓越的长上下文泛化能力,在长度为 16k 时具有前所未有的 $25\times$ 压缩。
