论文
自修剪键值注意力:通过预测未来效用来学习何时写作
Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility
摘要
在现代测试时计算和代理范式下,语言模型处理越来越长的序列。使用 Transformer 架构的高效文本生成越来越受到键值缓存占用空间和带宽的限制。为了解决这个限制,我们引入了自修剪键值注意力(SP-KV),这是一种旨在预测未来 KV 效用的机制,以减少长期 KV 缓存的大小。该策略以细粒度运行:轻量级效用预测器对每个键值对进行评分,虽然最近的 KV 始终可通过本地窗口获得,但较旧的键值对会写入缓存中,仅当其预测效用超过给定阈值时才用于全局关注。 LLM 和效用预测器仅通过下一个词元预测损失进行端到端联合训练,并根据预训练的 LLM 检查点进行改编。 SP-KV 不是强制执行固定的压缩比,而是执行动态稀疏化:该机制会适应输入,通常会将 KV 缓存大小减少 $3$ 到 $10\times$,较长的序列通常更容易压缩。这极大地提高了内存使用率和解码速度,而验证损失或大量下游任务的性能几乎没有降低。除了作为有效的 KV 缓存减少机制之外,我们的方法还揭示了结构化的层和头特定的稀疏模式,我们可以用它来指导混合局部全局注意力架构的设计。