论文

训练 Transformer 以实现 KV 缓存压缩性

Training Transformers for KV Cache Compressibility

模型推理KV Cache

摘要

长上下文语言建模越来越受到键值 (KV) 缓存的限制,其内存和解码时间访问成本与前缀长度呈线性关系。这个瓶颈催生了一系列上下文压缩方法,从 词元级 总结到最近基于优化的 KV 压缩方法。这些事后方法在固定预训练模型的 KV 缓存上运行,因此它们的有效性从根本上受到模型内部表示的压缩程度的限制。在这项工作中,我们形式化了 KV 可压缩性的概念,并表明它是学习表示的属性,而不仅仅是上下文的属性。我们证明,几乎任何序列到向量函数都允许高度可压缩和本质上不可压缩的 Transformer 实现,强调需要在训练期间引导 Transformer 走向可压缩表示。受此启发,我们提出了 KV 压缩感知训练(KV-CAT),这是一种持续的预训练过程,可以激励可压缩表示的出现。我们引入了训练时 KV 稀疏策略,可以在训练期间掩盖 KV 槽。这迫使模型使用更少的 KV 槽,并鼓励它学习适合事后压缩的表示。根据经验,我们表明 KV-CAT 改善了下游压缩方法在检索、长上下文问答和压缩前缀延续的基于困惑度的评估方面的质量预算权衡。