论文
用于高效长上下文建模的潜在压缩 Transformer
Latent-Condensed Transformer for Efficient Long Context Modeling
摘要
由于键值(KV)缓存的线性增长和自注意力的二次复杂度,大语言模型(LLM)在处理长上下文时面临重大挑战。现有方法分别解决这些瓶颈:多头潜在注意力(MLA)通过将词元投影到低维潜在空间来减少 KV 缓存,而稀疏注意力则减少计算量。然而,稀疏方法无法在 MLA 的压缩潜在结构上本地运行,从而错过了联合优化的机会。在本文中,我们提出了潜在压缩注意力(LCA),它直接压缩 MLA 潜在空间内的上下文,其中表示被分解为语义潜在向量和位置键。 LCA 通过查询感知池分别聚合语义向量,并通过锚点选择保留位置键。这种方法在不增加参数的情况下共同降低了计算成本和 KV 缓存。除了 MLA 之外,LCA 的设计与架构无关,并且很容易扩展到其他注意力机制,例如 GQA。理论上,我们证明了一个与长度无关的误差界。实验表明,LCA 在 128K 上下文中实现了高达 2.5$\times$ 的预填充加速和 90% KV 缓存减少,同时保持了具有竞争力的性能。