论文
大规模端到端上下文压缩
End-to-End Context Compression at Scale
摘要
长上下文语言模型推理受到内存的瓶颈,因为 KV 缓存随着上下文长度而增长。最近压缩 KV 缓存的技术存在不足:它们要么大幅降低模型质量,要么需要大量时间和计算来压缩单个长提示。此外,许多方法要求输入适合目标模型的上下文窗口,并且通常与现代生产推理引擎不兼容。编码器-解码器压缩器将长词元序列映射到解码器使用的较短的潜在嵌入序列,原则上是一种有吸引力的替代方案。然而,现有的方法在精度-效率方面与 KV 缓存压缩不具有竞争力。在这项工作中,我们重新审视编码器-解码器压缩并缩小这一差距。我们首先执行架构搜索,从头开始 预训练 许多变体,以确定如何最好地设计和训练编码器-解码器压缩器。在我们的研究结果的指导下,我们不断地以 1:4、1:8 和 1:16 的压缩比预训练一系列 0.6B 编码器、4B 解码器模型,每个模型超过 350B 个词元。我们引入了潜在上下文语言模型 (LCLM),这是一系列压缩器,可改善一般任务性能、压缩速度和峰值内存使用方面的帕累托前沿。我们证明 LCLM 可以作为长视野智能体的有效骨干,让智能体浏览压缩的长上下文并根据需要自适应地扩展相关部分。