论文
Meta-Soft:利用可组合元Token实现上下文保留的KV缓存压缩
Meta-Soft: Leveraging Composable Meta-Tokens for Context-Preserving KV Cache Compression
摘要
大语言模型使用的KV缓存具有线性增长的时间复杂度,因此LLM在处理长上下文时面临内存膨胀和解码效率下降的问题。当前KV Cache驱逐已成为重要研究方向;然而,基于固定Soft Token的现有方法(如Judge Q)依赖一组静态参数作为查询来评估KV对的重要性,因而无法动态适应不同的输入提示,也难以精确捕捉复杂多变的任务相关性。此外,被驱逐的KV对会被永久丢弃,造成不可逆的信息丢失和上下文断裂。为解决这一问题,我们提出Meta-Soft,一个基于探测驱动上下文整合的动态压缩框架。具体而言,我们构建了一个带可学习正交基矩阵$\mathcal{L}$的元库,并使用带Gumbel-Softmax的选择器网络生成可微的稀疏组合权重,从而从输入提示特征中动态合成最有针对性的$k$个Soft Token。我们将这些Soft Token追加到输入序列末尾以探测关键信息。我们还引入了基于注意力流的整合机制,将被移除Token的语义信息重新分配到保留Token中,从而有效保住被丢弃的上下文信息。多个数据集上的实验表明,我们的方法优于现有最先进的驱逐方法,为KV Cache压缩提供了新方案。
