论文

RetentiveKV:用于不确定性感知多模式 KV 缓存驱逐的状态空间内存

RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction

模型推理KV Cache

摘要

由于在处理长视觉上下文时视觉 KV 缓存的大幅扩展,多模态 大语言模型 在计算效率和内存消耗方面面临着严峻的挑战。现有的 KV 缓存压缩方法通常依赖于“重要性持久性”假设来修剪词元。然而,由于两个关键问题,这种方法在多模式设置中被证明是脆弱的:1)视觉标记显示“延迟重要性”,最初表现出低显着性,但在后来的解码过程中变得至关重要,这可能导致过早驱逐。 2)离散修剪破坏了视觉线索固有的空间连续性。为了应对这些挑战,我们提出了 RetentiveKV,一种熵驱动的 KV 缓存优化方法,它基于状态空间模型将 KV 驱逐从“离散上下文截断”重新表述为“连续内存演化”。我们的方法利用信息熵来量化低注意力词元的信息潜力,并通过熵引导的状态转换将计划驱逐的词元集成到连续状态空间中,从而在后续解码过程中出现语义相关性时实现它们的动态重新激活。对多模态基准的大量实验表明,RetentiveKV 实现了 5.0 倍的 KV 缓存压缩和 1.5 倍的解码加速。