论文
不折不扣地忘记:固定预算下用于流式 KV 缓存驱逐的 Nexus 采样
Forget Without Compromise: Nexus Sampling for Streaming KV-Cache Eviction Under Fixed Budgets
摘要
长上下文和代理 LLM 工作负载使 KV 缓存超出任何固定内存预算,迫使推理堆栈在连续推理流的每一步永久逐出词元。现有的方法都共享相同的模板,每个步骤的直接注意力分数,然后是确定性的 top-$K$ 选择,它将单个低于截止的步骤转换为不可逆转的判决,并永久删除任何直接注意力无法从噪声中挑选出来的微妙重要标记。为了应对这一挑战,我们提出了 Nexus 采样,这是一种 无需训练 驱逐方法,它与 Nexus 评分配对,这是一种对表面桥词元的直接注意力的迭代遍历,具有加权水库采样,保留具有包含概率的词元来代替确定性的 top-$K$。从理论上讲,我们表明 Nexus 采样在不太重要的词元的长期生存中主导着确定性的 top-$K$。根据经验,在 80% KV 缓存驱逐的情况下,Nexus Sampling 在 LongBench 上可匹配 1% 以内的密集注意力,同时在检索繁重的任务上优于 top-$K$ 基线,每个序列的缓存内存最多缩小 10 倍。