论文

LoopGuard:通过动态KV缓存干预打破自增强注意力循环

LoopGuard: Breaking Self-Reinforcing Attention Loops via Dynamic KV Cache Intervention

模型推理KV Cache

摘要

通过对长上下文生成的系统实验,我们观察到一种破坏性失效模式:解码可能坍缩为持续的重复循环。我们发现这种退化由坍缩的注意力模式驱动——一部分注意力头锁定在历史的狭窄后缀上,并被推理时的KV缓存复用进一步固化。至关重要的是,由于许多现有KV缓存策略依赖基于注意力的重要性评分,这种坍缩会为重复词元产生虚高分数,使缓存管理在无意中放大重复。为了以可控、可复现的方式研究这一现象,我们提出LoopBench,一个带有显式循环诱导条件与面向循环的指标的基准,在下游任务分数之外量化重复严重性与生成不稳定性。基于这些认识,我们提出LoopGuard,一个轻量级、即插即用的KV缓存守护器,在线检测循环的发生,并在固定缓存预算下通过剪除重复的尾部片段来打破反馈循环。在LoopBench上的实验表明,LoopGuard将循环发生率降低超过90个百分点,同时恢复输出多样性并减少词元浪费。

LoopGuard:通过动态KV缓存干预打破自增强注意力循环:论文配图
图 1:自我强化重复循环和我们的缓解策略的图示。 (a)注意力头锁定在狭窄的重复范围内,创建一个积极的反馈循环。 (b) 现有的基于注意力的驱逐政策(例如 H2O)通过保留高分重复标记而放弃多样化的上下文,无意中强化了这种循环。 (c) LoopGuard 检测循环开始并修剪重复尾部以打破反馈循环并恢复多样性。