论文

DeltaS:读取流视频中 KV 缓存驱逐的门控线性注意力状态

DeltaS: Reading the Gated Linear Attention State for KV Cache Eviction in Streaming Video

模型推理KV Cache

摘要

最近的视频语言模型越来越多地采用混合架构,将线性和全注意力层交织在一起,以实现高效的长上下文处理。虽然线性注意力的循环状态在大小上保持固定,但完全注意力的 KV 缓存随着视频流继续增长,使得在有限的内存预算下有必要进行驱逐。流式传输的关键挑战是驱逐必须在问题到达之前发生,因此必须在没有问题的情况下决定保留哪些内容。现有的驱逐方法使用位置、注意力或键值表示从 KV 缓存本身获取词元分数,而基于注意力的分数还需要代理查询或额外的计算。混合主干网提供了另一种信号源。在门控增量线性注意力中,循环状态由每个输入和已经从状态中检索到的内容之间的残差进行更新,因此它在帧块上的变化反映了该块带来了多少新信息。我们提出了 DeltaS,一种与查询无关、免训练的方法,它保留导致更大标准化状态变化或状态漂移的视频块。在与固定预算和保留政策的受控比较中,状态漂移优于基于位置、注意力和关键值的信号。由于信号仅花费前向传递的 1.9%,DeltaS 在六个长视频基准测试中平均超过最强的查询无关有界内存基线 2.1 点,在最长基准测试中超过 5.6 点。这些结果表明混合架构的两个存储器可以协同工作。代码可从此 https URL 获取。