论文
Sigmoid Attention 作为学习 KV 缓存驱逐的更好基础
Sigmoid Attention as a Better Substrate for Learned KV Cache Eviction
摘要
学习的 KV 缓存驱逐通常面临软到硬的不匹配:在训练期间,可微门通常会减弱词元贡献,而推理仅在物理删除 KV 条目时才能节省内存。我们询问注意力基底是否会影响这种从软到硬的转变。使用在 OpenWebText 上训练的 GPT-2-scale Transformer,我们对注意力类型、学习门控和位置编码进行受控的 $2\times2\times2$ 比较。尽管 sigmoid 注意力作为密集语言模型更糟糕,但学习的硬驱逐改变了有用的操作点:sigmoid 门控模型删除了 KV 条目,相对于它们自己的非驱逐引用,PPL 变化可以忽略不计。在相同密集主干上的匹配实时缓存协议下,学习的 sigmoid 门获得比我们的 H$_2$O 和 KeyDiff 实现更低的 PPL,而 softmax 门并不能统一击败这些事后方法。结果表明,注意力归一化可以极大地影响训练时软门是否干净地转移到硬 KV 删除。