论文

事务注意力:KV 缓存保留的语义赞助

Transactional Attention: Semantic Sponsorship for KV-Cache Retention

模型推理KV Cache

摘要

在 K=16 个词元(4K 上下文的 0.4%)时,每种现有的 KV 缓存压缩方法在凭证检索方面都实现了 0%。失败模式是休眠词元:凭证、API 密钥和配置值受到的关注几乎为零,但在生成时变得至关重要。由于这些词元缺乏驱逐政策所依赖的统计信号,因此没有基于注意力分数、重建损失或学习保留门的方法可以保留它们。我们引入了事务性注意力(TA),这是一种赞助机制,其中结构锚定模式(例如“密钥:”,“密码:”)保护相邻的具有价值的词元不被驱逐。 TA 在 K=16 时实现 100% 的凭证检索,其中六个基线(H2O、TOVA、SnapKV、StreamingLLM、PyramidKV、DynamicKV)实现 0%,并在 200 个函数调用试验中保持 100% 的准确性。 TA-Fast是一种attention-free变体,可减少52%的内存开销,并与SDPA和FlashAttention兼容。 TA 与现有压缩方法正交,增加的延迟开销不到 1%。