论文
超越稀疏权重:注意力何时可压缩?
Beyond Sparse Weights: When Is Attention Compressible?
摘要
KV 缓存压缩通常通过具有一些大权重的注意力图来证明是合理的。这是不完整的:大的权重可能不包含大部分质量,省略的值可能会被取消,并且保留注意力输出可能不会保留任务。我们将这些问题分开。全局分数差距(而不是阈值计数)决定需要多少词元才能保持目标质量。对于已实现的行,省略值的加权和是精确的缺失统计量。受控检索聚合模型解释了截断何时有用、何时有害。这些结果激发了 CertKV,一种 无需训练 压缩器,它为每个头保留一个尾部摘要槽,并通过值分散来分配其余部分。在匹配的预算下,CertKV 在 9 个 LongBench-v2 设置中的 7 个中排名前两名,在 128K RULER 上保持领先的压缩层,并在打包的 Llama 原型中实现了十倍的缓存预算。可压缩性取决于质量、值、未来的查询和任务——而不仅仅取决于看起来稀疏的地图。