论文

TriAttention:利用三角 KV 压缩进行高效长推理

TriAttention: Efficient Long Reasoning with Trigonometric KV Compression

模型推理KV Cache

摘要

大语言模型 (LLM) 中的扩展推理会造成严重的 KV 缓存瓶颈。领先的 KV 缓存压缩方法使用最近 RoPE 后查询的注意力分数来估计 KV 重要性。然而,RoPE 过程中查询会随着位置轮换,使得代表性查询非常少,从而导致顶键选择不佳和推理不稳定。为了避免这个问题,我们转向 RoPE 之前的空间,我们观察到 Q 和 K 向量高度集中在固定的非零中心周围,并且在各个位置上保持稳定 - Q/K 集中。我们表明,这种集中导致查询优先关注特定距离的键(例如,最近的键),中心通过三角级数确定优先选择哪些距离。基于此,我们提出 TriAttention 通过利用这些中心来估计关键重要性。通过三角级数,我们使用这些中心表征的距离偏好根据其位置对键进行评分,并利用 Q/K 范数作为重要性估计的附加信号。在具有 32K 词元生成的 AIME25 上,TriAttention 与 Full Attention 推理精度相匹配,同时实现了 2.5 倍的吞吐量提高或 10.7 倍的 KV 内存减少,而领先的基线在相同效率下仅实现了大约一半的精度。 TriAttention 使 OpenClaw 能够部署在单个消费者 GPU 上,否则长上下文会导致 Full Attention 内存不足。