论文

SPHERICAL KV:角度域注意力和率失真保留,实现高效的长上下文推理

SPHERICAL KV: Angle-Domain Attention and Rate-Distortion Retention for Efficient Long-Context Inference

模型推理KV Cache

摘要

长上下文推理越来越受到 KV 缓存的限制:驻留内存随着上下文长度而增长,并且解码受到重复的高带宽内存 (HBM) 流而不是算术的限制。驱逐、开窗、量化和卸载等现有方法减少了占用空间,但通常只能部分解决关键路径瓶颈,特别是当压缩状态在解码期间仍必须重建为密集向量时。我们提出了 Spherical KV,一种长上下文推理方法,它将 KV 分配视为基于注意力几何的速率失真问题,以实现高效解码。该方法基于两个想法:(i)在解码热循环中廉价地表示方向信息,以及(ii)根据估计的未来效用分配保留和精度。它的第一个组件是角度域注意力(ADA),将密钥存储在由标量半径和紧凑角代码组成的球形参数化中,并直接从这些代码计算注意力 logits,而无需重建密集密钥。这保留了分页、块本地、融合友好的解码路径,并直接针对实际服务设置中的 HBM 流量。它的第二个组件,率失真保留(RDR),在固定预算下共同选择每个词元和头的保留/丢弃决策和精度层,生成具有轻量级元数据和合并读取的层同质页面。 ADA 和 RDR 共同提供了一种面向部署的机制,可减少 KV 驻留,同时保持解码效率。