论文
Codec-Gauge:学习 Transformer KV 缓存的压缩友好规格
Codec-Gauge: Learning Compression-Friendly Gauges for Transformer KV Caches
摘要
长上下文 Transformer 推理越来越依赖于 KV 缓存压缩或量化。先前的旋转和变换编码结果表明,每个键/值向量的通道基础会影响固定后端保留模型行为的忠实程度。我们引入了 Codec-Gauge,这是一个 后训练 缓存协调层,它可以学习围绕现有压缩和量化后端的小型正交通道变换。其频率分布目标将词元通道 DCT 频谱质心损失与平滑速率代理相结合,将 KV 能量集中在面向低频编解码器的布局中。我们使用测量的字节和滚动压缩历史评分来评估实际的压缩和解压缩。在 $3$、$4$ 和 $6$ 位/值的六个模型中,学习量规相对于原始坐标将 zfp KL 散度平均减少 $44.0\%$,并且优于随机、Hadamard、DCT 和 PCA/KLT 控制。相同的量规可改善块均匀和 KIVI 式量化的质量保存。 27B 模型和长上下文任务提示的实验重现了质量趋势,而串行存储和时序测量则验证了所实现的压缩缓存路径。这些结果将缓存坐标几何图形确立为实用的 后训练 变量,用于提高压缩保真度,而无需更改模型权重、注意力语义或后端编码规则。