论文
连接 KV 缓存量化和线性注意力:从理论到预训练权重迁移
Bridging KV-Cache Quantization and Linear Attention: From Theory to Pretrained Weight Migration
摘要
KV 缓存量化和线性注意力是解决 Transformer 存储和计算成本的两种代表性方法。 KV 缓存量化将单个 KV 条目压缩为离散代码,但保留所有条目,而线性注意力经常将多个历史 KV 贡献聚合为固定大小的连续状态,但会引入干扰。这种对比提出了一个问题:每 KV 压缩和多 KV 聚合是否可以在单一机制中桥接以实现有效关注。我们将 RAM-Net 视为通过离散地址空间上的软分配的桥梁。这些分配确定对与每个地址关联的连续槽状态的循环更新。在受限的 RAM-Net 结构下,我们证明软地址分配将硬量化匹配扩展到可分离的读写重叠,局部近似全注意力相似性并支持循环聚合。这些连接进一步使 Transformer 能够通过基于软量化的新路径进行权重迁移。 中间施工。在从 0.3B 到 7B 参数的 9 个预训练 Transformer 模型中,RAM-Net 平均恢复了教师对 6 个常识和知识任务的随机猜测的 87.1% 的准确率,每个模型仅使用 5 亿token预算。