论文
DynaCalKV:通过头分组和自适应排名分配进行键值缓存压缩
DynaCalKV: Key-Value Cache Compression via Head Grouping and Adaptive Rank Allocation
摘要
由于 大语言模型 (LLM) 的推理阶段需要处理长上下文窗口,键值 (KV) 缓存最初似乎可以解决这一挑战,但随着上下文窗口的不断增长,最终成为一个重要的瓶颈。低秩压缩最近被研究为一种在保持模型性能的同时减少 KV 缓存内存的有效方法。然而,尽管键和值缓存的作用不同,但只有少数现有方法以不同的方式处理它们。此外,这些方法通常采用固定的注意力头分组,这可能无法充分利用注意力头之间的结构相似性。在本文中,我们提出了一种改进的低秩 KV 缓存压缩框架。对于密钥缓存,我们基于中心核对齐(CKA)相似性动态分组注意力头,并在参数预算下自适应分配排名预算。对于Value缓存,我们采用与ReCalKV相同的方法,通过离线校准细化低秩分解,以提高重建质量。三个指令调整的 LLM 的实验结果表明,我们的方法减少了 Key 缓存参数的数量,同时保持了有竞争力的准确性。我们进一步观察到,所提出的策略对于多头注意力(MHA)模型特别有效,而它应该更保守地应用于分组查询注意力(GQA)模型,特别是在长上下文设置中。