论文
冻结解码器,修复编码器:基于 SVD 的 KV 缓存压缩的参数高效适应
Freeze the Decoder, Heal the Encoder: Parameter-Efficient Adaptation for SVD-Based KV-Cache Compression
摘要
在单一共享学习率下比较参数有效的微调配方是一种常见但有缺陷的做法:当被比较的手臂具有非常不同的可训练参数计数时,共享速率可以同时抑制较大手臂的均值并扩大其方差,为最小手臂制造一个巨大的、看似多种子的显着优势,但这并不是真正的效果。我们在一个具体的设置中记录了这一混淆:基于事后 SVD 的 KV 缓存压缩,其中通过将其键/值权重分解为下投影(“编码器”)和上投影(“解码器”),将已经预训练的模型转换为低秩(多头潜在注意力样式)缓存,之后进行短暂的微调(“修复”)恢复截断损失的准确性。在共享学习率下,冻结解码器并仅修复编码器看起来明显优于修复解码器或同时修复这两个因素;一旦每只手臂都被赋予了自己调整的学习率,这种明显的优势就会消失,并且仅编码器的治疗反而会达到与替代方案相同的水平。 实际测量的可训练参数节省量减少了 3 倍,优化器状态内存节省了 3 倍。我们通过视觉语言模型(Qwen2.5-VL-3B-Instruct)上的每臂学习率调整和每个配置三个种子来验证这种奇偶性,以该协议涵盖的一个压缩比,并将其复制到跨两个骨干网的纯文本测试台上。因此,仅编码器修复是一种在训练时改造低阶 KV 缓存压缩的低内存插入方案,而我们记录并纠正的共享学习率陷阱是比较可训练参数计数不同的任何微调方案的一个警示结果。