论文

RippleKV:通过扰动传播进行跨层 KV 缓存分配

RippleKV: Cross-Layer KV Cache Allocation via Perturbation Propagation

模型推理KV Cache

摘要

长上下文 LLM 推理受到 KV 缓存内存的瓶颈,但跨层分配有限的缓存预算仍然具有挑战性。现有方法依赖于诸如层深度、注意力统计或表示变化等代理。这些代理不测量每一层的扰动如何传播到输出,因此可能导致敏感层分配不足,而容忍层分配过度。为了解决这个问题,我们提出了 RippleKV,它通过估计对每层值缓存的扰动如何影响最终的预测分布来跨层分配缓存。 RippleKV 独立地将范数自适应扰动注入到每一层的值缓存中,并在小型校准集上测量模型输出处诱发的 KL 散度。对这些响应进行平均会产生特定于模型的灵敏度曲线,该曲线不需要随深度单调变化。然后,RippleKV 通过标准化敏感度分数并应用指数映射,将敏感度配置文件转换为层预算乘数。比率参数控制敏感层和容忍层之间的分配差异,而最终标准化保留 KV 缓存预算。 LongBench 上的实验表明,在匹配的缓存预算下,RippleKV 在评估的 KV 缓存压缩方法中实现了最高的平均性能。