论文

VisCache:视觉 KV 缓存修剪,实现高效视觉 大语言模型 推理

VisCache: Visual KV Cache Pruning for Efficient Vision Large Language Model Inference

模型推理KV Cache

摘要

虽然 Vision 大语言模型 (VLLM) 在多模态推理方面取得了显着的成功,但由于视觉键值 (KV) 缓存的大量计算和内存开销,其长上下文推理仍然非常昂贵。现有的 KV 压缩方法通常在视觉标记和层之间应用统一的剪枝,导致大量的信息丢失和性能下降。为了解决这一挑战,我们提出了 \textbf{VisCache},这是一种即插即用的框架,用于从粗到细的 \textbf{Vis}ual KV \textbf{Cache} 剪枝,无需训练,它由两个协同阶段组成。首先,轻量级 VLM 通过有选择地转发语义信息关键帧来过滤时间冗余。其次,我们介绍 {PruneKV},一种针对 VLLM 的注意力动态而定制的外科 KV 压缩算法。与严格的剪枝策略不同,PruneKV 采用抛物线分层预算分配以及非对称更新机制,在融合值的同时选择性地剪枝键,从而保留关键的上下文信息。大量实验表明,VisCache 显着提高了推理效率,实现了高达 {2.35$\times$ 的加速} 并显着减少了内存,同时保持了具有竞争力的性能,仅保留了 {19--28\%} KV 缓存保留。 VisCache 始终优于现有基准,在长上下文 VLLM 推理的效率和性能之间建立了新的 Pareto 前沿。代码可在 https://github.com/Wlklk/VisCache 获取