论文

HybridKV:面向高效多模态大语言模型推理的混合KV缓存压缩

HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference

模型推理KV Cache

摘要

多模态大语言模型(MLLM)推动了文本、图像与视频上的统一推理,但其推理受到键值(KV)缓存快速增长的制约。每个视觉输入都会扩展为数千个词元,使缓存随上下文长度线性增长并在整个解码过程中常驻GPU显存,即便在高端GPU上也造成难以承受的内存开销与延迟。一种常见方案是在固定分配预算下以不同粒度压缩缓存:词元级统一丢弃较不重要的词元,层级在不同层之间改变保留量,头级在各注意力头之间重新分配预算。然而这些方法止步于预算分配,忽视了注意力头的异质行为,而后者需要不同的压缩策略。我们提出HybridKV,一个在三个阶段整合互补策略的混合KV缓存压缩框架:首先利用以文本为中心的注意力将注意力头分为静态或动态两类;随后由自顶向下的预算分配方案分层分配KV预算;最后对静态头采用文本先验剪枝压缩,对动态头采用分块检索压缩。在Qwen2.5-VL-7B上对11个多模态基准的实验表明,HybridKV最多可将KV缓存内存降低7.9倍,并实现1.52倍的解码加速,与完整缓存的MLLM相比几乎没有性能下降,甚至有所超越。

HybridKV:面向高效多模态大语言模型推理的混合KV缓存压缩:论文配图
图 1:左:我们引入 HybridKV,这是一种混合 KV 缓存压缩框架,用于高效且有效的 MLLM 推理。 HybridKV 利用头部注意力模式(第 2 节中详细介绍)通过文本引导信号对静态和动态头部进行分类,从而通过定制的修剪和检索策略实现分层预算分配。右:HybridKV 优于包括 SnapKV Li 等人在内的现有同行。 (2024b),LOOK-M Wan 等人。 (2024),MadaKV Li 等人。 (2025) 和 SparseMM Wang 等人。 (2025) 在 Qwen2.5-VL-7B 上仅使用 10% 的 KV 缓存进行八个基准测试。性能指标显示为相对于完整缓存的百分比。