论文
HybridKV:面向高效多模态大语言模型推理的混合KV缓存压缩
HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
摘要
多模态大语言模型(MLLM)推动了文本、图像与视频上的统一推理,但其推理受到键值(KV)缓存快速增长的制约。每个视觉输入都会扩展为数千个词元,使缓存随上下文长度线性增长并在整个解码过程中常驻GPU显存,即便在高端GPU上也造成难以承受的内存开销与延迟。一种常见方案是在固定分配预算下以不同粒度压缩缓存:词元级统一丢弃较不重要的词元,层级在不同层之间改变保留量,头级在各注意力头之间重新分配预算。然而这些方法止步于预算分配,忽视了注意力头的异质行为,而后者需要不同的压缩策略。我们提出HybridKV,一个在三个阶段整合互补策略的混合KV缓存压缩框架:首先利用以文本为中心的注意力将注意力头分为静态或动态两类;随后由自顶向下的预算分配方案分层分配KV预算;最后对静态头采用文本先验剪枝压缩,对动态头采用分块检索压缩。在Qwen2.5-VL-7B上对11个多模态基准的实验表明,HybridKV最多可将KV缓存内存降低7.9倍,并实现1.52倍的解码加速,与完整缓存的MLLM相比几乎没有性能下降,甚至有所超越。
