论文
MuKV:用于长流视频问答的多粒度 KV 缓存压缩
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
摘要
由于视觉标记的不断增长和 大语言模型 (LLM) 的推理长度有限,长流视频 QA 仍然具有挑战性。 KV 缓存通过 LLM 预填充存储历史词元的键值 (KV),并实现更高效的流式 QA。然而,现有的方法会缓存每一帧或两帧,从而导致冗余的内存使用,并丢失帧内的细粒度空间细节或跨帧的时间上下文。本文提出了 MuKV,一种采用多粒度 KV 缓存压缩模块和半分层检索方法的方法,可提高长流视频质量检查的效率和准确性。对于离线 KV 缓存,MuKV 提取补丁级、帧级和段级的视觉表示。多个粒度级别保留了局部线索和全局时间上下文,同时通过自注意力和频率引导的双信号词元压缩机制保持了效率。对于在线 QA,MuKV 设计了一种半分层检索方法来检索相关的 KV 缓存以生成答案。长流 VideoQA 基准测试表明,MuKV 显着提高了答案准确性,而无需牺牲内存和在线 QA 效率。此外,我们的压缩机制本身就在答案准确性、记忆力和 QA 效率方面带来了与基线相比一致的优势,展示了高效的贡献。