论文

解耦与缓存:流媒体视频理解的KV缓存构建

Decouple and Cache: KV Cache Construction for Streaming Video Understanding

模型推理KV Cache

摘要

流视频理解需要使用有限的内存和计算来处理无限的视频流,这带来了两个关键挑战。首先,无界流需要不断构建新的和驱逐旧的键值(KV)缓存。其次,由于在无界流上收集和训练的成本很高,模型必须从短序列中学习,同时推广到长流。现有的流式 VideoVLLM 无法扩展到无限制的视频流或专注于缓存重用策略,从而导致缓存构建的影响尚未得到充分研究。在本文中,我们提出了解耦流缓存(DSCache),这是一种 无需训练 缓存构建机制,可将预训练的离线模型适应流设置。 DSCache 维护累积的过去 KV 缓存,同时按需构建单独的即时缓存,与过去的缓存解耦以保留最近输入的信息性。为了实现超出训练长度的位置外推,DSCache 进一步结合了位置无关的编码策略,确保 KV 缓存支持未见过的位置并防止位置溢出。流视频 QA 基准测试的实验证明了 DSCache 的最先进的性能,与之前的方法相比,准确度平均提高了 2.5%。