论文

CoRDS:基于Coreset的流媒体视频理解的代表和多样化选择

CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding

模型推理KV Cache

摘要

使用大型视觉语言模型 (VLM) 进行流式视频理解需要紧凑的内存,以支持对不断增长的视觉历史进行未来推理。常见的解决方案是压缩键值 (KV) 缓存,但现有的流方法通常依赖于本地 token-wise 启发法,例如新近度、时间冗余或显着性,这些方法不会显式优化保留的缓存是否代表累积的历史记录。我们建议将 KV 缓存压缩视为核心集选择问题:我们选择一个涵盖累积视觉缓存几何形状的小子集,而不是独立对保留进行评分。我们的方法以联合 KV 表示形式运行,并引入双标准目标,平衡键和值空间的覆盖范围,保留检索结构和输出相关信息。为了鼓励更多样化的保留子集,我们进一步引入了正交驱动的多样性标准,该标准有利于候选者在当前选择之外贡献新的方向,并将该标准与对数行列式子集选择联系起来。在四个开源 VLM 和五个长视频和流视频基准测试中,我们的方法在固定缓存预算下比启发式流压缩基准有所改进。这些结果表明,代表性核心集选择为内存受限的流视频理解提供了比 token-wise 修剪更有效的原则。