论文
StreamEMS:针对视觉语言模型的具有自进化记忆方案的流式视频理解
StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models
摘要
最近,已经提出了许多流视频理解方法,通过构建外部存储器来存储历史数据以减少计算量。大多数方法侧重于优化当前数据的注入过程(写入)和从内存中检索信息丰富的历史数据(读取),而忽略了进一步增强内存本身表示能力的机会。在这项工作中,我们提出了 StreamEMS,这是一种通过自进化内存方案重新构造存储在内存中的历史数据来提高流视频理解的通用机制,从而实现信息更丰富、更稳健的内存表示。具体来说,我们首先引入语义进化模块,通过利用从粗到细逐步缩小语义尺度发现的信息记忆实体,将记忆进化为信息更密集的表示。此外,我们进一步引入了先验进化模块,通过利用先前的内存分布来细化当前的内存状态,从而将内存进化为更鲁棒的表示。我们在广泛使用的流媒体视频理解数据集(即 OVO-Bench 和 StreamingBench)上验证了我们提出的设计的有效性,结果表明我们的方法比其他方法表现更好。此外,即使在高词元使用率下降率设置下,我们的方法的优势也变得始终显而易见,这表明我们的方法在释放内存本身潜力方面的有效性和鲁棒性。