论文
ReMem:具有长上下文保留的流式视频理解
ReMem: Streaming Video Understanding With Long Context Retention
摘要
尽管当前的视觉语言模型(VLM)在各种视频理解任务上表现出色,但主要是为离线场景设计的,很难处理需要低延迟响应的在线流媒体视频。一些研究探索了记忆和token压缩策略,试图使离线VLM适应流视频理解任务。然而,通过我们的探索实验,我们发现大多数现有作品往往会随着输入流长度的增加而逐渐丢失长上下文信息。为了解决这个问题,我们提出了 ReMem,一种新颖的无需训练适应技术,使VLM能够处理任意长度的流视频,同时提高其长上下文信息保留能力。 ReMem 从两个角度利用记忆,作为两个核心组件实现。流上下文记忆 (SCM) 通过独立于查询的关注持续压缩历史上下文。然后,检索视觉记忆 (RVM) 从记忆检索最显着的、与查询相关的上下文,以增强VLM的输入。综合实验表明,所提出的 ReMem 在各种广泛使用的基准测试中实现了最先进的 (SOTA) 性能,涵盖流视频和一般的长视频理解任务。
