论文

建立动态和固定预算的内存库以实现高效的流媒体视频理解

Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding

摘要

目前,对于现有的 \emph{multimodal 大语言模型} (MLLM) 来说,流媒体视频理解仍然是一项艰巨的任务。其困难不仅在于处理不断增加的视频帧,还在于未来视频内容和输入指令的不可预测性。在本文中,我们从构建动态但固定预算的内存库的角度研究了这项任务,并提出了一种新颖的 无需训练 方法,称为 \emph{\textbf{CausalMem}}。 CausalMem致力于构建动态视觉记忆更新机制,从而在有限的记忆空间内最大化流式视频中的信息量,就像人脑一样。在实践中,CausalMem 估计视觉标记的冗余并通过在线语义基础更新记忆库,该基础语义对观察到的视频流的主要语义进行建模。为了验证 CausalMem,我们将其应用于两个代表性的 MLLM,分别是 LLaVA-OneVision 和 Qwen2.5-VL,并在流媒体和离线视频理解基准上进行了广泛的实验。实验结果不仅显示了在流媒体和离线设置下比现有方法的巨大优势,\emph{e.g.},平均准确率分别提高了 $+3.2\%$ 和 $+3.0\%$,而且还见证了流媒体视频的优越语义保存,\emph{e.g.},使用 12$k$ 词元预算 来记忆长达一小时的流媒体视频,实现了超过 \textbf{20$\times$}视觉词元压缩率高,仅占用约 \textbf{82 MB} 存储空间。 \textbf{我们的代码}在\href{https://github.com/hktk07/CausalMem}{CausalMem}中给出。