论文

通过视觉记忆机制扩展多模态 大语言模型 的长视频理解

Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism

模型推理KV Cache

摘要

长视频理解是困扰 \emph{Multimodal 大语言模型} (MLLM) 进步的关键挑战。在本文中,我们从视觉记忆机制的角度研究这个问题,并提出了一种新颖的无需训练方法,称为\emph{Flexible Memory} (\textbf{FlexMem})。原则上,FlexMem 的目标是模仿人类观看视频的行为,即不断观看视频内容并回忆最相关的记忆片段来回答问题。通过这种方式,FlexMem可以帮助MLLM实现无限长度的视频理解,而不像以前一次性处理所有视频信息并且有输入上限的方法。具体来说,FlexMem首先考虑视觉KV缓存作为内存来源,通过双路压缩设计实现有效的内存传输和写入。随后,FlexMem 还针对不同的视频理解任务(包括流行的流媒体任务)探索了不同的内存读取策略。为了验证 FlexMem,我们将其应用于两个流行的视频 MLLM,并对五个长视频和一个流视频任务进行了广泛的实验。实验结果表明,在 \textbf{单个 3090 GPU} 上,我们的 FlexMem 可以比现有的高效视频理解方法取得明显的改进,并处理超过 \textbf{1k 帧},这也有助于基础 MLLM 在某些基准测试(例如 \emph{e.g.}、GPT-4o 和 Gemini-1.5 Pro)上实现与 SOTA MLLM 相当甚至更好的性能。