论文
用于多事件长视频理解的模块化动态粒度视频 LLM
Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding
摘要
视频大语言模型(视频LLM)在各种视频理解任务中取得了显着的进步。然而,由于有限的视觉 词元预算 和捕获多个关键事件的需要之间的紧张关系,长视频场景仍然具有挑战性。现有方法通常分两个阶段处理长视频,即 i)选择关键帧和 ii)执行详细感知,这表现出局限性:它们缺乏自适应容量分配和自我校正的模块化机制,导致建模不可靠。为了应对这些挑战,我们提出了 MoD-VLLM,这是一种新颖的模块化动态粒度视频 LLM 框架,用于多事件长视频理解,它以迭代和自我反思的方式统一了时间基础和语义理解。具体来说,我们提出了正负视频片段时序定位模块和模块化动态粒度反射模块,它们形成闭环以逐步定位与问题相关的视频片段。时序定位模块指示视频 LLM 根据视频问题区分相关视频片段和不相关视频片段。反射模块采用模块化调度程序,动态选择相关正片段的细粒度编码以捕获详细感知,并为负片段选择粗粒度编码以维护全局上下文。我们进一步提出了一种动态粒度强化学习策略,允许 MoD-VLLM 联合学习最佳基础策略和动态粒度视觉表示。此外,我们提出了 MEventBench,这是一个具有挑战性的多事件长视频基准,用于复杂的长视频推理。对多个长视频理解基准和我们的 MEventBench 进行的大量实验表明,MoD-VLLM 的性能显着优于最先进的基准。