论文
MotionEnhancer:利用视频扩散实现运动增强视觉语言模型
MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models
摘要
新时代见证了扩展视觉语言模型(VLM)以解决视频理解任务的卓越能力。虽然当前的 VLM 擅长事件或故事级别的理解,但它们捕获细粒度运动细节的能力仍然有限,这主要是由于它们关注高级静态语义结构和宏观事件逻辑。相比之下,视频扩散模型(VDM)受益于大规模视频数据和时间生成的内在要求,擅长对动态运动模式进行建模。在本文中,我们介绍了 MotionEnhancer,这是一种新颖的方法,它利用从强大的视频扩散模型中提取的运动先验作为辅助监督,通过注意力对齐来增强 VLM 的运动理解能力。 MotionEnhancer 包含两个简单的无参数模块:运动敏感头选择 (MHS) 和运动显着文本标记识别 (MTTI),以仅计算的方式直接从 VDM 中提取和优化运动相关的注意力。 MotionEnhancer 为运动理解提供了可扩展的解决方案,无需额外的训练参数、对现有架构的修改或工具调用。大量实验表明,MotionEnhancer 在两个运动级视频理解基准上,尤其是在运动相关指标上,可以比最先进的 VLM 取得一致的改进。