论文

QMAVIS:利用大型多模态模型融合的长视频音频理解

QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models

上下文与知识上下文工程

摘要

用于视频音频理解的大型多模态模型(LMM)以往只在几分钟长的较短视频上评测。本文提出QMAVIS(Q Team-Multimodal Audio Video Intelligent Sensemaking),一个通过对LMM、大语言模型和语音识别模型进行晚期融合构建的新型长视频音频理解流水线。QMAVIS弥补了长视频分析的空白,特别是针对几分钟到超过一小时的长视频,为态势理解、视频内容分析、具身AI等开辟了新的潜在应用。使用QMAVIS的定量实验显示,在包含带音频信息长视频的VideoMME(含字幕)数据集上,较VideoLlaMA2和InternVL2等最先进的视频音频LMM提升38.75%。在PerceptionTest和EgoSchema等其他具有挑战性的视频理解数据集上的评测取得了最高2%的提升,显示出有竞争力的性能。定性实验还表明,QMAVIS能够提取长视频音频内容中不同场景的细微差异,同时理解整体叙事。此外还进行了消融研究,以确定融合流水线中各组件的影响。

QMAVIS:利用大型多模态模型融合的长视频音频理解 配图
图 1:QMAVIS 融合架构。