论文
高效长视频推理的语义和视觉证据:HD-EPIC VQA 挑战的解决方案
Semantic and Visual Evidence for Efficient Long-Video Reasoning: A Solution for the HD-EPIC VQA Challenge
摘要
由于上下文长度有限且细粒度视觉细节的基础不足,理解长篇自我中心视频对于多模态 大语言模型 (MLLM) 来说仍然具有挑战性。最近提出的 HD-EPIC 基准测试强调了这些局限性:即使是强大的长上下文模型,在不同的视频问答任务中也会获得相对较低的性能。在本文中,我们提出了一个统一的框架,将长视频推理解耦为两种互补的证据形式:语义证据和视觉证据。语义证据通过从粗到细的提取管道捕获全局程序结构,而以对象为中心的视觉证据通过边界框和视觉嵌入保留细粒度的基础。在推理过程中,我们将推理制定为查询条件证据检索和集成过程,从两个来源动态选择相关信息。我们的方法在跨多个任务类别的 HD-EPIC-VQA 挑战赛中取得了具有竞争力的表现。更广泛地说,我们的结果表明,明确地构建、检索和集成语义和视觉证据对于使用 MLLM 进行有效的长视频理解至关重要。