论文

StoryVideoQA:通过大规模、多流派和自动生成的数据集扩展深度视频理解

StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset

模型评测基准与评测资源

摘要

视频问答(VideoQA)旨在回答有关给定视频的问题。虽然现有方法在事实视频质量检查方面表现出色,但它们在深度视频理解 (DVU) 方面遇到了困难,这需要理解复杂的故事情节。这一挑战源于固有的远程视频内容、多方面的问题类型和实例级故事元素,所有这些都限制了手动构建的 DVU 数据集的规模和多样性。这些困难限制了手动构建的 DVU 数据集的规模和多样性。为了解决这些问题,我们之前引入了 StoryMind 来自动构建具有平衡细粒度主题的 DVU 数据集。尽管它可以为电视剧生成高质量的问答对 (QA),但在处理更长、更复杂的电影时,它的性能会显着下降。在本文中,我们进一步设计了 StoryMindv2,这是一个增强的多智能体协作框架,可为电视剧和电影生成高质量的 DVU 数据集。通过集成新颖的监督引导生成机制和完善的多审稿人投票策略,该框架用于构建迄今为止最大的 DVU 数据集 StoryVideoQA,对 393.2 小时的不同故事视频(包括电视剧(平均 1,635 秒)和电影(平均 7,878 秒))进行了超过 363K 的 QA。在这个大规模基准上对 20 种最先进的 VideoQA 方法进行的综合评估表明,它们无法完全维持远程角色关联或对复杂故事情节构建连贯的理解。为了弥补这一差距,我们提出了 PlotTree,一种新颖的视频理解代理,它将远程视频内容重新组织成分层情节结构,从而在 StoryVideoQA 上实现高效的故事情节推理。项目页面:https://github.com/nercms-mmap/StoryVideoQA/