论文
KARMA-MV:音乐视频因果问答的基准
KARMA-MV: A Benchmark for Causal Question Answering on Music Videos
摘要
虽然视频问答和跨模式理解方面取得了重大进展,但关于视觉动态如何驱动音乐视频中的音乐结构的因果推理仍未得到充分探索。我们引入了 KARMA-MV,这是一个源自 2,682 个 YouTube 音乐视频的大规模多项选择 QA 数据集,旨在测试模型整合时间视听线索的能力,以及在推理、预测和反事实问题中推理视觉到音乐影响的能力。与需要手动注释的传统数据集不同,KARMA-MV 利用 LLM 推理进行可扩展的生成和验证,产生 37,737 个 MCQ。我们提出了一种因果知识图(CKG)方法,通过跨模式依赖关系的结构化检索来增强视觉语言模型(VLM)。在最先进的 VLM 和 LLM 上进行的实验表明,以因果知识图谱为依据能够带来一致的收益——尤其是对于较小的模型——建立了音乐视频推理的显式因果结构的价值。 KARMA-MV 为推进超越相关性的因果视听理解提供了一个新的基准。