论文
MELON:用于多事件文本到长视频检索的大规模数据集
MELON: A Large-Scale Dataset for Multi-Event Text-to-Long-Video Retrieval
摘要
现有的文本视频检索数据集主要由包含单个主导事件的短片组成。虽然适合测量基本的视觉语言对齐,但它们在捕获现实世界的检索场景方面受到限制,其中长格式视频自然包含多个语义上不同的事件,并且单个文本查询可能对应于多个不连续的时间段。为了弥补这一差距,我们引入了 MELON,这是第一个大规模数据集,旨在将文本视频检索扩展到具有复杂、多事件结构的长视频。 MELON 明确注释了每个视频的多个事件间隔及其相应的文本描述,从而能够在未经修剪的长视频中训练和评估多事件理解。此外,我们提出了一种多事件感知损失,鼓励模型区分完整事件和部分事件匹配,从而显着提高检索准确性。 MELON 数据集和我们提出的损失为将文本到视频检索扩展到复杂的长格式场景奠定了坚实的基础,并为该领域的未来研究提供了更现实的评估设置。