论文
MultiVENT-Raw:原始视频检索和推理的基准
MultiVENT-Raw: A Benchmark for Retrieval and Reasoning over Raw Videos
摘要
在线信息越来越多地以视频形式被消费。其中大部分以“原始视频”的形式出现:用手机、手持相机或通过闭路电视拍摄的连续镜头,然后直接上传到社交媒体平台和内容共享服务。虽然专业甚至业余编辑的镜头往往以脚本语音、chyron、图形和元数据为特色,有助于将其主题背景化,但原始视频通常不包含这些内容,这使得它成为信息检索和机器理解更具挑战性的媒介。为了促进这一领域的进展,我们发布了 MultiVENT-Raw,这是一个多语言集合,包含近 120,000 个主要原始视频(总时间超过 5,300 小时),搭配 130 个事件和 222 个以事件为中心的查询,以及人工注释的视频相关性判断和人工提取的相关视频的关键事实。 MultiVENT-Raw 支持检索任务(识别集合中与查询事件相关的视频)和生成任务(将事件相关视频总结为目标用户的连贯报告)。我们在 MultiVENT-Raw 上进行了强有力的基准测试,表明即使对于一些最新的多模式模型来说,这两项任务也具有挑战性。