论文

LAION-BVD:1000 万小时的多模态开放视频数据集 预训练

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

模型训练合成数据

摘要

我们提出了 LAION-BVD,一个用于多模态学习的大规模开放视频数据集,其中包含从 CommonCrawl 收集的 1.3B 个特定于平台的视频 URL。我们从中下载了 8000 万个视频,总时长为 1000 万小时。该数据集专为跨视频、音频和图像模式的多模式 预训练 设计。使用内容感知场景检测,我们提取片段,并为其综合生成视频和音频字幕。根据这些数据训练的模型在标准视频文本和音频文本基准上实现了具有竞争力的性能,并且随着训练或模型规模的增加而不断改进。此外,我们通过提取场景变化帧来探索视频帧作为图像文本数据的替代来源。这些帧表现出与标准网络图像语料库不同的视觉分布,并且在此数据集上训练的模型实现了强大的图像文本检索性能。我们向研究界发布了 LAION-BVD。它以前所未有的规模显着扩大了对多模式视频的开放访问。