论文
MVEB:海量视频嵌入基准
MVEB: Massive Video Embedding Benchmark
摘要
我们引入了大规模视频嵌入基准 (MVEB),这是一个包含 23 个任务的视频嵌入基准,涵盖分类、零样本分类、聚类、对分类、检索和以视频为中心的问答。我们评估了 33 个模型,发现没有一个模型占据主导地位:基于 MLLM 的嵌入在分类、聚类、对分类和 QA 方面领先;多模式绑定导致检索和零样本分类;没有对比适应的生成 MLLM 在跨模式任务上崩溃。配对的纯视频与音频+视频评估表明,音频的贡献取决于数据集注释的出处:当标签由两种模态生成时,音频会有所帮助,而当标签仅由视觉生成时,音频会产生伤害,整个模型系列之间的六点差距一致。 MVEB源自MVEB+,一个184个任务池,旨在保持任务多样性,同时降低评估成本。它集成到 MTEB 生态系统中,实现跨文本、图像、音频和视频的统一评估。我们在 https://github.com/embeddings-benchmark/mteb 上发布了 MVEB 和所有 184 个任务以及代码和排行榜。