论文

了解文本到视频检索的性能高原:综合经验和语言分析

Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis

模型评测模型能力评测

摘要

文本到视频检索使用户能够使用自然语言查询查找相关视频内容,随着在线视频的快速扩展,这项任务变得越来越重要。在过去的六年里,研究产生了许多方法,例如双编码器、注意力驱动模型和多模态融合方法;然而,关于模型行为、数据集影响和查询难度的基本问题仍然存在。在这项工作中,我们在统一的预处理和评估框架下评估了 3 个广泛使用的数据集的 14 种最先进的检索方法。我们分析文本描述特征,包括长度、清晰度、语义类别以及动作与场景平衡,并将这些特征与模型性能联系起来。我们的结果表明,简短、清晰和简单的描述(例如描述单个动作或颜色属性的描述)可以实现更高的召回率,而复杂事件、多步骤活动或细粒度场景描述对于所有现有模型来说仍然具有挑战性。注意力驱动的架构可以更好地处理时间相关或多步查询,而双编码器和多模态融合模型主要在更简单或单类别描述上表现良好。跨数据集泛化随着更大、更多样化的文本描述集而提高,但生成文本描述并不能始终如一地提高检索准确性。总的来说,我们的研究结果强调了关键的数据集因素、基准挑战以及查询内容和模型架构之间的相互作用,为开发更有效的文本到视频检索系统提供了指导。