论文

VEDJE:用于可扩展视频文本检索的视频高效判别联合编码器

VEDJE: Video-Efficient Discriminative Joint Encoder for Scalable Video-Text Retrieval

应用与实践模型推理推理加速搜索

摘要

找到正确的视频通常需要区分发生不同事件的相似场景。联合匹配改进了检索,但处理每个查询的丰富视频表示的成本很高。 VEDJE 压缩采样帧内的特征,同时将它们的表示形式单独保存在可重用的缓存中。特征变化预测提供了辅助训练信号,可以改进从压缩缓存中的检索,而无需在查询时添加工作。在 MSR-VTT、MSVD、DiDeMo 和 ActivityNet 上,VEDJE 在两个检索方向上都比匹配的第一阶段检索器改进了 R@1。在 MSR-VTT 上,通过微调的 VideoCLIP-XL 第一阶段,它达到 59.8 文本到视频 R@1。在 VideoPrism 配置中,将每个视频缓存缩小四倍至 12 KiB,可将文本到视频的召回率保持在 0.2 点以内。这些结果表明,准确的视频搜索可以对紧凑的证据进行操作,编码一次并在新查询到达时重复使用。