论文
梦想:通过双目标编码扩展视觉语言模型以进行跨模态检索
DREAM: Extending Vision-Language Models with Dual-Objective Encoding for Cross-Modal Retrieval
摘要
在当今媒体驱动的世界中,监控、教育和娱乐等领域的视频内容呈指数级增长,使得通过自然语言查询检索语义相关的视频变得越来越重要。早期的视频检索系统依赖于手工制作的特征或浅层跨模式映射,限制了它们捕获复杂语义和时间动态的能力。虽然大规模视觉语言模型改进了跨模态对齐,但在建模细粒度时间依赖性和细致入微的语言结构方面仍然存在挑战。在本文中,我们介绍了 DREAM:双路径表示增强和对齐模型,这是一种新颖的多模式框架,可通过增强的视觉和文本编码来解决这些限制。 DREAM 采用混合语言建模策略,结合屏蔽和排列语言建模目标来捕获本地和全局语言语义。在视觉方面,我们设计了一个具有级联组注意力的分层视觉编码器,它通过多阶段词元交互和从粗到细的注意力细化来整合空间和时间信息。我们通过对广泛使用的 MSRVTT、MSVD 和 LSMDC 基准数据集进行综合评估来验证 DREAM,它分别获得了 49.4%、49.7% 和 27.3% 的最新 R1 分数。定性分析进一步表明该模型能够保持跨帧的一致注意力并将复杂查询与动态视频内容对齐。这些发现强调了分层注意力和双目标文本建模在实现稳健的上下文感知视频检索方面的有效性,并为推进跨模式表示学习的未来研究铺平了道路。