论文
MARS:用于文本视频检索的多模态 大语言模型 隐藏了哪些检索信号?
MARS: What Retrieval Signals Are Hidden in Multimodal Large Language Models for Text-Video Retrieval?
摘要
文本视频检索需要能够区分具有相似场景、动作和时间模式的视频的表示。最近的多模态 大语言模型 已被改编为嵌入模型,但它们通常使用最后一层的单个标记来表示每个输入。这可以将不同的视频文本线索压缩为单个向量并限制细粒度检索。为了解决这个限制,我们提出了 MARS,一种用于文本视频检索的多层和多槽嵌入框架。 MARS 通过组合来自不同解码器层的隐藏状态来构造多个自适应表示槽,比较相应的文本和视频槽,并聚合它们的相似性以进行检索。为了更好地处理令人困惑的候选者,我们进一步引入了硬负感知槽专业化目标,鼓励槽捕获有区别的匹配线索。对四个文本视频检索基准的实验表明,MARS 在基于直接相似性的检索和重新排名设置方面都取得了最先进的结果。消融研究和分析表明,多层融合、多个时隙和硬负感知时隙专门化提供了互补的增益。代码可在 https://github.com/sejong-rcv/MARS 获取。