论文
ViLL-E:用于检索的视频 LLM 嵌入
ViLL-E: Video LLM Embeddings for Retrieval
摘要
视频 大语言模型 (VideoLLM) 擅长输出文本的视频理解任务,例如视频问答和视频描述。然而,它们在检索任务(例如文本到视频检索和时刻检索)中表现不佳。我们推出了 ViLL-E (Video-LLM-Embed),这是一种统一的 VideoLLM 架构,具有新颖的嵌入生成机制,允许模型对复杂视频“思考得更久”,并针对简单视频提前停止。我们采用生成式学习和对比式学习相结合的三阶段训练方法来训练该模型:初始大规模 预训练 与视频描述对;随后对较小的细粒度视频描述数据集进行持续训练;最后以特定于任务的 微调 来总结一个新颖的多任务数据集,涵盖视频 QA、时间定位、视频检索和视频文本匹配。我们的模型显着改善了时间定位(比其他 VideoLLM 平均提高了 7%)和视频检索(比双编码器模型提高了 4%),实现了与最先进的专用嵌入模型相当的性能,同时在 VideoQA 任务上保持竞争力。此外,我们的联合对比生成训练解锁了新的零样本功能,在组合视频检索(比 SotA 增加 5%)和长文本检索(比 SotA 增加 2%)方面显着优于最先进的方法。