论文

从语言输入角度重新思考视频语言模型

Rethinking Video-Language Model from the Language Input Perspective

上下文与知识上下文工程

摘要

在大语言模型浪潮的推动下,视频语言模型(VLM)已成为弥合视频和文本之间差距的一项重要但具有挑战性的技术。尽管之前的 VLM 工作已经取得了显着的进展,但几乎所有的工作都隐含地假设所有文本都是由特定模板预定义的。在现实世界的应用中,这样严格的假设是不可能满足的,因为1)预定义所有文本非常耗时且费力。 2)这些预定义的文本输入限制太多且用户不友好,限制了它们的应用。据观察,给定视频输入,具有相似语义但不同模板的文本会导致不同的性能。为此,在本文中,我们提出了一种新颖的即插即用框架,适用于各种基于 VLM 的方法,以完全桥接视频和文本。具体来说,我们首先从原始文本生成正面和负面文本,以针对特定的文本组件。然后,我们提出了一种基于属性的文本推理策略来挖掘生成文本的细粒度文本语义。最后,我们利用视频作为指导,通过设计自加权损失来进行跨模态桥接。大量实验表明,所提出的方法可以作为即插即用模块,有效提高最先进的 VLM 的性能。