论文
激励视觉语言模型搜索长视频问答
Incentivizing Vision Language Models to Search for Long Video Question Answering
摘要
我们引入了 VSeek,这是一个代理框架,它将长视频问答(LVQA)从被动的单通道感知任务转变为多轮检索过程。 VSeek 利用自然语言驱动的搜索来识别长视频中的相关上下文,并通过强化学习 (RL) 进行后训练,以联合制定目标搜索查询并对检索到的剪辑进行推理以进行 LVQA。虽然 RL 后训练 彻底改变了数学和代码等符号领域的推理,但其在长视频理解中的应用仍然因缺乏经过验证的奖励而受到阻碍。为了确保检索到的上下文是相关的,我们提出了一种新颖的神经符号方法,它将开放式自然语言与离散视觉验证联系起来。具体来说,复杂的用户查询被编译成正式的时态逻辑规范,用于系统地将自然语言问题分解为所需原子视觉原语的明确清单,例如关键对象和活动及其时间顺序。这些系统派生的视觉定位事件为 RL 后训练 提供了关键的反馈信号,基于成功检索这些特定视觉元素,而不是完全依赖于仅结果的答案准确性,实现密集的、可验证的奖励。通过明确优化这种可验证的证据寻求行为,与基本模型相比,VSeek 在长视频理解基准上将 Pass@1 分数提高了 8%,将 Pass@4 分数提高了 15%。我们在 https://utaustin-swarmlab.github.io/VSeek 开源我们的代码。