论文

利用结构化视频提示改进视频语言模型中的时空推理

Improving Spatial-Temporal Reasoning in Video-Language Models with Structured Video Prompting

上下文与知识上下文工程

摘要

视频语言模型 (VLM) 对于需要跟踪一段时间内的事件并在特定空间区域提供答案的任务仍然很脆弱。我们建议,可以通过在推理时更好地组织视觉证据来解决部分限制。我们引入了结构化视频提示,这是一种 无需训练 推理时间方法,它通过轻量级空间结构和时间结构增强输入视频,为跨空间和时间组织证据提供显式锚点,而无需更改模型权重或解码,也无需更改主要比较中的问题提示。我们在两个互补的视频基准和两个开放视频语言模型上评估这种方法。在这些设置中,结构化输入在多种情况下可以提高性能,但增益因模型和任务而异。我们的研究结果表明,VLM 的一些失败不仅源于推理能力,还源于视频证据在推理时的呈现方式。这些结果强调结构化视频提示是提高视频理解的简单实用的方向。