论文
不是另一个文本基准:将“视觉”放回大型视频模型的视觉问答中
Not Another Text Benchmark: Putting the "Visual" Back in Visual Question Answering for Large Video Models
摘要
由于强大的预训练文本和视觉编码器的兴起,大型视频模型在各种视觉问答任务中表现出了令人印象深刻的性能。此类模型的实用性也在广泛的基准测试中得到了证明,但有一个重要的警告 - 这些基准测试中的主要方法是通过文本选项评估多项选择推理。这是在这些模型中测试基于文本的推理的自然方法,并且导致了关于社区中模型行为的重要见解。在这项工作中,我们提出了一个不同的问题——当评估方式是视觉而不是文本时会发生什么?我们在时间帧检索、视频未来预测和因果记忆失真方面引入了三个新的以视觉为中心的评估基准,所有这些基准都是围绕评估大型视频模型中的视觉理解能力而设计的。我们的方法补充了评估前沿模型中视频理解的现有方法。我们表明,当前的前沿模型在尝试通过视觉查询而不是文本进行推理时表现出明显的弱点。我们以扩展分析部分结束,该部分为未来改进大型视频模型的视觉理解提供了指导。