论文

弹出式干扰揭示了视频中的事件包行为 大语言模型

Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models

模型评测基准与评测资源

摘要

视频理解的一项关键功能是将主题与不同时间的事件可靠地联系起来,但 Video 大语言模型 (VideoLLM) 是否真正实现了这一点仍不清楚。在这项工作中,我们引入 DistractionBench 来评估 VideoLLM 是否可以在存在不相关视频片段的情况下稳健地链接主题和事件。通过受控干预,例如将短广告剪辑插入较长的视频中,我们发现 VideoLLM 经常产生来自不同片段的实体之间的交互幻觉,错误地将插入广告的动作归因于主视频中的主题。我们将这种系统性幻觉描述为事件袋 (BoE) 行为,其中模型将视频处理为事件集合而不是时间结构序列。通过评估 11 个流行的 VideoLLM,我们发现所有模型都表现出大量的 BoE 行为。我们的研究结果表明,VideoLLM 缺乏可靠的时间基础机制,并促进了具有更强大的主题-事件关联的模型的开发。