论文
LongEgoRefer:长篇自我中心视频引用表达理解的基准
LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension
摘要
以自我为中心的视频捕捉了丰富多样的人与物体的交互,并已成为理解与物体相关的人类活动的基本资源。在这种情况下,视频引用表达理解(Video REC)是在给定自然语言查询的情况下定位视频帧中引用对象的时间和空间范围的任务,在将文本描述与未经修剪的自我中心记录中观察到的对象联系起来方面发挥着关键作用。然而,现有的以自我为中心的视频录制基准主要集中在短视频剪辑上,其中一些目标对象密集地出现在帧内。这样的设置并不反映现实世界中以自我为中心的记录,这些记录是长篇的、未经修饰的,其特点是对象出现稀疏和活动转换复杂。为了解决这一限制,我们引入了 LongEgoRefer,这是一种新颖且具有挑战性的基准,由 Ego4D 数据集中的长格式视频构建。 LongEgoRefer 包含 1,498 个引用表达式,平均视频时长为 45 分钟。该基准展示了极端的目标稀疏性、详细的语言描述以及嵌入长期、动态的自我中心叙述中的复杂的人与物体交互。因此,它定义了一个要求很高的时空定位问题,要求模型识别事件何时发生以及所涉及的对象出现在扩展视频序列中的位置。我们评估现有的视频 REC 方法,包括基于视觉语言模型与 Grounded SAM2 相结合的 无需训练 基线。大量实验表明,即使是先进的基线和当前最先进的模型在 LongEgoRefer 上也表现不佳。这些结果凸显了长篇自我中心时空定位的内在困难,并强调需要更强大的视频理解模型。