论文

TAU-Bench:从异常实例跟踪到细粒度视频异常理解

TAU-Bench: From Anomaly Instance Tracking to Fine-Grained Video Anomaly Understanding

模型评测基准与评测资源

摘要

人类通过连贯的感知过程来理解异常事件,在该过程中,他们识别焦点实例,随着事件的展开跟踪其行为,并解释为什么它违反了周围场景的预期。视频异常理解 (VAU) 旨在赋予模型类似的功能,不仅仅是确定视频是否异常,而是解释事件如何发展以及为何重要。尽管最近的视觉语言模型(VLM)可以生成详细且可信的异常描述,但它们的语义流畅性并不能确保这些解释随着时间的推移始终基于正确的异常实例。现有的基准通常通过单独的协议来评估跟踪和语义理解,而导致这种情况——语义不一致基本上无法测量。因此,我们引入了 TAU-Bench,这是一个以跟踪为中心的基准,用于联合评估异常实例跟踪和细粒度异常理解。 TAU-Bench 包含 1,118 个视频、1,454 个轨道和 202,438 个像素级掩模,涵盖 49 个事件和 45 个场景类别,以及连接实例级识别、事件级理解和场景级推理的以轨道为中心的注释。为了大规模构建 TAU-Bench,我们开发了一个自动化数据引擎,集成了异常适用性过滤、异常实例跟踪构建、分层视频描述标注和人工质量控制。对代表性 VLM 系列的评估表明,产生合理异常解释的模型可能仍然无法可靠地定位和跟踪正确的实例,从而揭示了语义推理和视觉基础之间持续存在的差距。因此,这些发现强调基于实例的评估是迈向更忠实和可靠的 VAU 系统的重要一步。