论文
TD-VAD:通过文本驱动学习打破视频异常检测中的视觉依赖性
TD-VAD: Breaking Visual Dependence in Video Anomaly Detection with Text-Driven Learning
摘要
视觉数据通常是训练现有视频异常检测(VAD)方法的先决条件。然而,由于异常数据的稀有性和异常事件的多样性,获得足够的带注释的异常数据用于训练是具有挑战性的且不可扩展的。在这项工作中,我们提倡将文本视为 VAD 模型的视频序列的有效性,并提出一种新颖的文本驱动视频异常检测(TD-VAD)方法来打破视觉依赖。与异常视频数据相比,异常事件的文本描述很容易收集,并且可以直接导出其类别标签。具体来说,我们的方法利用由 LLM 生成的具有时间特征的类视频文本描述来训练 VAD 模型,而不依赖于目标域异常数据。为了捕获事件的长程和短程时序逻辑,我们设计了事件演化因果注意模块来建模跨时间的上下文依赖关系。在推理过程中,考虑到文本和视频序列之间的域差距,我们使用冻结的 CLIP 编码器来提取视频帧的嵌入,以对齐文本模态,同时保留关键的视觉信息。对两个大型 VAD 数据集 XD-Violence 和 UCF-Crime 的综合实验表明,我们的方法大大优于先前的一类和无监督 VAD 方法。