论文
MuST-VAD:用于视频异常检测的相互结构化学习
MuST-VAD: Mutual Structured Learning for Video Anomaly Detection
摘要
在本文中,我们提出了 MuST-VAD,这是一种用于弱监督视频异常检测(VAD)的相互结构化学习框架,其中异常检测器和大型视觉语言模型(LVLM)交换其获得的知识。弱监督 VAD 中的检测器从固定的、与任务无关的主干提取的特征中学习异常分数。这些固定特征限制了可实现的检测精度。因此,最近的方法将 LVLM 语义作为更丰富的特征转移到检测器中。然而,这种传输是单向的:检测器了解的目标视频信息永远不会返回到 LVLM。 MuST-VAD 将单向迁移扩展为双向学习循环。在此循环中,最新的检测器预测监督 LVLM 自适应,并且自适应的 LVLM 返回重新训练检测器的更新表示;这两个模型通过小型视频组交替进行这些更新。两种模型都在检测器选择的关键片段上进行训练,而置信权重和注释锚定问答保持了交换监督的可靠性。在 UCF-Crime 上,我们的相互学习将单次传输基线 AUROC 从 88.15% 提高到 88.63%,平均精度 (AP) 从 37.25% 提高到 42.46%,比 AP 中最先进的方法高出 4.13 个百分点。