论文

表示——可解释的弱监督视频异常检测的行为对齐

Representation--Behavior Alignment for Explainable Weakly-Supervised Video Anomaly Detection

模型训练参数高效训练

摘要

多模态大语言模型 (MLLM) 提供了一种自然的方式来使视频异常检测更易于解释。然而,他们的最终决策并不总是充分利用其隐藏状态中包含的歧视性信息,我们将这个问题称为表征行为失调。我们将这个间隙分解为一个容量分量,用于测量从未聚合到读出位置的判别信息,以及一个方向分量,用于测量该位置处的最佳轴和本地正常-异常轴之间的角度不匹配。在多个视频异常检测基准和MLLM骨干模型中,方向分量占主导地位,残余流跟踪表明,本机轴可分离性在几个中后期注意层中急剧上升。因为这两个组件都是由注意力而不是 MLP 更新来控制,所以我们提出了表示-行为对齐(RBA),这是一种参数高效方法,它仅使用视频级标签来调整这些层,同时更新大约 0.012% 的骨干模型参数。三个基准测试的实验表明,RBA 提高了本机读出性能,并更好地将模型的决策方向与判别性表示保持一致,并且它通过单个生成过程生成异常决策和解释。

表示——可解释的弱监督视频异常检测的行为对齐的原论文方法或结果图
图 3:RBA 框架概述。 探针派生的伪标签监督注入到转换注意层中的低秩适配器,通过沿着固定的原生读出轴 $\mathbf{u}$ 的铰链边缘损失进行优化。