论文

推理引导定位:通过多模态提升视频异常检测 大语言模型

Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models

模型训练监督微调与指令调优

摘要

视频异常检测 (VAD) 传统上被定义为二元分类或异常值检测,既不提供可解释的推理,也不提供异常事件的精确空间定位。虽然视觉语言模型 (VLM) 提供了丰富的场景理解,但它们在可靠的空间基础上遇到了困难 - 当要求定位对象时,通常会产生幻觉或几何无效的边界框。我们提出了 VANGUARD(通过推理和基础来理解视频异常),这是一个在单个 VLM 中统一异常分类、空间基础和思想链推理的框架。 VANGUARD 引入了一个三阶段课程,逐步分层训练目标:(1) 冻结主干特征上的分类器预热,(2) LoRA 适应的空间基础,以及 (3) 思维链生成。为了克服 VAD 基准中典型的稀疏注释,我们采用了师生注释管道,其中 VLM (Qwen3-VL-4B) 基于 UCA 数据集中提供的手动注释生成结构化的每个子片段推理轨迹。此外,GroundingDINO 还提供边界框监控。在 UCF-Crime 上,VANGUARD 实现了 94% ROC-AUC 和 84% F1,同时产生可解释的思想链解释和异常物体的空间基础 - 以前的 VAD 方法所缺乏的功能。消融证实,分阶段训练优于整体优化,并且结构化推理充当隐式正则化器,比仅分类的 微调 产生更平衡的预测。到 XD-Violence 和 ShanghaiTech 的零样本迁移展示了无需目标域适应的跨域泛化。