论文
一瞥、细查与思考:推动视频异常检测从免训练走向Agentic推理
Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning
摘要
视频异常检测(VAD)旨在识别异常事件并定位其时间区间。现有方法存在“何时-何事”脱节:传统的基于DNN的方法能定位异常何时发生但缺乏语义理解,而基于大语言模型(LLM)的方法能解释发生了什么却忽视精确的时间定位。我们将此归因于缺乏统一的推理范式。受人类检查监控视频方式的启发——先全局一瞥形成时间假设,再细查可疑片段,然后迭代思考纠正错误——我们从两个视角研究这一由全局到局部的范式。我们首先提出Glance then Scrutinize(GtS),一个使用静态与动态文本引导、进行由粗到细异常定位与理解的免训练框架,兼顾准确性与速度。为突破冻结外部模块带来的上限,我们进一步提出一种工具增强的agentic VAD方法,其中多模态大语言模型学会调用视频裁剪工具、检查密集重采样的帧、并自我纠正定位错误的假设,训练方式为冷启动监督微调加上带答案-定位联合奖励的强化学习。在训练与评估方面,我们将先前的VAGU基准扩展为VAGU-T(Video Anomaly Grounding, Understanding, and Thinking),包含7,567个真实世界视频,覆盖21个异常类别,带有人工验证的定位、解释、问答对和思维链工具调用轨迹。我们进一步提出JeAUG,一个联合评估语义可解释性与时间精确度的指标。实验表明,GtS大幅超越免训练基线,而agentic模型同时取得更高准确率与更快推理。
