论文

一瞥、细查与思考:推动视频异常检测从免训练走向Agentic推理

Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning

模型训练强化学习

摘要

视频异常检测(VAD)旨在识别异常事件并定位其时间区间。现有方法存在“何时-何事”脱节:传统的基于DNN的方法能定位异常何时发生但缺乏语义理解,而基于大语言模型(LLM)的方法能解释发生了什么却忽视精确的时间定位。我们将此归因于缺乏统一的推理范式。受人类检查监控视频方式的启发——先全局一瞥形成时间假设,再细查可疑片段,然后迭代思考纠正错误——我们从两个视角研究这一由全局到局部的范式。我们首先提出Glance then Scrutinize(GtS),一个使用静态与动态文本引导、进行由粗到细异常定位与理解的免训练框架,兼顾准确性与速度。为突破冻结外部模块带来的上限,我们进一步提出一种工具增强的agentic VAD方法,其中多模态大语言模型学会调用视频裁剪工具、检查密集重采样的帧、并自我纠正定位错误的假设,训练方式为冷启动监督微调加上带答案-定位联合奖励的强化学习。在训练与评估方面,我们将先前的VAGU基准扩展为VAGU-T(Video Anomaly Grounding, Understanding, and Thinking),包含7,567个真实世界视频,覆盖21个异常类别,带有人工验证的定位、解释、问答对和思维链工具调用轨迹。我们进一步提出JeAUG,一个联合评估语义可解释性与时间精确度的指标。实验表明,GtS大幅超越免训练基线,而agentic模型同时取得更高准确率与更快推理。

一瞥、细查与思考:推动视频异常检测从免训练走向Agentic推理:论文配图
图2:VAD 范式比较。(a) 传统监督方法依赖视频级标签,仅输出时间定位(“何时”)。(b) 直接使用现成 VQA/VTG 模型对整个视频单次处理。(c) 基于 VLM 的帧/片段级方法穷尽地为每个片段生成字幕,代价高得令人望而却步。(d) 我们免训练的 GtS 将外部模块组装成由文本引导驱动的“先总览后细察”(glance-then-scrutinize)流水线。(e) 我们的智能体方法将全局到局部的推理循环内化到单个 MLLM 中,可原生调用裁剪工具进行密集复查,并在推理过程中自我修正定位错误的假设