论文

QVAD:一种以问题为中心的代理框架,用于高效和 无需训练 视频异常检测

QVAD: A Question-Centric Agentic Framework for Efficient and Training-Free Video Anomaly Detection

智能体系统Agent 架构与控制循环

摘要

视频异常检测(VAD)是计算机视觉领域的一项基本挑战,特别是由于异常的开放集性质。虽然最近利用视觉语言模型 (VLM) 的 无需训练 方法已显示出前景,但它们通常依赖于大量资源密集型基础模型来弥补静态提示的模糊性。我们认为 VAD 的瓶颈不一定是模型能力,而是查询的静态性质。我们提出了 QVAD,一个以问题为中心的代理框架,将 VLM-LLM 交互视为动态对话。通过基于视觉上下文迭代地细化查询,我们的 LLM 代理指导较小的 VLM 生成高保真字幕和精确的语义推理,而无需更新参数。这种“及时更新”机制有效地释放了轻量级模型的潜在功能,使用竞争方法所需的一小部分参数,在 UCF-Crime、XD-Violence 和 UBNormal 上实现最先进的性能。我们进一步在单场景 ComplexVAD 数据集上展示了卓越的通用性。至关重要的是,QVAD 以最小的内存占用实现了高推理速度,使高级 VAD 功能可以部署在资源受限的边缘设备上。