论文
MemoVAD:边缘计算场景中通过动态语义内存进行资源高效的视频异常检测
MemoVAD: Resource-Efficient Video Anomaly Detection via Dynamic Semantic Memory in Edge Computing Scenarios
摘要
在现实世界的监控中部署视频异常检测 (VAD) 面临着确保有效性的高级语义需求与边缘设备有限的计算资源之间的根本紧张关系。视觉语言模型 (VLM) 提供丰富的开放词汇语义,但其延迟和计算成本阻碍了设备上的部署。为了应对这一挑战,我们提出了 MemoVAD,这是一种边缘云协作框架,有选择地将 VLM 语义合并到流式 VAD 中。 MemoVAD 使用轻量级检测器和因果时间上下文编码器 (TCE) 在边缘运行大部分推理,以对时间依赖性进行建模。具体来说,我们引入了一种基于主观逻辑的不确定性感知门控(UAG)策略,以对感知的不确定性进行建模,并仅针对高不确定性和语义新颖的剪辑查询基于云的 VLM。此外,动态语义内存(DSM)旨在缓存经过VLM验证的原型以进行高效检索,使边缘模型能够通过语义适配器逐步合并VLM级语义。通过真实边缘设备对 UCF-Crime 和 XD-Violence 数据集进行的实验表明,MemoVAD 大大降低了通信开销,同时超越了最先进的性能。