论文
COPRA:用于视频异常检测的强化学习条件参数自适应
COPRA: Conditional Parameter Adaptation with Reinforcement Learning for Video Anomaly Detection
摘要
视觉语言模型 (VLM) 在视频异常检测 (VAD) 方面表现出强大的性能,同时提供可解释的预测。然而,现有的基于 VLM 的 VAD 方法在数据分布和模型配置方面都存在训练和推理之间根本不匹配的问题。首先,大多数方法依赖于静态 后训练 适应,限制了分布变化(例如未见的环境或异常类型)下的泛化。其次,他们在长视频的稀疏帧上训练 VLM,但在密集采样的短片段上进行推理,从而造成训练和测试之间的不一致。为了解决这些限制,我们提出了 COPRA,一种基于 VLM 的 VAD 的条件参数自适应框架。 COPRA 不是固定提示或共享参数更新,而是生成特定于输入的参数更新,以便在训练和推理过程中为每个视频片段动态调整冻结的 VLM。实验表明,在标准 VAD 基准测试中具有强大的性能,在域内和跨域设置中始终优于静态基线。此外,COPRA 将 VAD 推广到看不见的任务,例如多项选择视频问答和密集字幕。这些结果凸显了 COPRA 作为一种有效的权重空间生成框架,可用于可扩展、自适应和上下文感知的视频理解。代码将在 https://github.com/THE-MALT-LAB/COPRA 发布