论文
VESSI - VLM 对监视和调查的增强支持
VESSI - VLM-Enhanced Support for Surveillance and Investigations
摘要
自动视频监控分析已成为情报基础设施和执法机构的重要组成部分。传统系统缺乏用于全面态势感知和取证任务的语义模块,限制了它们有意义地解释事件或支持事件后调查的能力。这会减慢运营洞察力并增加人类分析师的负担。视觉语言模型(VLM)的最新进展为弥合这一差距提供了有希望的途径。为了解决这个问题,我们提出了 VLM 增强型监控和调查支持 (VESSI),这是一种基于 VLM 的框架,旨在通过提示驱动的视频序列询问来增强自动视频监控分析,其中显着的视觉特征被转换为文本描述。我们使用四个最先进的模型来测试我们的框架。由于此任务的大多数数据集都未标记,因此我们还提出了复合模型效用评分 (CMUS) 来评估 VLM 性能。实验结果表明,我们的解决方案大大提高了人类的分析能力 操作员并增强自动监控系统的灵活性。在我们的评估中,最可靠的模型标记了超过 66% 的视频中的潜在相关活动,同时将审核时间减少了 85% 以上,在选择性和效率之间提供了实际平衡。无参考 CMUS 评估产生的模型排序由正常视频 CMUS 评估再现,并与从 5,909 个手动参考帧获得的误报率排序相匹配。该协议支持在评估环境中使用分数。