论文
用摄像头思考:通过动态视点控制进行主动视觉推理,实现监控视频理解
Thinking with Cameras: Active Visual Reasoning via Dynamic Viewpoint Control for Surveillance Video Understanding
摘要
大型视觉语言模型(LVLM)最近在通用视频理解方面取得了显着进展。然而,由于缺乏大规模的特定领域数据集以及从固定视点进行被动观察的限制,它们在监控视频中的应用仍然具有挑战性。在监控场景中,当目标较远、较小、被遮挡或超出当前摄像机视野时,很容易错过关键的视觉证据。在这项工作中,我们引入了 CamVLM,这是一种用相机思考的新框架,它使 LVLM 能够通过动态视点控制主动获取视觉证据,而不是被动分析固定视频流。我们首先构建了 CCTV-Anomaly,这是一个大规模监控视频理解数据集,包含 10 个异常类别的 14,459 个视频,并带有详细的标题和事件注释。我们进一步将视点控制表述为主动视觉感知问题,并构建了 CamTrack-53K,这是一个用于学习相机动作的以对象为中心的视点轨迹数据集。此外,我们提出了一种基于强化学习的视点策略优化框架,它将摄像机控制建模为一个顺序决策过程,并学习超越监督轨迹模仿的长视野观察策略。大量实验表明,CamVLM 在被动观察和动态视点设置下均实现了最先进的性能,验证了基于主动摄像机的监控视频理解推理的有效性。我们的数据集、模型和代码将在 https://github.com/xiaozhang79/CamVLM 提供。