论文
CrossView:视觉语言模型可以跨摄像头进行推理吗?
CrossView: Can Vision-Language Models Reason Across Cameras?
摘要
视频理解基准长期以来一直以单摄像头设置为中心,其中现代多模态语言模型在图像和视频任务中实现了强大的性能。然而,现实世界运行在多摄像头网络上:自动驾驶汽车、安全系统和机器人都通过许多同步视图收集数据。我们认为这不仅仅是单摄像头问题的“更多”问题;这是根本不同的。多摄像机推理需要处理与视图数量成比例的上下文,解决仅从摄像机子集可见的遮挡,判断哪些视图重要,以及跨可能重叠或发散的视角整合证据。当前的模型正是在应对这些挑战,但没有系统性地针对这些挑战的基准。我们推出 CrossView,这是一个多摄像头视频问答基准测试,涵盖自动驾驶、安全监控、自我中心/外中心视频和机器人技术。对 GPT-5.2 等专有模型和 Qwen3-VL 等开源模型的评估显示,准确度始终较低,开源模型大幅落后。性能与模型联合处理多个视点的能力密切相关,将 CrossView 定位为多摄像头视频的严格基准。我们在 https://utaustin-swarmlab.github.io/CrossView 开源我们的代码和数据集。