论文
GHR-VLM:通过基于视觉证据的混合推理实现零样本交通视频分析
GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning
摘要
交通视频理解可以提供传统乘客柜台和票价系统无法捕获的有价值的细粒度数据。然而,监督视频模型需要特定于任务的注释,而将视觉语言模型(VLM)直接应用于长板载视频既不可靠又昂贵。为了利用两种方法的互补优势,我们提出了 GHR-VLM,这是一种用于零样本公交视频分析的基于视觉的混合推理框架。它的动机是观察到明确的视觉定位可以通过将长监视流转换为紧凑的、以乘客为中心的时空证据来改善 VLM 推理。具体来说,我们提出了一种边缘云设计,其中基于边缘的轻量级监视器持续跟踪门状态并分段乘客剪辑。然后,后端 VLM 识别登机乘客,并通过时空证据的两阶段从粗到细的细化对支付行为进行分类。通过仅在已定位乘客的视频片段和联系表上调用 VLM,GHR-VLM 减少了云推理,避免了特定于支付的训练数据,并提供了 VLM 难以识别的本地化证据。对 486 分钟真实公交车监控视频的评估展示了以视觉定位为依据的边缘—云推理在乘客级支付分析中的潜力,同时强调了视频条件退化带来的挑战。