论文
MonitorVLM-v2:用于实时安全违规检测的已部署视觉语言框架
MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection
摘要
大型视觉语言模型 (VLM) 可以逐步推理复杂的视觉场景,但这种开放式、自回归思想链 (CoT) 方法不太适合安全关键、规则管理的环境,例如工业监控,其中决策必须是有界的、确定性的和低延迟的。由于 CoT 推理成本与推理长度和并发流数量共同缩放,因此它会产生吞吐量瓶颈,妨碍工业问责所需的实时多流监控。在这里,我们介绍了 MonitorVLM-v2,这是一个面向部署的框架,它将基于 VLM 的安全评估重新构建为有限监管决策空间上的概率推理,将多模态推理压缩为单步规则 ID 预测,并减少从可变长度序列到单个词元的解码。我们引入了符号策略优化(SymPO),这是一种新颖的对比策略优化算法,可锐化有限符号空间内的决策边界,以及熵驱动的分类机制,可将不确定的预测路由给人类评审员以供专家确认。在对运营中的地下采矿设施中的 10 个并发摄像头进行为期四个月的预期部署中,MonitorVLM-v2 的推理速度提高了 19.45 倍,识别出的已确认违规次数是现场例行手动检查工作流程的 2.78 倍,展示了压缩符号决策对于实时、可审核的工业监控的实用价值。