论文
物体检测和小型 VLM 的集成用于施工安全隐患识别
Integration of Object Detection and Small VLMs for Construction Safety Hazard Identification
摘要
准确及时地识别工人周围的施工危险对于预防工作场所事故至关重要。虽然大型视觉语言模型 (VLM) 表现出强大的上下文推理能力,但其高计算要求限制了其在近实时建筑危险检测中的适用性。相比之下,参数少于 40 亿个的小型视觉语言模型 (sVLM) 可以提高效率,但在分析复杂的施工场景时常常会出现准确性下降和产生幻觉的问题。为了解决这种权衡问题,本研究提出了一种检测引导的 sVLM 框架,该框架将对象检测与多模态推理相结合,以进行上下文危险识别。该框架首先采用 YOLOv11n 检测器来定位场景内的工人和建筑机械。然后将检测到的实体嵌入到结构化提示中,以指导 sVLM 的推理过程,从而实现基于空间的危险评估。在此框架内,六个 sVLM(Gemma-3 4B、Qwen-3-VL 2B/4B、InternVL-3 1B/2B 和 SmolVLM-2B)在零样本设置下对带有危险注释和解释性原理的建筑工地图像精选数据集进行了评估。所提出的方法持续改进了所有模型的危险检测性能。性能最佳的模型 Gemma-3 4B 的 F1 分数为 50.6%,而基准配置的 F1 分数为 34.5%。解释质量也显着提高,BERTScore F1 从 0.61 增加到 0.82。尽管结合了对象检测,但该框架引入的开销最小,在推理过程中每个图像仅增加 2.5 毫秒。这些结果表明,将轻量级物体检测与小型 VLM 推理相结合,为上下文感知的施工安全隐患检测提供了一种有效且高效的解决方案。