论文

SafeBuild-Bench:具有图形增强数据挖掘功能的时态鲁棒施工安全基准

SafeBuild-Bench: A Temporal-Robust Construction Safety Benchmark with Graph-Enhanced Data Mining

模型评测基准与评测资源

摘要

施工安全模型必须处理具体的部署风险,例如工人站在没有护栏的脚手架边缘附近,而不是只识别策划图像中的常见物体。然而,真正的检查档案是冗余的、长尾的,并且是在不断变化的地点和月份中收集的。我们推出了 SafeBuild-Bench,这是一个元数据驱动的基准,用于评估现实时间和场地变化下的多模式 大语言模型 的施工安全性。它是从 100K+ 工业图像文本记录中挖掘出来的,包含来自 3,000 多张经过专家验证的图像的 3,314 个任务实例,涵盖多项选择危险识别和自由形式危险描述。为了使专家验证可扩展,我们开发了 GEMS,这是一种图形增强的多模式选择管道,它将代理模型混淆信号与基于图形的多样性相结合,以从冗余流中识别信息丰富的候选者。在公共指令调整数据上,GEMS 选择的子集在小数据预算下保留了面向稳健性的性能。在 SafeBuild-Bench 上,当前的 MLLM 距离可靠的施工安全理解还很远,最好的总体得分接近 60。我们在 https://github.com/safebuild/gems 上发布了基准测试、评估脚本和 GEMS 代码库。