论文
SteelBench:评估真实工业环境中的视觉语言模型
SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments
摘要
现有的视频基准评估消费者视频、以自我为中心的录音或模拟工业环境的动作识别。他们没有在真实工业闭路电视的视觉和程序条件下测试视觉语言模型,在工业闭路电视中,工人在灰尘、蒸汽、弱光、眩光、遮挡和重叠活动中显得遥远。我们推出了 STEELBENCH,这是一种工业监控诊断基准,可联合评估每个工人的活动识别、安全规则推理和注释来源。 SteelBench 包含 1,345 个密集注释的剪辑,这些剪辑是根据 149 小时的运行工厂录像和 10,024 个候选剪辑,使用时间重复数据删除、类平衡和可见性感知分层采样进行整理的。每个剪辑都包含密集的每个工人操作标签、PPE 属性、空间上下文和安全规则注释。由于模型辅助注释可以塑造稍后用于模型评估的标签,因此 SteelBench 包含了来源感知审核协议。该协议测量标签的影响,评估对 真值 来源的敏感性,并报告来自专家评审标签的人类参考。应用此审核后,我们发现未经审核的 VLM 来源的 真值 可使同系列模型的准确性提高多达 17 个百分点。在来自四个架构系列的九个 VLM 中,最佳模型仅达到 42.6% 的动作准确度,而人类基准为 84.6%。性能还分为识别、鲁棒性、校准和安全推理。即使模型预测了正确的行动,37-58% 的情况仍然会产生错误的安全判断,并且没有模型通过 5 项诊断检查中的 2 项以上。该数据集可在 Hugging Face 上公开获取。