论文

一般危险检测

General Hazard Detection

模型评测基准与评测资源

摘要

危险作为一个抽象概念,通常是通过认知层面的逻辑推理而不是具体的例子来定义的。相比之下,现有的危险检测系统依赖于预定义的危险类别,并且需要在检测或分类架构中密集收集标记的示例。这种方法在解决抽象安全概念时面临三个基本挑战:(1) 嘈杂且稀疏的训练数据,(2) 随上下文和时间而变化的动态演变的定义,以及 (3) 对未见过或新颖场景的泛化有限。为了解决这些限制,我们提出了 CompliVision 数据集,这是第一个为基于规则的合规性评估而设计的通用危害数据集,以及危害评估的基线框架。我们的关键创新是通过基于语言的规则表达安全要求,将危险概念与基于图像的示例解耦。我们的方法以权威领域法规和 ISO 标准为基础,定义跨多个领域的不同危险概念。 CompliVision 数据集包含 3,006 张图像,涵盖交通、建筑和仓库环境,每张图像都带有注释,以符合特定的安全规则,并附有自然语言解释,突出显示支持的视觉证据。为了实现强大的概括,我们开发了一个主动学习框架,以更有效地指导和完善评估危险合规性的视觉语言模型。虽然最先进的 VLM 展示了强大的功能,但它们在准确安全评估所需的细粒度、依赖于上下文的解释方面遇到了困难。我们提出了一个通用的危险检测框架来解决这一限制,该框架将基于 LLaVA 的视觉推理与人机交互反馈相结合。