论文

危险还是异常?评估 VLM 以了解危险和差异

Hazard or Anomaly? Evaluating VLMs for Understanding Dangers and Discrepancies

模型评测模型能力评测

摘要

现代安全关键系统越来越依赖人机交互来降低灾害风险并支持紧急情况下的决策。视觉语言模型 (VLM) 在这些设置中很有前景,因为它们可以解释复杂的场景并传达安全相关信息,但它们仍然需要仔细评估以确保可靠的安全推理。特别是,当前的评估通常将危险识别视为二元决策(安全/不安全),从而不清楚模型是否正在识别真正的物理危险,或者只是对异常场景元素做出反应。我们通过引入危险和异常之间的明确区别,并分别识别危险和异常状态来解决这一限制。我们跨两个数据集和多种提示策略评估了几个最先进的 VLM,以测试这种区别是否会改变模型行为。我们的结果表明,VLM 经常将异常情况误解为危险,这表明过度依赖上下文不规则性作为危险的代表。我们进一步表明,明确地将异常与危险分开可以为 VLM 安全推理提供更丰富的信息评估,并揭示二元安全判断可能掩盖的故障模式。我们的公共数据集可在 Roboflow https://app.roboflow.com/vlm-in-context-anomaly-and-hazard-detection/camera-ready-roman-ds 上获取。