论文
SafeSceneReason:连接工业隐患与事故知识的多模态推理基准
SafeSceneReason: A Multimodal Reasoning Benchmark Connecting Industrial Hazards with Accident Knowledge
摘要
工业安全理解不仅仅是检测工人、设备和个人防护装备。模型还必须评估合规性、识别危险交互、解释潜在事故机制并推荐预防措施。现有安全数据集主要聚焦视觉感知或孤立的违规识别,为基于证据的推理提供的监督有限。我们提出 SafeSceneReason,一个多模态工业安全推理基准及配套训练语料,将工作场所场景与职业事故调查知识相连。SafeSceneReason 结合两条互补的数据构建管线。以场景为中心的管线将标注的工作场所图像转换为可执行的安全场景图,并通过在对象、关系和安全规则上的程序执行生成确定性答案。以报告为中心的管线从事故报告中提取图表和上下文证据,利用证据图、显式信息边界、多步推理路径和迭代验证构建多模态问题。所得资源包含 110,581 个经核验的以场景为中心的问答对和 13,114 个精炼的以报告为中心的问答对,覆盖感知、空间与定量推理、合规评估、证据综合、因果分析和面向缓解的决策。对代表性专有与开源视觉-语言模型的评估揭示了显著的性能差异,以及在比较性、技术性和多证据推理上的持续弱点,表明强大的通用视觉理解尚不能保证可靠的工业安全推理。
