论文

TSHA:可信安全危害评估场景中视觉语言模型的基准

TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios

模型评测基准与评测资源

摘要

视觉语言模型(VLM)的最新进展加速了其在室内安全危害评估中的应用。然而,现有的基准测试存在三个基本限制:(1)严重依赖通过模拟软件构建的合成数据集,与现实世界环境产生显着的领域差距; (2)过于简单化的安全任务,对危险和场景类型进行人为约束,从而限制了模型的泛化; (3)缺乏严格的评估协议来彻底评估复杂家庭安全场景中的模型能力。为了应对这些挑战,我们引入了 TSHA(\textbf{T}rustworthy \textbf{S}afety \textbf{H}azards \textbf{A}ssessment),这是一个综合基准,包含 66,668 个经过验证的问答对,其中包括从现有室内数据集、互联网帧/图像、AIGC 图像、新捕获的图像和浑源全景图像中提取的 64,961 个精心策划的训练 QA 对。该基准测试还包括一个具有 1,707 个 QA 对的极具挑战性的测试集,不仅包括从训练分布中精心挑选的子集,还包括新添加的 Sora 生成的视频和包含多种安全隐患的浑源全景图像,用于评估模型在复杂安全场景中的鲁棒性。对 22 种流行的 VLM 进行的大量实验表明,当前的 VLM 缺乏强大的安全隐患评估功能。重要的是,在 TSHA 训练集上训练的模型在 TSHA 测试集上实现了高达 +18.3 点的显着性能提升,并且在其他基准测试中也表现出增强的通用性,强调了 TSHA 基准测试的重大贡献和重要性。