论文
HazardArena:评估视觉-语言-动作模型中的语义安全性
HazardArena: Evaluating Semantic Safety in Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型继承了视觉语言主干中丰富的世界知识,并从动作演示中获得了可执行的技能。然而,当前的评估主要衡量任务完成情况,而对学习行动策略的语义安全性尚未进行充分探索。这种差距造成了一个严重的漏洞:当周围的视觉语言环境发生变化时,策略可能会正确执行预期的操作,但会产生不安全的结果。我们推出 HazardArena,这是 VLA 系统中压力测试语义安全的基准。其核心设计是一组安全/不安全的孪生场景:具有匹配对象、布局和操作要求的配对环境,但语义风险上下文不同。这种受控对比将安全判断与运动能力隔离开来,并直接测试 VLA 是否能够识别原本有效的动作何时变得危险。 HazardArena 包括基于机器人安全标准的七个安全类别的 2,000 多个资产和 51 个风险敏感任务。在四个代表性的 VLA 主干中,我们观察到一致且令人担忧的模式:仅安全的 微调 提高了良性任务的成功率,同时也增加了匹配的不安全场景的危险执行。物理世界实验证实这种故障超出了模拟范围。这些结果表明,更强的操作执行并不意味着更安全的行为,并促使语义风险感知评估和执行成为现实世界 VLA 部署的首要要求。代码发布于 https://github.com/HazardArena-Team/HazardArena ;更新了代码可用性信息。