论文

SafeVLA-Bench:视觉-语言-行动模型中成功与安全差距的基准

SafeVLA-Bench: A Benchmark for the Success-Safety Gap in Vision-Language-Action Models

模型评测基准与评测资源

摘要

视觉-语言-动作(VLA)基准衡量策略是否完成了所请求的操作任务,但二元成功可以隐藏轨迹上的安全违规行为:策略可能会在施加过度接触、干扰旁观者物体、破坏所持物体稳定或进入机器人自接触时达到目标。我们提出了 SafeVLA-Bench,这是一个针对现有基于模拟器的 VLA 基准的事后安全评估框架,可揭示仅成功评估所遗漏的违规行为。它将任务感知安全要求编码为具有定量鲁棒性语义的信号时态逻辑 (STL) 不变量。除了本机成功之外,它还报告先前安全评估中使用的安全率和成功但不安全率 (SBU),并引入违规严重性指数 (VSI),即有界最严重违规深度评分。我们在 LIBERO 和 RoboCasa-365 上实例化 SafeVLA-Bench,评估桌面和厨房操作任务中的 27 个策略基准条目。高任务成功率并不意味着安全执行:超过 90% 的 15 个桌面策略意味着成功率仍然有 18-28% 的不安全事件率,并且 38-56% 成功的 RoboCasa-365 轨迹采样违反了至少一项主动安全条款。 后训练 案例研究进一步表明 SafeVLA-Bench 可用于提高保单安全性。项目页面:https://safevla.org