论文
SafeStage:评估视觉语言条件机器人操作之前、期间和之后的安全性
SafeStage: Evaluating Safety Before, During, and After Vision-Language-Conditioned Robot Manipulation
摘要
视觉语言调节的机器人策略集成了感知、语言理解和通用操作的控制。然而,现有的评估通常侧重于任务成功、孤立的物理约束、语义拒绝或已实现的物理损坏,对闭环操作期间安全失败的地方提供的了解有限。我们引入了 SafeStage,这是一个生命周期结构的基准,用于评估任务执行之前、期间和之后的操作安全性。 SafeStage 包含 97 个专门构建的风险场景,分为三个阶段。初始状态危险捕获了在操纵目标之前必须解决的安全相关关系。执行时安全性评估执行期间的不安全接触、轨迹、区域条目和对象交互。最终状态危险捕获名义任务完成后剩余的不稳定或其他不安全的情况。该基准测试使用基于事件和基于状态的检查来评估已实现的交互,并独立于特定阶段的安全结果报告本机任务的成功。我们在通用闭环协议下评估代表性直接行动愿景-语言-行动(VLA)政策和基于世界模型的政策。我们的结果表明,名义任务完成经常与安全违规共存,并且不同的策略在三个阶段表现出不同的失败情况。通过将任务成功与安全分开,并在发生违规时进行本地化,SafeStage 提供了一个统一的诊断测试平台,用于评估和改进视觉语言调节的机器人操作策略。