论文
SafeManip:机器人操作中时间安全评估的属性驱动基准
SafeManip: A Property-Driven Benchmark for Temporal Safety Evaluation in Robotic Manipulation
摘要
机器人操作通常通过任务成功来评估,但达到正确的最终状态并不能保证安全执行。尽管受到污染、过早释放或排序不正确,机器人仍可能成功。任务完成指标或孤立的状态检查很难捕获这些故障,因为安全性通常取决于行为随着时间的推移如何展开。我们引入了 SafeManip,这是一个直接从八个物理和语义类别的低级操作部署中评估时间安全性的基准。 SafeManip 将符号操作谓词转化为有限执行上可重用的时间属性,并用 LTLf 形式化。我们进一步介绍了 ManipVerse,一种属性本体,使语义安全规则能够跨对象、任务和环境泛化。最后,SafeManip 引入了每次触发的安全指标,通过激活每项义务的安全相关机会来规范违规行为,并考虑到这些机会在策略和任务中出现的频率差异。我们在 RoboCasa365 和 LIBERO 上实例化 SafeManip,以审核七个最先进的机器人基础模型策略。我们的结果揭示了任务能力和临时安全性之间的差距:更高的任务成功率并不一定意味着更安全的执行,成功的部署仍然可能包含违规行为,并且失败模式在安全类别、任务范围和操作套件之间系统地变化。 SafeManip 提供了一个可重用层,用于评估操作任务的执行安全性,而不仅仅是评估它们是否完成。