论文

WBAG:用于视觉-语言-动作操纵的全身和附加几何安全框架

WBAG: A Whole-Body and Attached-Geometry Safety Framework for Vision-Language-Action Manipulation

智能体系统Agent 动作执行与治理

摘要

视觉-语言-动作(VLA)策略在通用机器人操纵方面表现出了令人印象深刻的能力,但由于涉及机器人不同部分、操纵对象和周围环境的潜在碰撞,它们在现实世界中的部署仍然具有挑战性。现有的推理时间 VLA 安全框架通常依赖于以末端执行器为中心的简化表示,这些表示不会显式地对完整的关节式机器人和附加对象几何结构进行建模。在本文中,我们提出了 WBAG,这是一种安全框架,用于对机器人的全身和依赖于抓取的附着几何结构进行建模。 WBAG 构建了一个抓取条件安全集,该安全集在抓取对象时适应受保护的几何体,然后将这种不断演变的几何体转换为可微分的 CBF 约束,最小化修改 VLA 的本地六维操作空间动作,以避免跨机器人、场景和附加几何体发生碰撞。在 SafeLIBERO 基准(LIBERO 的一个变体,增加了安全评估障碍)上,WBAG 在监控所有符合条件的非任务对象的场景级安全评估器下,在评估方法中实现了最佳的整体安全性和安全任务成功率,达到了 97.38\% 的聚合场景安全性和 59.38\% 的安全成功率。