论文

VLA策略的多连杆安全过滤:应对移动障碍

Multi-Link Safety Filtering for VLA Policies Around Moving Hazards

智能体系统Agent 动作执行与治理

摘要

视觉-语言-动作 (VLA) 策略可以完成操作任务,同时撞倒与其无关的对象,因此任务成功本身并不表明该策略可以安全地部署在杂乱环境中。我们研究如何在运行时保持预训练的 VLA 策略免受此类危险,而无需对其进行重新训练,这需要保护比末端执行器更多的手臂,在其移动时跟踪危险,并与策略共享机载计算。我们的免训练防护罩用五个椭球体覆盖抓手、手腕和前臂,并通过一个屏障程序过滤每个指令运动,以避开在重置时根据RGB-D感知拟合的禁入椭球体。然后,稀疏光流将椭球体的中心与危险一起携带,无需重复检测或重新拟合。在六种模拟危险运动条件下,防护罩将碰撞从 $65.62\%$ 降低到 $27.27\%$,并将安全成功、无碰撞任务完成从 $29.35\%$ 提高到 $50.43\%$。消融表明,保护手臂连杆可以提供超出末端执行器屏蔽的保护,并且跟踪可以恢复当危险估计在重置时冻结时丢失的大部分保护。在异构边缘硬件上,五椭球屏障在第 99 个百分位数时在 CPU 上运行的时间为 $2.2$~ms,并且修剪视觉语言前缀并采取更少的流匹配步骤可将集成 GPU 上的每个 $π_{0.5}$ 策略调用从 $343$ 缩短到 $177.3$~ms。在执行四项任务的物理 SO-101 手臂上,该手臂在 16 次受防护试验中的 3 次接触了危险,而在 16 次非受防护试验中则有 11 次接触了危险。项目页面:https://yathag.github.io/multilink-safety-filter/