论文
ActFovea:通过时空视觉动作一致性保护 VLA 策略的运行时保护
ActFovea: Runtime Safeguarding for VLA Policies via Spatiotemporal Visual-Action Consistency
摘要
视觉-语言-动作(VLA)策略在机器人操作方面取得了出色的性能,但仍然容易受到运行时干扰的影响,从而破坏视觉观察、机器人状态和执行动作之间的时间对齐。我们推出了 ActFovea,这是一个即插即用的保护框架,可以检测并缓解此类故障,而无需重新训练或修改底层 VLA 策略。 ActFovea 使用机器人运动学、本体感受状态和最近的动作来构建动作条件的注视点区域,该区域保留与接触相关的区域和预测的运动走廊,同时抑制与任务无关的视觉内容。它通过评估视觉运动和观察新鲜度是否与几何、本体感受和动作转换保持一致来检测运行时风险。对于可恢复的干扰,ActFovea 构建特定于干扰的候选观测值,并仅在验证生成的动作块后才接受恢复。当过时的或重放的观察结果导致可靠的恢复变得不可能时,它会调用有限的安全故障程序。在跨多个 LIBERO 套件的 $π_0$ 闭环评估中,ActFovea 将局部视觉叠加下的成功率从 49.3% 提高到 90.3%,缩小了 93.7% 的干净性能差距。它进一步将动作漂移和视觉延迟下的成功率分别提高了 7.0 和 9.8 个百分点,同时保持了干净任务的性能。在冻结观察重放下,ActFovea 在所有试验中及时触发安全失败,没有不受保护的失败。这些结果表明,时空视觉动作一致性为 VLA 策略的运行时保护提供了有效的基础。