论文
通过约束流匹配为视觉-语言-动作模型提供神经符号安全指导
Neuro-Symbolic Safety Guidance for Vision-Language-Action Models via Constrained Flow Matching
摘要
视觉-语言-动作(VLA)模型已经在机器人操作任务中展示了有前景的泛化能力,但由于缺乏有效的安全措施,它们在现实世界中的部署仍然受到限制。具体来说,现有的安全措施只能防止机器人下一步动作引起的碰撞。在本文中,我们提出了一种基于流量匹配的 VLA 的神经符号安全引导机制,可以实现预测性避免碰撞。基于流匹配的 VLA 通过迭代神经流匹配过程预测轨迹(一系列动作)来确定下一步动作。我们的方法将安全执行制定为最小范数约束优化问题,用于纠正噪声中间轨迹预测的去噪过程中的安全违规行为。通过分析预测轨迹并在迭代去噪期间应用修正,我们的方法可以在碰撞不可避免之前预测到它们。符号约束满足与神经轨迹生成的这种交错可以实现预测性碰撞避免,而不是反应性干预。在 SafeLIBERO 基准上,我们的方法实现了 82.8% 的碰撞避免率和 81.6% 的任务成功率,比单步方法分别提高了 6.3% 和 19.8%,在复合分布偏移最明显的长范围任务中收益最大。我们的方法的视频演示包含在我们的项目页面上:https://willenglish.tech/SafetyGuidedFlowMatching/。