论文

迈向通用语言条件的潜在安全过滤器

Towards General Language-Conditioned Latent Safety Filters

智能体系统Agent 动作执行与治理

摘要

机器人策略变得越来越通用,视觉-语言-动作 (VLA) 模型使单个策略能够执行以自然语言指定的各种任务。然而,安全部署不仅需要适应新任务,还需要适应用户、环境和应用程序之间不同的安全要求。现有的安全过滤器在很大程度上仍然是特定于约束的,因此当安全要求发生变化时必须重新设计或重新学习。在本文中,我们研究了以语言为条件的安全过滤,其中汉密尔顿-雅可比安全参与者和评论家以语言指定的约束为条件。我们在基于视觉的设置中跨拾取放置、表格擦除和块堆叠任务评估该公式,检查其强制执行语言指定的约束以及转移到评估的约束族中看不见的约束实例的能力。我们的实验提供了证据,表明语言条件安全过滤器减少了约束违规,并表现出部分转移到看不见的约束实例。