论文

SafeBranch:面向具身Agent的分支对安全对齐

SafeBranch: Branch-Pair Safety Alignment for Embodied Agents

模型训练偏好优化

摘要

基于视觉语言模型的具身Agent能够完成指令任务,但在过程中常违反安全约束,这一问题近来被定义为交互安全。训练此类Agent安全行事很困难,因为安全与任务成功是不同的目标,而且安全只在轨迹中少数安全关键步骤上出现。标准监督是不够的:模仿安全轨迹只教了行为却未解释为何安全,而对比任意安全与不安全轨迹会把安全信号与无关差异混在一起。我们提出SafeBranch,一个通过分支对让具身执行体在安全上对齐的框架,分支对由执行体自身的不安全rollout经环境回滚构造而成。SafeBranch把每条不安全rollout回滚到引发违规的安全关键步骤,向执行体查询一个安全的替代动作,并把原动作与替代动作配对,使两条分支仅在该步骤上不同。训练后的执行体在部署时无需评论家介入即可安全行事。在IS-Bench、SafetyALFRED以及含未见任务与物体的分布外变体上,它在不过度牺牲任务成功的情况下可靠地保障安全,在未见物体变体上取得的safe success约为未训练基线的十倍。

SafeBranch:面向具身Agent的分支对安全对齐:论文配图
图1:面向交互安全的分支对监督。在安全关键步骤上,将监督结构化为共享相同上下文但执行者动作不同的两个分支,使决定安全的选择变得显式。这种分支对形式隔离出步骤级安全信号,使执行者能够学习在何处以及如何选择安全分支。