论文
告诉机器人不该做什么:否定理解的角度
Tell Robot What Not to Do: A Negation Understanding Perspective
摘要
指令遵循使机器人能够执行以自然语言指定的各种任务,使其成为人机交互的基本能力。除了传达期望的结果之外,用户还需要指定不该做什么的限制。我们研究如何使视觉语言动作模型(VLA)遵循否定指令,其中机器人必须在尊重明确排除的同时完成任务目标。为此,我们提出了 NegaAlign,这是一种参数高效、即插即用的框架,它扩展了预训练的 VLA,以仅通过图像语言监督来遵循否定指令。具体来说,我们将否定转换层引入视觉语言主干的选定层中,以重塑中间指令表示。同时,设计了教师引导的对齐机制来对齐与指令相关的视觉标记,从满足否定约束的指令转移与动作相关的基础。训练阶段使用根据现有演示构建的监督,并仅更新插入的层,保持 所有预训练参数均已冻结,包括动作生成器。我们进一步介绍了 NegaBench,这是一个模拟基准,涵盖五个领域的 10 个场景,用于系统地评估否定约束下的操作。 GR00T、$π_0$ 和 $π_{0.5}$ 的实验证明了否定指令跟随方面的持续改进。凭借 1160 万个可训练参数,NegaAlign 将 NegaBench 上 $π_{0.5}$ 的否定指令成功率从 2.60% 提高到 88.45%,将现实任务中的成功率从 12.4% 提高到 88.8%,同时保留肯定指令的性能。