论文
DeicticVLA:在单个 VLA 中统一基于语言和指示手势的指令模式
DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA
摘要
视觉-语言-动作模型(VLA)允许用户用自然语言指定操作任务,但在相同类别或相似外观的对象之间区分目标或放置目标需要详细的表达,而 VLA 可能无法可靠地使用。我们提出 DeicticVLA,它通过文本提示完成和指示手势基础将语言指令(LI)、视觉语言指令(VLI)和视觉指令(VI)规范化为文本提示和指示掩码,使单个预训练的 VLA 能够处理所有三种指令模式。通过共享主干、演示和匹配的训练步骤,我们在模拟中比较了两种 RGB 视觉提示方法、两种单独通道掩模提示方法和三种训练策略。在两阶段训练下,四种提示方法在分配中取得了很高的成功,但在看不见的布局中使用指示掩码的能力有所不同。在各种方法中,训练策略消融表明,两阶段训练可以改善这种使用,同时保留第二阶段 LI 数据可以减轻遗忘,而不会降低 VLI 和 VI 性能。在三项现实任务中,一项策略支持所有模式。在看不见的表情、外观变化和新物体下,VLI 和 VI 的表现优于 LI。对于看不见的类别,两者都取得了 100% 的成功,而联合训练的 LI 的成功率为 16.7%。这些结果展示了统一的三模接口并指导 DeicticVLA 设计。