论文
GIVE:在视觉-语言-动作模型中理解与执行人类手势
GIVE: Grounding Human Gestures in Vision-Language-Action Models
摘要
人类交流本质上是多模式的,语言通常伴随着非语言提示,例如传达意图的手势。然而,当前的视觉-语言-动作(VLA)模型将机器人操作视为纯粹的文本驱动任务,忽视了手势在人机交互(HRI)中的重要作用。当语言指令不明确或不明确时,这通常会导致不准确的意图基础和不可靠的操作。为了应对这一挑战,我们提出了 GIVE(通过视觉语义增强的手势意图),这是一种有效的方法,可以通过人类手势理解来增强预先训练的 VLA 模型,而无需修改架构。具体来说,GIVE 通过两个互补的途径整合手势信息:视觉途径将手部骨骼和指尖光线叠加到机器人观察上,以实现明确的对象基础;语义途径,生成人类手势的高级描述和任务指令,以实现稳健的意图基础。通过联合利用视觉和语义指导,GIVE 使 VLA 策略能够更好地将手势与操作行为关联起来,并适应动态交互意图。在现实世界的 HRI 实验中,GIVE 的性能大大优于基线,将目标对象识别准确率提高了 40%,总体任务成功率提高了 80%,同时对看不见的空间布局和不同的参与者表现出了强大的鲁棒性和泛化性。