论文
GesVLA:手势感知视觉-语言-动作模型嵌入式表示
GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations
摘要
视觉-语言-动作(VLA)模型通过统一感知和动作,显示出通用机器人操纵的巨大潜力。然而,现有的 VLA 系统主要依赖于文本指令,很难解决具有多个相似对象的复杂场景中的空间模糊性。为了解决这个限制,我们引入手势作为并行指令模态,并提出了手势感知视觉-语言-动作模型(GesVLA)。我们的方法将手势特征直接编码到潜在空间中,使它们能够参与高级推理和低级动作生成,并采用双 VLM 架构来实现手势表示和动作策略之间的紧密耦合。在数据层面,我们通过将手部模型渲染到现实世界的场景图像上来构建可扩展的手势数据生成管道。这减少了模拟与真实的视觉差距,同时产生具有不同运动模式和相应指向注释的丰富数据。此外,我们采用两阶段训练策略,使模型具备手势感知和动作预测能力。我们评估了我们在多个现实世界机器人任务上的方法,包括用于验证的受控块操作任务以及更实际的场景,例如产品和产品选择。实验结果表明,结合手势可以持续提高目标目标定位精度和人机交互效率,特别是在复杂和杂乱的环境中。项目页面:https://gwxuan.github.io/GesVLA/。