论文

SignVLA:通过注意力 LSTM 和视觉语言动作模型进行实时手语引导机器人操作

SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models

摘要

视觉-语言-动作(VLA)模型使机器人能够根据基于视觉观察的自然语言指令执行操作任务。然而,现有的 VLA 界面主要依赖于语音或文本输入,限制了聋哑、听力障碍和语言障碍用户的可访问性。我们推出了 SignVLA,这是一种实时手语引导的 VLA 框架,用于实现无障碍的人机交互。该系统引入了模块化的手语到文本界面,可将视觉手语手势转换为与下游 VLA 策略兼容的语义指令。给定视频流,SignVLA 提取手部标志特征,并采用注意力增强型长短期记忆 (LSTM) 网络来捕获时间手势动态,以进行字母级和命令级标志识别。时间稳定模块进一步提高了实时交互设置中的预测一致性。然后将生成的指令序列传递到下游 VLA 策略以进行符号条件机器人操作。实验结果证明了稳定的实时符号识别以及由手语输入驱动的操作任务的成功执行。我们的研究结果表明,轻量级时间符号识别可以作为多模式体现智能的有效且实用的可访问层。