论文
UniTacVLA:视觉语言动作模型中的统一触觉理解和预测
UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models
摘要
视觉-语言-动作(VLA)模型在许多机器人操作任务中取得了强大的性能,但在接触丰富的灵巧操作中仍然受到限制。为了克服这一限制,最近的视觉-触觉-语言动作 (VTLA) 方法将触觉感知纳入 VLA 模型中,以提供直接接触信息。然而,他们通常将触觉信号视为被动辅助输入,这使得对触觉语义和未来物理交互进行建模变得困难。为此,我们提出了一个用于丰富接触操作的统一触觉学习框架,该框架将触觉信号建模为接触理解和预测的动态交互线索。具体来说,我们构建了一个统一的触觉潜在空间,并通过触觉思维链推理和从粗到细的未来触觉预测来共同建模当前的触觉状态和未来的接触变化,从而形成状态感知和动态感知的触觉先验。基于此,我们引入了一种触觉动作混合控制器,该控制器结合了实时和预测触觉反馈,以通过高频校正来细化低频动作块。在干净和外部扰动的环境下对四类富含接触的任务(包括调整、插入、擦拭和组装)进行的真实世界实验表明,我们的方法比现有方法提高了成功率、操作精度和接触鲁棒性,证明了其在灵巧物理交互中的有效性。