论文

VT-WAM:用于丰富接触操作的视觉-触觉世界动作模型

VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation

摘要

富含接触的操纵需要策略对局部变形、压力、滑动和摩擦做出反应,但这些线索在时间上是稀疏的,并且在视觉观察中通常是不可见的。现有的视觉触觉策略通常将触觉观察直接输入到动作预测中,但很少在动作生成过程中对触觉变形动态进行建模。在本文中,我们介绍了 VT-WAM,一种视觉-触觉世界动作模型,它在统一的流匹配框架内共同学习未来视觉预测、触觉变形预测和动作预测。特别是,VT-WAM 引入了 (1) 非对称混合 Transformer (MoT) 注意力,以将第一帧视觉锚与时间触觉动力学联系起来,以及 (2) 接触门控动作视觉触觉注意力指导 (AVTAG),以鼓励动作查询在接触阶段依赖触觉证据。在 6 个现实世界中接触丰富的操作任务中,VT-WAM 的平均成功率达到 71.67%,比 Fast-WAM 高 26.67%,比 OmniVTLA 高 35.84%。消融表明,触觉变形动力学建模和引导接触阶段触觉注意力对于接触丰富的任务都很重要。项目网站:https://vt-wam.github.io/。