论文

DexTacWAM:用于灵巧操作的视觉触觉世界动作模型

DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation

摘要

灵巧的操作取决于接触动态,而接触动态通常只能通过视觉部分观察到。最近的世界动作模型(WAM)将预测视频世界建模与动作生成结合起来,但仍然主要以视觉为中心,因此无法直接对这些接触动态进行建模。我们提出了 DexTacWAM,一种视觉触觉 WAM,它独立编码每个指尖,通过手指和姿势感知触觉压缩器聚合结果特征,并将触觉潜伏注入视频扩散世界模型中,以进行联合视觉触觉世界建模。在 22 自由度双手平台上的六项接触丰富的灵巧操作任务中,DexTacWAM 在每项任务上都取得了最高分,平均为 70.6,而最强基线为 38.0。消融将增益归因于建模接触进化作为预测世界状态的一部分,而不是单独的触觉调节:删除触觉世界建模将四任务平均值从 74.7 降低到 26.6,同时保持相同的触觉特征和动作专家。使用冻结的预训练视觉 VAE 进行四个小时的触觉编码器适应后,我们的持续视觉到触摸学习将预训练视频模型扩展到触摸,每个任务使用大约 100 个演示,无需触觉中间训练,同时将视觉预测质量保持在仅视觉对应物的 0.5 dB 以内。该压缩器保留了 89.4% 的融合前接触回忆,同时训练速度提高了 2.26 倍,推理速度提高了 1.29 倍。总之,这些结果表明,预训练的视频先验可以以数据和计算高效的方式扩展到分布式多手指接触动态。