论文
ME-Dex 1.0:将异构触觉感知引入世界动作建模
ME-Dex 1.0: Bringing Heterogeneous Tactile Sensing into World Action Modeling
摘要
世界动作模型将视频模型的预测能力引入机器人动作生成中,为未来视觉状态建模提供了丰富的基础。触觉传感通过直接测量物理交互来补充这一基础。一些现有的方法使用触觉特征作为调节输入,而不共同预测未来的触觉状态、视觉观察和动作。我们的主要见解是,触觉信号(例如视频)提供了对不断变化的世界状态的观察,并且应该与视频一起建模为未来的观察。我们推出了 ME-Dex-1.0 (MachEmbodied-Dex-1.0),这是一个用于联合视觉、触觉和动作学习的统一世界动作触觉模型。 ME-Dex-1.0采用Mixture-of-Transformers架构,包括视频专家、触觉专家和动作专家,所有专家都经过流匹配训练。我们使用共享注意力将中间层的专家连接起来,允许动作生成在联合去噪过程中利用学习到的视觉和触觉动力学表示。为了支持多源异构触觉输入,规范手模型和统一触觉自动编码器将来自不同实施例和感测布局的触觉观察映射到共享空间和潜在空间。为了解决配对视觉、触觉和动作数据的有限可用性,我们开发了代理触觉数据引擎,这是一个基于代理的数据生产平台。它为 RoboTwin 和 DexJoCo 提供了在模拟轨迹重播期间直接从力传感器记录的触觉数据的补充。 RoboTwin、DexJoCo 和 ManiFeel 仿真平台上的实验以及真实的机器人评估表明,使用配备触觉传感的夹具和灵巧的手可以提高操作性能。