论文

SPACE:从跨机器人数据中学习以制定通用策略

SPACE: Enabling Learning from Cross-Robot Data Toward Generalist Policies

模型训练监督微调与指令调优

摘要

在机器人学习中,跨不同实施例和环境扩展训练数据集已成为学习通用机器人策略的主导范例。这些策略通常通过行为克隆进行训练,以模仿预先收集的演示中的动作。然而,由于机器人动作与数据收集机器人的动力学相关,因此不同的机器人可能需要不同的动作来实现相同的运动。这种差异阻碍了不同机器人的政策训练和部署。为了解决这个问题,我们建议使用笛卡尔状态增量作为跨机器人的通用动作表示,并引入状态预测和自适应命令执行(SPACE)框架。 SPACE 在三个层面上处理机器人动力学变化:不同实施例之间、同一实施例的硬件单元之间以及操作期间单个机器人内。它由两个组件组成:(i) 预测几何末端执行器位移的笛卡尔状态增量策略,以及 (ii) 动作适配器,它将预测的笛卡尔状态增量转换为机器人特定的控制命令。实验表明,当从跨不同实施例和跨同一实施例的硬件单元收集的数据进行学习时,SPACE显着优于直接预测控制命令的策略。 SPACE 在部署时的动态变化(包括控制频率、物体重量和控制器增益的变化)下也保持稳健。该项目页面位于http://haeone.site/space-website/。