论文

DROM:用于多技能机器人操作的语言引导扩散框架

DROM: A Language-Guided Diffusion Framework for Multi-Skill Robotic Manipulation

摘要

从有限的演示中学习针对各种长期任务的强大操纵策略仍然是机器人技术的基本挑战。我们提出了 DROM,一种语言引导的扩散框架,使机器人能够在单个生成策略中学习、表示和组合多种操作技能。 DROM 利用动态运动基元 (DMP) 将一小组专家演示增强为富有表现力的多技能数据集,从而大大减少数据收集,同时提高演示工作空间之外的空间泛化能力。在运动规划扩散(MPD)的基础上,我们扩展了扩散架构,以通过交叉注意力支持语言条件的多技能轨迹生成,从而允许单个模型为多种操作基元生成技能一致的运动,包括使用传统运动规划或硬编码控制器难以设计的方向敏感行为。对于长范围操作,大语言模型将高级操作员请求分解为可执行的技能序列,从而实现自然语言交互和自主任务执行。我们在 Franka Emika Panda 机器人、FANUC CRX25ia 机器人以及 MuJoCo 仿真中验证了各种操作任务的 DROM。实验结果表明,DROM 优于运动规划扩散和行为克隆基线,实现了强大的多技能泛化,并组合了学习的技能,仅使用有限数量的人类演示,即可根据自然语言指令可靠地执行长视野操作任务。 https://github.com/automation-robotics-machines/drom. 中的数据集、仿真环境等