论文

通过语言驱动的质量多样性自主获取机器人操作技能

Autonomously Acquiring Robot Manipulation Skills with Language-Driven Quality-Diversity

摘要

质量多样性(QD)算法在机器人学习中越来越受到关注,其中多样化的运动基元库允许机器人在部署时适应零射击约束。然而,此类方法通常需要专家设计人员编写成功条件、适应度和多样性指标,这强烈限制了机器人的自主性。另一方面,现有的基于LLM的奖励塑造技术允许机器人自主学习,但只能输出单一的高性能解决方案,限制了机器人的适应性。在本文中,我们提出了一种方法,旨在通过自主利用质量多样性算法来输出不同的运动基元档案,只需要用通用语言对任务进行自由形式的描述。为了解决设计相关适应度和多样性指标的困难,我们提出了一种自主探索机制,能够可靠地输出覆盖适应度和行为描述符(BD)空间的函数集。首先,我们将策略探索作为一个功能设计问题,其中功能空间比完整的 BD 和健身空间低维,并提出一种基于 LLM 的探索方案,从这些低维空间中进行采样,而无需任何特定于任务的提示、微调 或专家干预。我们采用了 MAP-Elites success (MES) 算法的多 BD 变体,旨在利用异构 BD 样本。最后,通过基于创世模拟器的实验,我们表明我们的方法可以有效地生成不同运动基元的档案,在一组 4 美元的机器人操作任务上优于具有推断和手写参数化的经典 QD 算法。