论文

DreamControl-v2:通过可训练的引导扩散先验实现更简单且可扩展的自主人形技能

DreamControl-v2: Simpler and Scalable Autonomous Humanoid Skills via Trainable Guided Diffusion Priors

模型训练强化学习

摘要

为人形机器人开发强大的自主局部操纵技能仍然是机器人技术中的一个悬而未决的问题。虽然强化学习已成功应用于腿部运动,但考虑到操纵的长期规划挑战,将其应用于复杂的、交互丰富的操纵任务更加困难。最近的一种类似方法是 DreamControl,它通过利用现成的人体运动扩散模型作为生成先验来指导训练期间的强化学习策略,从而解决了这些问题。在本文中,我们研究了 DreamControl 运动先验的影响,并提出了一种改进的框架,该框架直接在人形机器人的运动空间中训练引导扩散模型,将不同的人类和机器人数据集聚合到统一的实施空间中。我们证明,由于训练数据混合更大,我们的方法可以捕获更广泛的技能,并通过消除手动过滤干预的需要来建立更自动化的管道。此外,我们还表明,扩大参考轨迹的生成对于实现强大的下游强化学习策略非常重要。我们通过模拟和真实 Unitree-G1 上的大量实验验证了我们的方法。