论文

Dex-One2Many:从单个人类演示中学习灵巧操作

Dex-One2Many: Learning Dexterous Manipulation from a Single Human Demonstration

应用与实践模型训练强化学习合成数据机器人

摘要

虽然从单个人类视频中学习灵巧的操作为昂贵的机器人演示提供了一种有前途的替代方案,但许多最近的方法主要模仿演示的动作。这种严格的运动匹配通常会限制对视频中未显示的初始物体姿势、目标姿势和抓握的概括。或者,通过强化学习(RL)发现策略可以进行广泛的泛化,但如果没有事先指导,它很难在复杂的多阶段任务中进行高维探索。为了解决这些耦合的泛化和探索挑战,我们提出了 Dex-One2Many,这是一个真实到模拟到真实的框架,可以从单个人类视频中学习可泛化的灵巧操作策略。我们的主要见解是将视频抽象为指导强化学习的顺序场景图,从而实现高效探索,同时保持广泛的通用性。这些图作为对不同重置状态进行采样的生成约束,并为每个阶段提供密集的奖励。因为图表限制关系而不是精确的姿势,所以这些重置状态 覆盖视频之外的物体姿势和抓握,同时用密集的奖励初始化每个阶段,使探索变得简短和有指导性。 Dex-One2Many 完全经过模拟训练,可将零射击转移到真正的多指手上。在五项工具使用和操作任务中,Dex-One2Many 在已见配置中超出了基线 6.5%,而其强大的泛化能力在未见场景中将这一差距扩大至 71%。