论文

预训练 模拟中的视觉灵活性

Pre-training Visual Dexterity in Simulation

模型训练预训练

摘要

大规模的 预训练 使机器人策略 微调 的数据效率越来越高,但这一进步很大程度上是由围绕简单平行爪夹具构建的数据集和实施例驱动的。灵巧的多指手仍然相对缺乏数据,因为真正的远程操作的扩展成本很高,而人手视频是非具体的,需要有损姿势估计和重新定位。我们引入了用于灵巧性的模拟 预训练 (SPD),这是一个用于灵巧操作的 预训练 框架,它使用完全在模拟中收集的数据。在 SPD 中,人类在 VR 耳机内操纵虚拟对象,从而实现实体轨迹和无机器人收集。在五名操作员的帮助下,我们收集了一周内 75 小时的多任务灵巧操作,并用它来预训练序列建模目标上的因果 Transformer。我们通过 微调 在 56 自由度双手灵巧设置上进行 1-2 小时的物理演示,研究了模拟 预训练 对现实世界任务的好处。我们发现我们的方法优于从头开始的训练行为克隆策略,这表明模拟远程操作是现实世界灵巧操作的可行 预训练 来源。我们进行消融研究,测量历史调节和短动作块对反应控制的好处。