论文
IronMind:通过相机空间以自我为中心的预训练扩展人形灵巧操作
IronMind: Scaling Humanoid Dexterous Manipulation via Camera-Space Ego-Centric Pretraining
摘要
以自我为中心的人类视频为灵巧操作提供了可扩展的数据源,但用它来训练人形机器人面临着两个挑战:(1)体现差距,因为人手在结构上与机器人末端执行器不同,并且低成本的以自我为中心的记录缺乏传统重定向所需的躯干运动学; (2) 异构数据质量,包括嘈杂的手势跟踪和弱对齐的文本注释。我们介绍了 IronMind,这是一种视觉-语言-动作 (VLA) 模型,它使用以自我为中心的人类视频和异构机器人数据来预训练人形灵巧操作的策略。为了弥补体现差距,IronMind 通过使用摄像机空间动作表示、以自我为中心的视频的本机参考空间以及语义上对齐机器人和人类动作维度,绕过了显式的身体重定向。在 250 到 10,000 小时的总预训练预算中,验证损失随着数据规模大约呈对数线性下降。更大的预训练预算还可以改善训练后的分布外真实机器人操作:在六项具有看不见的物体、可供性和推理提示的挑战性任务中,10,000 小时的模型实现了 55.0% 的成功率,而长达 5,000 小时的每个预训练预算的成功率最多为 11.7%,而没有预训练的则为 5.0%。在相同的预训练预算下,相机空间动作表示也优于躯干框架基线。总之,这些发现支持在大规模人类自我中心数据上使用相机空间动作表示进行预训练,作为人形机器人操作的可扩展基础。