论文

EgoSteer:从第一人称视频构建可指令控制的灵巧操作系统

EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos

模型训练预训练

摘要

可操纵性是通用机器人策略的一项决定性能力,但由于缺乏大规模、语言一致且动作准确的演示数据,在灵巧手系统中仍然基本上不存在。为了解决这个瓶颈,我们提出了一个全栈系统,可以从第一人称的人类视频中扩展灵巧的 VLA 预训练,并实现数据高效的真实机器人 后训练。它集成了 EgoSmith,这是一个数据管道,可将野外的第一人称的视频整理为 9.6K 小时的高质量 预训练 数据,其吞吐量比之前的 SOTA 高 9 倍,准确性更高;用于远程操作和人机在环校正的统一机器人堆栈; EgoSteer,一个经过优化基础设施训练的世界模型增强型 VLA。人类数据 预训练 为 EgoSteer 配备了语言引导的操作先验,这些先验以机器人 后训练 为基础,并通过 DAgger 细化进行改进。根据经验,EgoSteer 在 40 多个不同任务中稳健地执行自由格式指令,展示了故障恢复、灵活性和泛化能力。预训练模型还可以通过少量样本适应复杂的长期任务,包括盒子折叠,在两种机器人形态中成功率达到 75% 以上。我们在 https://egosteer.github.io/ 开源系统、数据和模型。