论文

ActiveMimic:具有主动感知的以自我为中心的视频预训练

ActiveMimic: Egocentric Video Pretraining with Active Perception

模型训练预训练

摘要

以自我为中心的人类视频为预训练的机器人数据提供了一种可扩展的替代方案,但在此类视频上预训练的模型始终低于在机器人数据上预训练的模型。我们将这种差距归因于缺失的信号,即以自我为中心的视频中的主动感知行为,人类在操纵过程中不断重新定位他们的视角,从而引起标准管道视为噪声的摄像机运动。为了解决这个问题,我们提出了 ActiveMimic,这是一个预训练框架,可以从单个身体佩戴的 RGB 相机中恢复同步的相机和手腕轨迹,将相机运动建模为视点动作,并在适应目标机器人之前从野外的以自我为中心的人类视频中共同学习主动感知和操作。根据经验,针对具有不同主动感知需求的任务的现实世界实验表明,ActiveMimic 始终超越人类视频预训练的基线,并与机器人数据预训练的最先进模型相匹配。进一步的分析提供了证据,表明主动感知能力源自以自我为中心的人类视频预训练,而不是机器人特定的 微调,证实主动感知是解锁以自我为中心的人类视频用于机器人预训练的关键。