论文

来自预训练 ViT 的每个补丁的标量可在现实世界中实现快速移动导航

A scalar per patch from pre-trained ViTs enables fast moving navigation in the real world

模型优化模型压缩

摘要

现实世界机器人的训练策略依赖于计算机视觉组件,通常采用预先训练的视觉编码器的形式。这些编码器是一个重要组成部分,事实证明,它们的力量不仅仅来自于机器人下游损失的训练。 预训练 具有计算机视觉前置任务形式的辅助损失,是一个决定性因素,在很大程度上影响着机器人任务中代理的性能。在这项史无前例的大规模研究中,我们在真实世界的建筑物中运行了 966 次静态点目标导航,距离为 24 公里,并询问哪些组件对于机器人的计算机视觉方面真正重要:我们在现实条件下评估最先进的视觉编码器。我们探索异构多教师 蒸馏 的有用性,从而使编码器具有多种不同且互补的技能。我们通过以一种有原则的和空间上有用的方式限制这些编码器的瓶颈来调查机器人技术需要多少信息,并且我们表明这导致了与可供性相关的可解释特征的出现。我们还认为,仅对 RGB 数据进行训练策略并不能实现视觉特征的最佳使用,并通过对特权信息预训练的策略进行微调来证明这一点。总而言之,我们更全面地了解了计算机视觉的哪些方面与现实世界的导航相关。