论文
ARGUS:使用大型 3D 视觉模型在移动视图下对齐机器人场景几何形状
ARGUS: Aligning Robot Scene Geometry Under Shifting Views with Large 3D Vision Models
摘要
大规模视觉运动策略在各种机器人操作任务中都表现出了令人印象深刻的性能。然而,尽管取得了如此成功,操纵策略经常将场景几何与相应的视点纠缠在一起,学习对象位于图像中的位置,而不是它位于任务空间中的位置。这种纠缠本质上限制了相应策略从不同观点的数据集(例如 DROID、BridgeV2)中学习并泛化到训练数据中捕获的观点之外的能力。在这项工作中,我们提出了 ARGUS,一种观察预处理管道,它使用大规模 3D 视觉模型将任意相机视点的图像观察结果对齐到规范视点,然后将其传递给下游视觉运动策略。在具有不同视点多样性水平的训练数据集上进行的实验(从固定的多视图相机配置到高度变化的相机放置)表明,我们的方法在有限视图和视图多样化训练方案中始终优于先前的方法。在效率比较中,ARGUS 展示了从视角多样化数据中学习的能力,通过利用简化的观察空间,收敛到高成功率的速度比以前的方法快 4-6 倍。总体而言,我们的研究结果表明,利用大规模 3D 视觉模型可以减轻视觉运动策略的学习负担,从而能够从大规模、多视角的机器人数据集中进行更有效的学习。