论文
Dexterity-BEV:调整 3D 世界和动作以实现通用机器人策略学习
Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning
摘要
端到端操纵策略与网络规模的预训练视觉语言模型(VLM)相结合,展现了通用且灵巧的机器人操纵的前景。然而,它们继承了 2D 基础模型的两个关键限制:1)依赖 2D RGB 输入,忽略了操纵的本质 3D 性质; 2) 输入输出空间之间以及不同的机器人实施例、相机设置和轨迹数据集之间缺乏空间 3D 对齐。在本文中,我们提出了一系列解决这些问题的贡献。首先,我们引入对齐的顶点图和顶点谱——一种像素级 3D 表示,它使用相机校准和可选深度将 2D 视觉输入提升为 3D。这种新颖的输入表示将 3D 感知与 2D 大型 VLM 的泛化结合起来。然后,我们建议通过将每个摄像机视图和机器人动作的每像素 3D 信息表达到共享坐标来对齐操纵策略的输入和输出。基于此,我们指定了一个规范的鸟瞰图(BEV)对齐框架,并创新性地提出构建 BEV 图像,产生对相机姿态变化具有鲁棒性的视图不变表示。为了实现大规模训练和评估,我们开发了一个全面的数据处理管道来执行此类对齐;我们还引入了一种新颖的时间对齐方案,用于跨不同机器人、人类操作员和数据集的轨迹。这些贡献共同减轻了输入和输出时空错位,提高了现实世界操作的一致性和泛化性。预训练的检查点、源代码和数据处理管道可在 https://hnuzhy.github.io/projects/Dex-BEV 中找到。