论文
一种策略,多种实施例:用于异构具体操作的统一以相机为中心的动作几何 预训练
One Policy, Many Embodiments: Unified Camera-Centric Action Geometry Pre-training for Heterogeneous Embodied Manipulation
摘要
扩展通用视觉语言动作(VLA)策略受到具身数据固有异质性的严重瓶颈,这些数据涵盖不同的机器人形态、相机配置和底层动作空间。现有的范例通常通过显式的动作重定向、人机视频合成或特定于数据集的适应分支来解决这种不匹配问题,从根本上阻碍了统一策略的联合学习。我们引入了 UCAG-P,一种以相机为中心的统一动作公式,它将异构的具体数据集在结构上对齐到共享的几何动作空间中。 UCAG-P 不是将特定于机器人的命令视为共享策略目标,而是通过图像和相机框架坐标中相机可观察的锚点运动来表示操纵,将机器人手臂、类人机器人和人手视为共同动作模式的不同实施例。几何条件动作转换器将预测运动与目标具体运动学相结合以产生可执行控制。由此产生的解耦架构允许共享 VLA 策略学习可转移的操纵几何形状,同时保留特定于实施例的可控性。 UCAG-P 接受了 4030 小时的机器人和模拟数据以及 234000 小时的人体演示训练。单个检查点在 LIBERO 上达到 98.3%,在 RoboTwin Easy 和 Hard 上达到 88.7% 和 89.2%,在 LIBERO-Plus 上达到 82.0% 零样本,在 RoboCasa GR-1 上达到 62.0%,没有特定于基准的 微调。