论文
OASIS:通过 SE(3) 机器人操作轨迹预测进行观察-动作空间对齐
OASIS: Observation-Action Space Alignment via SE(3) Trajectory Prediction for Robotic Manipulation
摘要
最近的视觉语言动作(VLA)模型和世界动作模型(WAM)通过利用辅助空间特征或未来视觉状态预测丰富中间表示来推进机器人操作。然而,这些表示很大程度上保留在观察空间内,并且不共享动作空间的刚体几何形状,迫使动作解码器隐式恢复该几何形状。我们提出 OASIS,一种视觉运动策略,通过 $SE(3)$ 末端执行器轨迹预测将中间表示与动作空间对齐。 OASIS 将融合视觉语言和度量深度特征的 3D 感知特征编码器与生成相机帧末端执行器轨迹的 $SE(3)$ 轨迹预测器结合起来。根据预测器的姿势监督隐藏状态,动作解码器生成与刚体运动一致的动作块。在模拟和现实实验中,OASIS 在成功率和分布外泛化方面优于 VLA 和 WAM 基线。我们的项目页面位于 https://npuhandsome.github.io/OASIS_web。