论文

StereoPolicy:通过立体感知改进机器人操作策略

StereoPolicy: Improving Robotic Manipulation Policies via Stereo Perception

摘要

机器人模仿学习的最新进展产生了强大的视觉运动策略,可以通过视觉输入操纵不同的物体。然而,单目观察缺乏深度信息,这对于在杂乱或几何复杂的场景中进行精确操作至关重要。在现实世界的操作中,显式深度图和点云通常是嘈杂且脆弱的。我们引入了 StereoPolicy,这是一种视觉运动策略学习框架,它直接利用同步立体图像对来改善空间感知,而无需构建显式 3D 表示。 StereoPolicy 使用预训练的 2D 视觉编码器处理每个图像,并通过基于交叉注意力的 Stereo Transformer 融合左右特征,学习任务条件双眼表示。该框架集成了基于扩散和预训练的视觉语言动作 (VLA) 策略,在三个模拟基准和七个真实机器人桌面和双手移动操作任务中,对 RGB、RGB-D、点云和多视图基线进行了一致的改进。我们的结果支持任务训练的双目融合是调整二维视觉表示以进行操作的有效方法。