论文
RayViT:用于视点鲁棒模仿学习的光线条件视觉表示
RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation Learning
摘要
视觉模仿学习使机器人能够直接从图像中获得视觉运动技能,但 RGB 观察缺乏明确的几何线索,使得学习的策略容易受到相机扰动的影响。为了解决这个问题,我们提出了 \textbf{光线调节视觉 Transformer 编码器(RayViT)},这是一种轻量级架构,可将相机几何结构注入预先训练的 ViT 主干中。 RayViT 将相机几何形状表示为 Plücker 光线图,将其修补为光线特征,并使用门控交叉注意力来生成光线条件类标记。这些光线特征被添加为密集位置嵌入,而光线类标记取代了原始的 ViT 类标记以提供几何感知的摘要表示。我们将此方法与辅助余弦相似性损失相结合,以持续提高几何感知标记的性能和鲁棒性。模拟和真实机器人任务的实验表明,与基线相比,RayViT 在多任务 RoboCasa 基准中相机扰动下的鲁棒性提高了约 13 个百分点,而现实世界多任务成功率的平均完成阶段提高了 1.78 个百分点。