论文

RoboMP-DINOv2:用于稳健机器人操作的提示,而不是过滤器

RoboMP-DINOv2: Prompts, Not Filters for Robust Robot Manipulation

摘要

机器人操纵策略必须概括整个视觉变化,同时保留与动作相关的场景上下文。通用视觉编码器不适用于视觉运动控制,而以对象为中心的方法通常使用分割掩模作为硬过滤器,从而丢弃潜在有用的上下文。我们提出了 RoboMP-DINOv2(机器人掩模提示 DINOv2),这是一种全场景视觉编码器,它将掩模视为空间提示而不是可见性过滤器。它从完整的观察中提取密集的 DINOv2 特征,在屏蔽位置注入学习到的特定区域嵌入,并联合上下文关联有提示和无提示的标记以进行动作预测。我们进一步引入掩模区域颜色随机化(MCR)来提高外观鲁棒性,产生 RoboMP-DINOv2-MCR。在七种模拟操作设置中,RoboMP-DINOv2 在空间变化下取得了 60.7% 的成功率,在场景混乱下取得了 59.7% 的成功率,而基于 DINOv2 的扩散策略的成功率分别为 50.7% 和 41.0%。在看不见的物体颜色下,RoboMP-DINOv2-MCR 取得了 72.5% 的成功率,而最强颜色随机基线的成功率为 35.1%。额外的实验和表示分析表明,鲁棒性得到了提高,同时保留了行为相关的场景信息。代码可从此 https URL 获取。