论文
ART-VS:视觉自适应分辨率平铺 Transformer 视觉伺服
ART-VS: Adaptive Resolution Tiling for Vision Transformer Visual Servoing
摘要
具有自监督视觉 Transformer (ViT) 功能的视觉伺服使 无需训练 机器人定位具有很强的通用性,但面临着鲁棒性和精度之间的基本权衡。粗略的块级描述符提供稳定的对应关系,但限制了定位精度。提高图像分辨率可以提高精度,但只能带来边际鲁棒性增益 - 在扰动下,高分辨率处理将收敛成功率从 76.6% 提高到仅 81.0%,尽管 ViT 补丁数量增加了 12 倍。因此,我们提出了自适应分辨率平铺视觉伺服(ART-VS),这是一种使特征粒度适应伺服进度的两阶段方法:在本机 ViT 分辨率下进行粗略阶段以实现稳定对齐,然后是平铺高分辨率阶段,限制与局部邻域的匹配,从而提高定位精度。在没有任何特定任务训练的情况下,ART-VS 在扰动下实现了 95.4% 的收敛,比标准伺服和基于全分辨率 ViT 的伺服高出 18.8 和 14.4 个百分点。与前者相比,它减少了 53% 的定位误差,同时运行速度比后者高 10 倍,VRAM 低 27%。我们在三个 ViT 主干上验证 ART-VS,并演示对不可见对象实例的真实世界类别级抓取,在透明瓶子上实现 95/100,在鞋子上实现 98/100。代码可在 https://art-vs.github.io/ 下找到。