论文
VGM-VS:重新思考高精度视觉伺服的视觉几何模型
VGM-VS: Rethinking Visual Geometry Model for High-Precision Visual Servoing
摘要
我们提出了 VGM-VS,一种基于预训练的前馈视觉几何模型构建的视觉伺服方法。给定当前视图和在目标配置处捕获的参考图像,我们使用视觉几何模型估计相对相机位姿,并将其迭代应用为基于闭环位姿的视觉伺服(PBVS)方案的位姿增量。当目标被遮挡、纹理较弱或仅覆盖图像的一小部分时,从大规模预训练中获取的几何感知表示可以保持该估计的可靠性。然而,这些模型固有的尺度模糊性使得预测的平移定义为未知的尺度,而姿势增量必须是机器人控制的度量。我们通过特定于场景的度量适应来缩小这一差距:机器人从目标姿势开始沿着预定义的运动自动记录图像姿势对,并且我们根据这些数据微调摄像头,共同学习手眼变换,从而消除对专用校准过程的需要。我们在三个具有严格公差的实际组装任务中评估了我们的方法:USB-C 电缆拾取、电缆插入和 RAM 插入。 VGM-VS 以 30Hz 实时运行,在电缆任务上收敛到亚毫米级终端精度,在伺服过程中移动目标时达到 90--100\% 的成功率。它在所有试验中都在距参考姿势最大 30 厘米的初始位移以及 50% 的目标对象被遮挡的情况下收敛,优于所比较的视觉伺服基线。