论文
WM-VS:闭环视觉伺服的进步对齐世界模型
WM-VS: Progress-Aligned World Models for Closed-Loop Visual Servoing
摘要
闭环视觉伺服需要预测表明某个动作是否会减少任务错误,而不仅仅是该动作是否合理。我们将这种差距称为预测控制失配,并引入 WM-VS,这是一种以目标为中心、进度一致的世界模型框架,用于闭环视觉伺服。离线目标区域 DINOv2 对应定义了用于平移、缩放和面内旋转的带符号四维伺服坐标。第 1 阶段将动作条件潜在转换与此坐标对齐;第二阶段冻结世界模型,并通过动作模仿、结果监督和有利于误差收缩的短期想象轨迹来训练反应式联合速度策略。部署仅是 RGB 和反应式的,没有在线轨迹优化。在真正的 7-DoF 眼对手系统上,WM-VS 在 30/30 次试验中达到的角 RMSE 不大于其初始值的 10%,并在 25/30 次的最终有效帧中保留此标准(83.33%)。消除未来错误对齐将保留率降低至 26.67%。学习到的进度信号与未用于训练或控制的外部 AprilTag 角点误差一致(平均 Spearman rho = 0.8778)。在不进行重新训练的情况下,两个看不见的 3D 目标的平移误差分别减少了 86.48% 和 90.27%,旋转误差分别减少了 70.01% 和 65.70%。这些结果将与进度一致的行动结果与重复的闭环修正和转移联系起来。代码和数据将作为开源发布。