论文

GenVid2Robot:通过刚性几何一致性从视频生成到机器人操作

GenVid2Robot: From Video Generation to Robot Manipulation via Rigid-Geometric Consistency

摘要

生成的视频为机器人操作提供了有用的视觉运动先验,但它们的视觉合理性并不意味着物理可执行性。生成的视频通常缺乏度量几何、抓取定位、机器人运动学可行性和执行时反馈,这使得直接轨迹重放在现实世界的操作中不可靠。本文提出了 GenVid2Robot,这是一种刚性几何一致性框架,可将生成的视频运动转换为可执行的真实机器人操纵轨迹。给定初始 RGB-D 观察和任务指令,GenVid2Robot 从真实第一帧中采样与任务相关的语义锚点,通过生成的视频候选跟踪这些锚点,并验证所得到的 2D 运动是否可以在稀疏相对 $SE(3)$ 模型下由第一帧 RGB-D 锚点解释。通过这种方式,生成的视频被视为不确定的视觉运动假设,而不是直接的机器人演示。只有几何一致的运动才会传递给机器人。然后将接受的相对运动应用于由掩模约束抓取选择的真实抓取时间 TCP 姿势,产生与视觉运动先验和物理抓取配置一致的抓取条件执行轨迹。为了减少由 RGB-D 噪声、校准残差和小接触引起的位移引起的执行不匹配,有界深度补偿模块可以纠正局部深度方向误差,而无需假设完全在线重新规划。真实机器人实验表明,GenVid2Robot 通过将视觉运动先验与稀疏度量几何、抓取约束、机器人可行性检查和有界执行反馈结合起来,提高了生成视频引导操作的可靠性。