论文
V2-STRep:基于 VLM 的结构化任务表示,用于从生成的视频中获取可重复使用的机器人技能
V2-STRep: VLM-Grounded Structured Task Representations for Reusable Robot Skills Acquired from Generated Videos
摘要
人类操作视频提供了丰富的动作和交互线索,无需机器人演示即可获取机器人技能。视频生成模型根据初始场景图像和任务指令合成此类演示,从而无需记录每个任务的演示。然而,恢复的运动仅捕获一种特定于场景的实现,而隐含了任务结构、几何关系和约束。我们提出了 V2-STRep,这是一个零镜头框架,可通过基于 VLM 的结构化任务表示将生成的视频运动转换为可重复使用的机器人技能。该表示指定运动阶段、参考和任务相关约束,并通过最小几何结构描述目标:点、点法线、轴、平面和完整 6D 姿势。使用 RGB-D 观察将 VLM 提供的 2D 图像空间线索提升为 3D,以重建任务几何形状和候选抓取姿势。特定于几何形状的规则将运动转移到新场景,而任务约束的轨迹优化将抓取选择与完整的机器人运动规划结合起来。它保留任务要求,同时使用剩余的旋转自由度来适应关节限制。更新部署基础和约束可以在新的兼容指令下重复使用,而无需生成另一个视频。对六个现实世界操作任务的实验表明,与基线相比,执行成功率有所提高,成功获得的技能的可靠跨场景传输以及对更改的部署指令的适应。