论文
KnowDemo:从人类视频生成知识引导的机器人演示
KnowDemo: Knowledge-Guided Robot Demonstration Generation from Human Videos
摘要
学习机器人操纵策略通常需要大量的演示数据,而在真实的机器人上收集这些数据的成本很高。最近的方法通过适应恢复的运动并验证模拟中产生的轨迹,从人类视频中生成机器人演示。然而,以运动参考适应为中心的方法可以通过保留演示的接触策略和子任务顺序来限制行为多样性,而对任务要求和场景关系的理解不足可以通过生成无效的候选者来降低演示生成效率。为了解决这些限制,我们提出了 KnowDemo,这是一个框架,它使用人类视频中的结构化操作知识为目标工作空间生成不同的机器人演示。为了区分任务要求和特定于演示的选择,我们开发了一个基于视觉语言模型(VLM)的知识提取和推理模块,该模块将对象和动作描述与推断的任务条件、演示参考和允许的执行变化相关联。为了将这些知识转化为可执行的演示,我们解析了针对目标场景实体和几何形状的描述,以在运动规划和模拟之前指导候选生成和筛选。由此产生的演示通过替代接触策略和有效的子任务顺序以及结构化执行标签展示了多模式行为。实验证明了除了仅供参考的配置之外的其他经过验证的执行模式,并通过任务引导的抓取采样提高了候选计划的成功率。为了验证生成的政策学习数据,我们在模拟数据上微调预训练的 $\pi_{0.5}$ 模型,实现跨三个任务的模拟到真实的迁移。项目页面:此 https URL