论文
在没有真实世界数据的情况下通过合成视频场景学习各种人形任务
Learning Diverse Humanoid Tasks via Synthetic Video Scenarios without Real World Data
摘要
人形机器人的类似人类的形态赋予它们敏捷和多功能运动能力的非凡潜力,但它也给获得复杂技能带来了巨大的挑战。传统的从演示中学习的方法通常受到收集现实世界数据的高成本、捕获特定运动行为的困难以及个体演示的多样性有限的限制。此外,即使对于同一任务,人类也可能以多种不同的方式执行动作。在本文中,我们提出了一个新框架,利用生成式人工智能的力量将文本提示转换为现实且多样化的人体运动序列,使机器人能够观察单个任务执行方式的多种变化。然后,这些综合演示被用作训练资源,使机器人能够学习各种任务执行方式,而无需直接人工干预。我们在四个模拟场景中评估所提出的方法。实验结果表明,该机器人不仅成功完成了任务,而且对复杂的运动变化表现出很强的适应性。