论文
Video2Sim2Real:从单个人类视频中获取全栈自主灵巧技能
Video2Sim2Real: Full-Stack Autonomous Dexterous Skill Acquisition from a Single Human Video
摘要
人类操作视频是机器人学习的便捷直观的来源。然而,由于感知误差和体现差距,将人类的灵活性直接转移到机器人仍然具有挑战性。为了解决这个问题,我们引入了 Video2Sim2Real,这是一个全栈框架,用于从单个人类操作视频中自主获取技能。我们的框架首先使用现成的基础模型来重建模拟器就绪的数字孪生并提取机器人和物体运动先验。我们的关键思想不是将提取的机器人运动作为整个执行过程中的可靠参考,而是从所展示的技能中恢复和利用最基本的监督来源:我们识别以对象为中心的关键帧,以使用来自模拟器的对象信息来优化相应的机器人配置,并使用这些配置作为锚点来细化机器人运动,使其最终对环境产生预期的影响。为了弥合剩余的模拟与真实的差距,我们引入了一种模拟与真实的策略,该策略将鲁棒性与手部物体交互动态变化中的噪声和不完整感知解耦。具体来说,我们学习通过 IL 从嘈杂的现实世界点云中重新校准机器人配置,并利用残差 RL 执行局部手指级适应,以确保稳健且有效的交互。最后,碰撞感知运动规划模块能够对新颖的对象配置进行空间泛化。在多个日常操作任务中,Video2Sim2Real 提高了模拟任务的成功率、安全性和众多基线上的轨迹一致性,并实现了比现有技术更好的模拟到真实的转换。这些结果表明了从人类视频中获取自主灵巧技能的一条有前途的道路。