论文

主持人:机器人在几秒钟内从单个人类视频中获得操纵技能

HOST:Robots Acquire Manipulation Skills in Seconds from a Single Human Video

模型训练监督微调与指令调优

摘要

快速、轻松地获得技能,同时保留已掌握的技能的能力对于机器人来说至关重要。然而,当前的方法仍然依赖于繁琐的训练时间循环,成本高昂且缓慢,同时侵蚀了已经掌握的技能。在本文中,我们介绍了 HOST(人机机器人一次性技能获取),该框架使机器人能够在几秒钟内从单个人类视频中获取技能,同时保留以前掌握的技能。 HOST 通过一系列自我预测来解决技能获取问题。它首先估计机器人在演示任务中的进度,然后将即将到来的进度转化为机器人自己未来的观察结果,最后从这些预测的观察结果中得出行动。该级联在与视频演示耦合的目标上进行训练,通过将机器人轨迹和视频演示映射到共享任务进度流形上来获得,然后重新定义每个目标以与视频的未来进度保持一致。因此,HOST 使机器人能够主动遵循演示的程序并使其适应机器人的实施例。 HOST 在平均 29 秒的时间内从单个人类视频中获得新颖的技能,并实现了 62% 的平均成功率。它超出了零射击基线 45%,同时保留了以前掌握的技能。 HOST 甚至超过了针对每个任务 50 次机器人演示进行微调的基线,同时所需的演示次数减少了 50 倍,并且获取每项技能的速度提高了 507 倍。有关 HOST 的更多信息可在项目网站上找到。