论文
RoboReact:来自生成的以自我为中心的视频的代理技能 蒸馏,用于普遍的全身操作
RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation
摘要
人形机器人有潜力在人类环境中进行灵巧的操作,但由于昂贵的硬件数据收集和劳动密集型注释,获取多样化和通用技能的成本仍然很高。视频生成模型的最新进展为从视觉观察中合成丰富的操作体验提供了一个有希望的机会,但将这种想象的行为转化为可执行的全身人形技能仍然很大程度上尚未探索。在这项工作中,我们提出了 RoboReact,这是一个框架,可以通过单个以自我为中心的 RGB-D 观察自动合成全身人形操纵技能。 RoboReact 生成人类操作视频,通过深度感知 3D 重建提取保留几何形状的交互关键帧,并将其重新定位到高自由度人形平台,同时保留手部对象交互几何形状。为了弥合想象计划和实际执行之间的差距,RoboReact 执行以对象为中心的在线重新定位,并利用视觉语言模型引导的细化循环来调整几何不匹配和执行偏差下的技能。精细化的技能通过全身控制器来执行,实现全身操控的协调和灵巧的交互。对真实人形机器人的实验表明,RoboReact 可以泛化不同的对象配置,并且可以从执行干扰中稳健地恢复,无需远程操作或人工演示。这些结果凸显了将生成模型、视觉语言推理和闭环控制相结合以实现可扩展的人形技能习得的潜力。