论文
RynnWorld-Teleop:数字远程操作的动作条件世界模型
RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
摘要
扩展机器人学习需要大量、多样化的轨迹数据,但收集目前受到物理远程操作的瓶颈,每次演示都将操作员的时间绑定到特定的硬件和工作空间。我们引入了数字远程操作,这是一种通过用生成世界模型替换真实机器人来将数据收集与物理约束分离的范例。在此框架中,操作员的手势流驱动以机器人为中心的生成世界模型,以从单个参考图像合成高保真自我中心视频。记录的姿势流用作与实施例无关的动作标签,可通过标准重定向转移到任何目标机器人,从而产生独立于物理硬件的模仿学习的完整状态动作轨迹。我们在 RynnWorld-Teleop 中实例化了这一范例,该系统集成了深度感知骨骼调节、视频 Diffusion Transformer (DiT) 上的渐进式人机训练以及流式自回归 蒸馏。该管道将生成过程压缩为单通道推理,从而在单个 H100 GPU 上实现 40+ FPS 的实时交互生成。专门针对 RynnWorld-Teleop 生成的数据进行训练的策略可实现跨灵巧且多样化的双手任务的有效零样本 Sim2Real 迁移。此外,使用我们的数字远程操作数据增强现实世界数据集可以持续提高成功率,这表明 RynnWorld-Teleop 可以作为下一代机器人代理的高保真、可扩展的数据引擎。