论文
AnyWorld:用于跨实施例泛化的因式分解的自我中心世界模型
AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization
摘要
大规模收集接触丰富的机器人经验仍然是可推广操作的主要瓶颈。除了数据量之外,机器人学习还需要跨实施例、观点和场景的多样化经验。人类以自我为中心的视频提供了丰富的物理交互,但每个视频仅捕捉到单个身体、摄像机轨迹和环境下的一小部分体验。我们提出了 AnyWorld,一个跨实体的世界建模框架,它将单一的人类交互扩展为多种机器人本地部署,而无需配对的人类与机器人演示。我们的模型将交互分解为动作、相机和实体:动作控制捕获运动结构,相机控制指定视点演变,目标实体上下文定义动作主体及其交互几何形状。该公式能够独立重组实施例、视点和场景因素,从而允许单个模型生成许多机器人领域的体验,同时保留底层的动力学和对象交互。我们通过大规模人机交互预训练来训练模型,然后使用混合实施例 微调。实验表明,我们的模型支持跨实施例、视点和场景的可控重组,并且我们进一步证明生成的数据可以提高 RoboCasa GR1 桌面基准和真正的 IRON 人形机器人的操作性能。除了总体收益之外,我们还测试了是否可以将不配对的人类经验重组为针对政策差距的机器人本地视频动作对。受控的 IRON 干预措施先纠正虚假完成,并建立基于语言的空间目标选择;仅采取行动的反事实干预无法可靠地学习后者,这表明行动校准和视觉重组都是必要的。