论文
XEWorld:动作条件世界模型可以推广到看不见的机器人实例吗?
XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments?
摘要
动作条件世界模型是用于机器人操作的有前途的学习模拟器,但仅在训练机器人上对其进行评估无法揭示它们是捕捉物理动态还是仅仅记住视觉模式。为了回答模型是否能够忠实地渲染它从未见过的机器人,我们引入了 XEWorld,这是一个用于世界模型的受控跨实施例测试台,它通过评估物理相同场景中的保留机器人来隔离实施例。我们的系统分析揭示了一个共同的架构瓶颈:当前模型主要充当 2D 视觉模式匹配器,其泛化由视觉相似性而不是物理运动学相似性控制。受此限制的驱动,他们努力将抽象的数字联合动作转化为连贯的视觉轨迹,并且无法根据静态初始观察预测动态视觉变化。因此,成功地渲染一个看不见的零样本实施例严格需要大量的线索,特别是像素空间动作和明确的时空对齐。即使当通过少样本适应绕过这个零样本障碍时,强制出现恢复也会引发对所见实施例的灾难性遗忘。总之,这些失败暴露了将学习的物理动力学应用于新颖的视觉外观的严重缺陷,强调了实现真正的跨实体泛化需要将视觉外观与底层物理动力学分离的架构创新。