论文
iMaC:将动作转化为具体世界模型的运动和接触图像
iMaC: Translating Actions into Motion and Contact Images for Embodied World Models
摘要
具身世界模型已成为视觉机器人决策和交互式环境模拟的关键范例。然而,传统的体现框架依赖于低维结构化动作向量(例如,关节角度和末端执行器姿势),其表达能力有限,不同实施例之间的泛化能力差,以及复杂物理交互的不自然动态建模。为了解决这些限制,本文提出了siMac(图像作为动作控制),这是一种新颖的统一控制范例,它将原始视觉图像视为具体世界模型的本机动作表示。与传统的显式运动动作编码不同,iMac 将连续视觉操作制定为基于图像的动作标记,其本质上封装了空间运动意图、交互式几何约束和微妙的物理动力学。我们构建了一个由图像动作编码器和动态世界预测器组成的双分支体现架构:编码器将目标驱动的视觉图像压缩为紧凑的动作嵌入,而预测器学习以图像动作为条件的环境转换规则,以实现高保真未来状态预测和闭环体现控制。在公共具体操作基准和现实世界的机器人场景上进行了大量的实验。结果表明,iMac 在预测准确性、任务成功率和跨场景泛化能力方面优于基于矢量的动作控制基线。此外,我们的图像动作设计消除了对手动定义动作空间的依赖,实现了对异构实体的灵活和通用控制。这项工作为具体世界模型提供了创新的视觉动作视角,为可扩展的机器人感知和操作提供了简单而有效的范例。