论文
HarmoWAM:通过自适应世界行动模型协调通用和精确的操作
HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models
摘要
世界动作模型(WAM)通过对物理动力学进行建模,已成为机器人控制的一种有前途的范例。当前的WAM通常遵循两种范例:“想象然后执行”方法,它使用视频预测通过逆动态来推断动作;以及“联合建模”方法,它联合建模动作和视频表示。基于系统实验,我们观察到这些范式之间的基本权衡:前者明确利用世界模型进行可推广的传输,但缺乏交互精度,而后者能够生成细粒度、时间连贯的动作,但受到训练分布的探索空间的限制。受这些发现的启发,我们提出了 HarmoWAM,这是一种端到端的 WAM,它充分利用世界模型来统一预测和反应控制,从而实现通用传输和精确操纵。具体来说,世界模型提供了时空物理先验,为两个互补的动作专家提供了条件:一个利用潜在动态生成迭代动作的预测专家,以及一个直接从预测的视觉进化推断动作的反应专家。为了实现自适应协调,提出了一种过程自适应门控机制来自动确定它们之间切换的时间和位置。这使得世界模型能够驱动反应型专家扩展探索空间,并驱动预测型专家在任务的不同阶段执行精确的交互。为了进行评估,我们在六个现实世界的机器人任务中构建了三个训练未见的测试环境,涵盖了背景、位置和对象语义的变化。值得注意的是,HarmoWAM 在这些场景中实现了强大的零样本泛化,明显优于之前最先进的 VLA 模型和 WAM,分别高出 33% 和 29%。