论文

LaWAM:高效动态感知机器人策略的潜在世界行动模型

LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies

模型架构新型架构

摘要

视觉语言动作模型(VLA)利用大规模视觉语言预训练进行语义机器人控制,但通常缺乏对机器人动作如何改变场景的明确预见。世界动作模型(WAM)通过根据预测的未来调整策略来解决这一限制,但现有方法通常依赖于计算成本高昂且具有大量像素级冗余的视频生成。我们提出了 LaWAM,一种潜在世界行动模型,它通过紧凑的潜在视觉子目标而不是重建的未来视频,向机器人策略公开预测动态。 LaWAM 的核心是潜在动作条件的潜在世界模型(LaWM)。我们通过在预训练视觉基础模型的潜在空间中训练潜在动作模型并重新利用其前向解码器来预测场景演化的未来观察特征来获得 LaWM。然后,LaWAM 根据这些预测的潜在视觉子目标来调节动作生成,以实现动态感知的机器人控制。 LaWAM 在 LIBERO (98.6% SR)、RoboTwin (91.22% SR) 和现实世界操作任务中实现了最先进或有竞争力的成功率 (SR),同时保留低延迟推理。 LaWAM 每个动作块预测的运行时间为 187 毫秒,并且挂钟延迟比像素空间 WAM 低 24 倍。