论文

DSWAM:细粒度机器人操作的双系统世界动作基础模型

DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation

摘要

世界动作模型(WAM)通过使用基于视频的世界建模作为机器人动作学习的密集监督,为视觉-语言-动作(VLA)策略提供了一种有前景的替代方案。现有的 WAM 擅长物理基础执行,但通常缺乏基于 VLM 的 VLA 中用于分解粗略指令的显式语言级规划接口。当家庭任务涉及复杂的多步骤目标时,这种分解就变得很重要,其中粗略的用户命令需要转换为细粒度的可执行子任务序列。与此同时,该领域仍然缺乏 VLA 和 WAM 执行能力之间公平的真实机器人比较,因为现有系统通常在数据、机器人实施例和任务协议方面存在差异。为了解决分解差距和受控 WAM-VLA 比较的需要,我们引入了 DSWAM,一种用于细粒度机器人操作的双系统世界动作基础模型。 DSWAM 将系统 1 WAM 执行器保留为默认控制路径,并且仅在任务分解有用时才选择性地激活系统 2 视觉语言子任务规划器。规划器根据短期视觉历史记录和全局任务提示来预测可执行子任务,而 WAM 执行器则为每个指令或子任务执行世界感知动作生成。执行器接受动作预测和视频协同训练的训练,但推理直接预测动作块,而无需明确的未来视频生成。为了使这个执行路径在真实的机器人上实用,我们进一步集成了 TensorRT 加速、异步执行和实时分块 (RTC),以便策略查询不会阻止机器人控制。为了提供与 VLA 策略的公平的真实机器人比较,我们在 DeMaVLA 真实世界变形操纵设置下构建并评估 DSWAM,并使用匹配的机器人平台、预训练数据、后训练 数据和评估标准。