论文

DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation

摘要

移动操作要求机器人预测运动与手臂动作如何共同改变未来观测与控制。现有的世界-动作模型主要面向固定基座平台开发,并未显式区分相机自我运动与基座和手臂动作。在本文中,我们提出 DECOWAM,一个通过专用条件接口分离这些因素的全身世界-动作模型。DECOWAM 冻结一个适配过的 FastWAM 主干,并训练残差适配器、一个从特权观测蒸馏而来的动作等效未来瓶颈、对抗性分离的基座与手臂潜在表示,以及用于视频预测的基座速度条件化。我们还进一步推出 ARMDOG,一个同步视频、全身状态与动作以及语言的真实机器人数据集。在固定的重放协议下,DECOWAM 在未来视频和动作预测上都优于 FastWAM,仅用 25.95M 可训练适配参数就将动作 MSE 降低 21.7%。在每种方法 79 次闭环试验中,它在所比较系统中取得了观察到的最高全身协调性与基座位移鲁棒性,同时任务完成度与最强基线相当。这些结果表明,具身感知的因式分解可以在移动视角下支持参数高效的联合视觉预测与全身控制。

DECOWAM:面向腿式移动操作的解耦全身世界-动作模型:论文配图
图1:DECOWAM的架构、训练与部署。(A)冻结的WAN主干配备可训练的残差适配器、师生未来瓶颈、分离的底座/臂潜变量以及底座速度自运动条件;ActionDiT产生未来RGB片段和一个48步、14维动作块。(B)部署时移除未来帧输入和特权的教师路径,得到严格因果的14维动作推理。(C)分阶段训练先将预训练的FastWAM对齐到ARMDOG,然后适配解耦后的模块以获得可部署的策略。